Todos os artigos
IA em tempo real

Agentes de chamadas telefônicas AI comparados: latência, detecção de turno e interrupções

Por que todos os benchmarks publicados discordam, quanto custa realmente a detecção de curvas e como medi-la você mesmo Aqui estão dois fatos sobre agentes telefônicos de IA em 2026, ambos bem fornecidos, verdadeiros e aparentemente incompatíveis. Fato um: Vapi tem como alvo p50 abaixo de… Leia mais »

Por Om KamathTempo de leitura: 17 minutos
Duas formas de onda de áudio frente a frente em um campo escuro com uma lacuna brilhante entre elas

Por que todos os benchmarks publicados discordam, quanto custa realmente a detecção de curvas e como medi-la você mesmo

Aqui estão dois fatos sobre os agentes telefônicos de IA em 2026, ambos bem fundamentados, verdadeiros e aparentemente incompatíveis.

Fato um: Vapi tem como alvo p50 abaixo de 500 ms. Retell publica aproximadamente 600 ms. A página inicial do Bland diz 400 ms. O teste ConversationRelay interno do Twilio relata uma mediana de 491 ms.

Fato dois: um benchmark independente que ligou para essas plataformas através de linhas telefônicas reais e mediu a partir do áudio gravado encontrou medianas entre 1.296 ms e 1.740 ms – cada plataforma duas a quatro vezes mais lenta do que seu próprio número publicado.

Ninguém está mentindo. Eles estão medindo coisas diferentes, em transportes diferentes, com suposições diferentes sobre onde o relógio começa. E até que você entenda exatamente o que cada número descreve, você não poderá usar nenhum deles para escolher uma plataforma.

Este artigo leva a sério o problema de medição, coloca os benchmarks publicados lado a lado com suas metodologias anexadas, explica por que a detecção de curvas - e não o modelo de linguagem - é agora a variável dominante e termina com um protocolo para produzir números em que você pode realmente confiar.

Para onde vai o tempo

Uma chamada de voz em um telefonema é uma corrida de revezamento com cinco etapas, e o bastão é colocado entre cada par de corredores.

Barra abstrata da linha do tempo empilhada mostrando cinco segmentos de latência desiguais cruzando uma linha de limite

Uma virada de voz é uma corrida de revezamento em cinco etapas. Um deles é sempre muito mais largo que os outros. Imagem gerada com GPT Image 2.

Palco Pilha co-localizada Pilha costurada típica
Rede/SIP 45ms 150ms
Fala para texto 100ms 225ms
Inferência LLM 225ms 650ms
Conversão de texto para fala 80ms 185ms
Total 450ms 1.210ms

Duas observações. O LLM domina ambas as colunas – e é por isso que encaminhar conversas comuns para um modelo pequeno e rápido e escalar apenas quando o raciocínio é genuinamente necessário é a mudança de maior alavancagem disponível para a maioria das equipes. E o intervalo de 760 ms entre as colunas não faz diferença na qualidade do modelo. É a geografia, a contagem de saltos e quantas redes de fornecedores separados o áudio atravessa.

O que esta tabela deixa de fora é a etapa que geralmente custa mais: decidir se o interlocutor terminou de falar. Isso acontece antes do início da retransmissão, e um limite de endpoint mal configurado pode adicionar mais atraso do que todo o pipeline abaixo dele.

Os benchmarks, com suas metodologias anexadas

Quatro estudos independentes publicaram números para essas plataformas em 2026. Eles discordam, às vezes invertendo totalmente as classificações. Aqui estão eles com a metodologia que os produziu, porque a metodologia é o resultado.

Estudo 1: Chamadas telefônicas reais, medidas a partir de áudio gravado

O benchmark público metodologicamente mais transparente ligou para o agente de cada plataforma por meio de uma chamada telefônica real com um robô chamador lendo um script fixo, gravou ambos os lados da chamada em um único relógio e localizou os limites da fala na gravação usando Silero VAD com refinamento de energia. Nenhum carimbo de data/hora relatado pela plataforma foi usado. 2.078 turnos utilizáveis ​​em cinco plataformas; endpoint padronizado em 0,1 s quando configurável. A métrica é o tempo até o primeiro byte de áudio.

Plataforma p50 pág.95 Proporção de cauda Turnos utilizáveis
Telnyx 1.296ms 1.856ms 1.43× 419/432
ElevenLabs 1.424ms 1.768ms 1.24× 429/432
Bland AI 1.520ms 2.248ms 1.48× 429/432
Vapi 1.558ms 2.008ms 1.29× 382/432
Retell AI 1.740ms 2.259ms 1.30× 419/430

Observe a última coluna. Vapi descartou 50 turnos – mais de dez por cento – contra um punhado dos outros. Uma plataforma que ocasionalmente não consegue produzir uma curva utilizável está lhe dizendo algo que nenhum percentil de latência captura.

Estudo 2: Chamadas de produção, voz a voz

Um estudo de março de 2026 realizou 500 chamadas de produção por plataforma, medindo voz a voz.

Plataforma Mediana pág.95
Retell 680ms 920ms
Vapi 720ms 1.050ms
Bland 850ms 1.180ms

Retell termina em último no Estudo 1 e em primeiro no Estudo 2. Mesma plataforma, mesmo ano, conclusão oposta. Isso é o mais importante neste artigo: no estado da arte atual, o método de medição movimenta mais o resultado do que a plataforma.

Estudo 3: pilha de terceiros corrigida

Uma abordagem diferente — mantenha os modelos constantes (GPT-4.1, Deepgram Nova-3, ElevenLabs Flash) e meça a volta completa, isolando a camada de orquestração:

Plataforma Volta completa, p50
ElevenLabs 1,73s
Retell 1,96s
Vapi 2,34s

Cada número aqui está muito acima do que qualquer fornecedor anuncia, porque uma volta completa em uma pilha fixa de terceiros inclui as peças que os fornecedores excluem quando citam seu próprio caminho otimizado.

Estudo 4: Somente a perna transportadora

Finalmente, um teste de junho de 2026 com 120 chamadas de saída por operadora isolou o tempo de ida e volta no trecho de telefonia:

Transportadora p50 RTT p95 RTT
Telnyx 71ms 118ms
Twilio 89ms 161ms
Vonage 94ms 152ms

Contexto útil: a portadora contribui com menos de 100 ms. Se o seu agente parecer lento, a rede telefônica quase nunca é o motivo.

Quatro instrumentos de medição diferentes agrupando diferentes vãos da mesma barra brilhante

Um objeto, quatro instrumentos, quatro leituras. Todos os números de latência neste artigo são precisos; eles simplesmente não estão medindo o mesmo intervalo. Imagem gerada com GPT Image 2.

Como ler todos os quatro juntos

Tipo de número O que inclui O que isso esconde Confie nisso para
Reivindicação do fornecedor p50 Caminho otimizado, muitas vezes WebSocket não é telefonia Espera final, perna transportadora, cauda Qualidade de arquitetura aproximada
Latência do componente (por exemplo, 75 ms TTS) Tempo de síntese de um modelo Todo o resto Escolhendo esse componente
TTFAB de áudio gravado Tudo o que o chamador ouve Nada - mas inclui sobrecarga de gravação Classificando a experiência real
Turno completo de pilha fixa Sobrecarga de orquestração, isolada Os próprios modelos ajustados de cada plataforma Comparando camadas de orquestração
Transportadora RTT Somente transporte de telefonia O agente inteiramente Escolhendo uma operadora

E os limites que importam perceptualmente: a transferência de conversação humana fica perto de 200 ms; depois de aproximadamente 800 ms, um chamador registra o atraso; após cerca de 1.500 ms, ele parece quebrado. Observe que a maioria dos números do p95 no Estudo 1 ficam do lado errado desse segundo limite. A mediana é a sensação da sua demonstração. O p95 é o que seus interlocutores sentem.

A detecção de curvas é o verdadeiro diferencial

Cada plataforma acima pode chamar modelos da classe GPT e transmitir vozes da classe ElevenLabs. Essas são mercadorias. O que separa um agente natural de um exaustivo é a parte que decide quando falar, e é aqui que residem agora as verdadeiras diferenças de engenharia.

O imposto final

A abordagem ingênua espera pelo silêncio. Defina o limite em 800 ms e você terá adicionado quase um segundo inteiro a cada resposta antes do início de qualquer processamento. Mais de uma chamada de dez minutos que é um verdadeiro ar morto, paga por um valor de configuração. Reduza o limite e o agente começará a interromper qualquer pessoa que faça uma pausa para pensar – ou seja, todo mundo, no meio de um número de conta.

A pilha que corrige isso

A detecção de curvas é a parte menos glamorosa e mais importante de um agente de voz. O próprio passo a passo do LiveKit sobre seu modelo semântico de final de expressão é a explicação mais clara de por que um tempo limite de silêncio não é suficiente.
Camada O que isso faz Implementações representativas
DVA Classifica cada quadro de áudio como fala ou não Silero VAD - inadimplência quase universal
Ponto final Observa o fluxo de transcrição em busca de sinais de conclusão Configuração de endpoint do provedor STT
Detecção semântica de virada Prevê a conclusão da mudança a partir do significado, pode cometer antes do silêncio Detector de giro LiveKit (ajuste fino Qwen2.5-0.5B, inferência de CPU, 14 idiomas); Pipecat Volta Inteligente
STT conversacional Reconhecimento e troca de turnos em um só modelo Deepgram Flux; Tavus Sparrow-1

O Flux do Deepgram, geralmente disponível em formato multilíngue desde 29 de abril de 2026 em dez idiomas com troca de idioma durante a conversa, relata detecção média de fim de turno em 260 ms com p95 em 1,5 s, expõe um configurável eot_threshold para negociar latência com precisão e relata redução da latência de resposta do agente em 200–600 ms em comparação com STT-mais-VAD convencional. Tavus relata seu modelo de fluxo Sparrow-1 com latência média de previsão de piso de 55 ms.

Colocando de forma concreta: mudar de um tempo limite de silêncio de 800 ms para um detector de mudança de direção semântico pode economizar mais latência do que qualquer outra otimização nesta página combinada. Se você está comprando com base na latência, pergunte qual detecção de curva a plataforma usa e se você pode alterá-la – essa resposta prevê sua experiência melhor do que qualquer p50 publicado.

Tratamento de interrupções: uma política, não uma alternância

Barge-in geralmente é exposto como um booleano. Essa é a forma errada para o problema e é o motivo mais comum pelo qual um agente com boa pontuação em latência ainda sente que é errado conversar.

A razão é que o áudio do chamador recebido não é uma coisa. Uma taxonomia útil divide-a em seis formas, cada uma exigindo um comportamento diferente:

Classe de entrada Exemplo Comportamento correto Sinal de falha
Correção verdadeira "Não, sexta-feira" Pare, aceite a vez, preserve o contexto da tarefa O chamador repete a mesma correção
Canal traseiro "sim", "mm-hm" Continue falando; não trate como intenção O agente cancela a resposta e reinicia
Ruído de fundo Teclado, trânsito, segunda voz Continuar; registrar uma interrupção falsa A reprodução é interrompida sem transcrição da chamada
DTMF O chamador pressiona 2 durante um menu Rota por dígito, não por transcrição Dígito ignorado ou tratado como fala
Pausa longa na entidade Pausar número intermediário da conta Espere; não responda cedo O agente interrompe antes que a entidade conclua
Escalada "Eu quero uma pessoa" Pare e transfira imediatamente Agente argumenta

A falha que mata a confiança mais rapidamente é a falsa parada: o chamador diz “ok” enquanto o agente está no meio da frase, o agente para e então trata “ok” como uma nova pergunta. Em uma chamada, é uma falha. Em milhares de chamadas, há uma queda mensurável na taxa de conclusão e não aparece em nenhuma métrica de latência.

A estrutura correta é a política por tipo de mensagem. Saudações interrompíveis após período de carência; menus que aceitam DTMF e fala; paciente de captura de entidade; divulgações legais, de consentimento e de pagamento ininterrupto; preenchimentos de espera de ferramenta canceláveis ​​instantaneamente; intenção de transferência humana sempre honrada.

E instrumentalize-o. Os quatro eventos que vale a pena registrar em cada turno são o candidato à interrupção, a decisão e a versão da política que a produziu, a posição de recuperação e os falsos positivos confirmados. Rastreie a taxa de interrupções falsas e a taxa de interrupções perdidas como painéis separados – elas se movem em direções opostas e a média delas oculta ambas. Há um pacote de cenários aberto para testes de invasão em GitHub que funciona em Vapi, Retell, Bland, Pipecat e LiveKit auto-hospedado.

As plataformas

Vapi

Vapi é a camada de orquestração mais flexível: traga seu próprio STT, LLM, TTS e telefonia, troque qualquer um deles e ajuste o pipeline. Custa aproximadamente US$ 0,05/min para orquestração, com cada provedor subjacente cobrado separadamente. O teste independente coloca uma pilha ajustada na mediana de 500–700 ms e o pipeline padrão é significativamente mais lento. Escolha-o quando quiser controlar todos os componentes e estiver preparado para dominar o ajuste; a flexibilidade é real, assim como a carga de configuração.

Retell AI

Retell é uma pilha gerenciada com ênfase em fluxos de diálogo estruturados e conformidade empresarial. Aproximadamente US$ 0,055/min para infraestrutura de voz, com pagamento conforme o uso a partir de cerca de US$ 0,07/min. Relatado cerca de 600 ms fora da caixa em um estudo e último lugar em outro – veja a seção acima. Escolha-o quando desejar um pipeline gerenciado compatível com forte controle de fluxo em vez de um kit de componentes.

Bland AI

Bland usa preços agrupados – fala para texto, LLM, texto para fala e telefonia a uma taxa de US$ 0,09–0,14/min – e desenvolvido especificamente para saída de alto volume. Medido em torno de 700–900 ms dependendo da complexidade do caminho. O pacote é genuinamente mais fácil de raciocinar comercialmente; a compensação é menos controle sobre cada camada.

ElevenLabs Agents

Construído a partir da síntese de voz mais conceituada da categoria, cujo modelo Flash sintetiza em aproximadamente 75 ms. Os agentes cobram cerca de US$ 0,08/min em planos de negócios anuais e cerca de US$ 0,10/min em Creator e Pro, com tokens LLM repassados ​​separadamente e pacotes de minutos em cada nível. Entroncamento SIP conecta a telefonia existente — Twilio, Telnyx, PBX auto-hospedado — com autenticação digest ou ACL e uma ferramenta de transferência para número que suporta estilos de conferência, blind e SIP REFER. Notavelmente, ele registrou a proporção final mais estreita no benchmark de áudio gravado, o que é mais importante do que uma boa mediana.

Telnyx

A propriedade distintiva é a integração vertical: Telnyx possui a rede da operadora pela qual o áudio viaja, e seu orçamento de arquitetura de 450 ms vem da co-localização da pilha, e não de modelos mais rápidos. Postou a mediana mais baixa no estudo de áudio gravado e o RTT da operadora mais baixo no estudo de transporte. Escolha-o quando a área de telefonia for uma preocupação de primeira classe.

OpenAI Realtime

Não uma plataforma, mas um modelo, e cada vez mais aquilo sobre o qual as plataformas são construídas. O API em tempo real suporta três transportes — WebRTC para navegadores, WebSocket para servidores e SIP para rotear uma chamada telefônica real diretamente para uma sessão. É fala para fala nativa: entrada e saída de áudio, sem gargalos de texto intermediários e prosódia preservada durante todo o turno. O preço é baseado em token e não por minuto, o que produz uma ampla faixa efetiva dependendo de quão disciplinado você é com contexto e cache. Escolha-o quando desejar a menor latência de giro possível e puder construir a orquestração circundante; evite-o quando precisar registrar, auditar ou restringir o raciocínio intermediário, porque não há nenhum texto para inspecionar.

Synthflow, Twilio ConversationRelay e o resto

Synthflow custa cerca de US$ 0,09/min para seu mecanismo de voz com um construtor sem código voltado para operadores e não para engenheiros. Twilio ConversationRelay anexa um agente de IA ao conjunto de telefonia existente do Twilio, com 491 ms p50 e 713 ms p95 relatados internamente – atraente se sua infraestrutura de chamada já estiver lá.

Construindo você mesmo: Agentes Pipecat e LiveKit

Ambos são de código aberto e genuinamente viáveis para produção.

Pipecat, originado pelo Daily, modela um agente de voz como um pipeline de processadores através dos quais o áudio e o texto fluem, com uma biblioteca de plugins muito grande e desenvolvimento quase diário. Pipecat Cloud atingiu disponibilidade geral em 2026 após uma versão beta com mais de mil equipes, então o caminho gerenciado existe se você quiser.

Agentes LiveKit é construído no servidor de mídia WebRTC do LiveKit, e seu diferencial é o modelo de sala: o agente ingressa como participante ao lado dos usuários, o que torna os cenários com vários participantes nativos, em vez de integrados. Uma equipe relatou publicamente a reconstrução de um agente telefônico de Pipecat para agentes LiveKit quando um cliente escalou de 20 para 400 chamadas simultâneas.

A auto-hospedagem pode custar bem menos de US$ 0,05/min em volume. Você está negociando taxas de plataforma para trabalho de infraestrutura, plantão e ajuste de latência – o que é uma boa negociação em escala e ruim antes de você encontrar a adequação do produto ao mercado.

Quanto realmente custa

O erro orçamentário mais comum nesta categoria é comparar uma taxa exclusiva da plataforma com uma taxa agrupada.

Plataforma Taxa de título O que isso cobre All-in realista
Vapi US$ 0,05/min Somente orquestração ~$0,25–0,33/min quando STT, LLM, TTS e telefonia forem adicionados
Retell US$ 0,055/min Infraestrutura de voz A partir de ~$0,07/min, pagamento conforme o uso
Bland US$ 0,09–0,14/min Tudo, empacotado Aproximadamente a taxa de manchete
Synthflow US$ 0,09/min Motor de voz Mais LLM e telefonia
ElevenLabs Agents US$ 0,08–0,10/min Plataforma + voz Mais tokens LLM transmitidos
OpenAI Realtime Baseado em token O modelo apenas Altamente variável; cache e disciplina de contexto dominam
Auto-hospedado (Pipecat/LiveKit) Infraestrutura Nada empacotado Pode custar menos de US$ 0,05/min em volume, mais tempo de engenharia

Pontos de referência de componentes para construir sua própria estimativa: telefonia em torno de US$ 0,014/min, streaming de fala para texto em torno de US$ 0,008/min, TTS premium em torno de US$ 0,05/min e um pequeno LLM rápido em torno de US$ 0,01/min. Em todo o mercado, as taxas totalmente carregadas em 2026 abrangem aproximadamente uma faixa seis vezes maior, de cerca de US$ 0,05/min nos planos de autoatendimento mais agressivos a cerca de US$ 0,31/min em níveis empresariais premium.

Uma observação estrutural: o cache de prompt não é um erro de arredondamento em um agente de voz. O prompt do sistema – persona, proteções, regras de negócios, conhecimento – é idêntico em todas as chamadas. A entrada armazenada em cache em modelos em tempo real custa uma pequena fração da entrada padrão. Ativar o cache frequentemente altera o custo do modelo em uma ordem de magnitude e é a primeira coisa a verificar antes que alguém proponha fazer o downgrade para um modelo pior para economizar dinheiro.

Conformidade não é opcional aqui

Os agentes telefônicos carregam uma exposição regulatória que os agentes navegadores não têm.

Nos Estados Unidos, a FCC Decisão declaratória de fevereiro de 2024 confirmou que as vozes geradas por IA são uma “voz artificial ou pré-gravada” no TCPA. Isso traz requisitos de consentimento para chamadas para linhas residenciais e sem fio, obrigações de identificação e divulgação e tratamento de opt-out – com danos legais de US$ 500 por violação, subindo para US$ 1.500 para violações intencionais. Espera-se que uma nova regulamentação da FCC sobre chamadas geradas por IA seja concluída por volta do final de 2026 ou início de 2027, e o resultado amplamente esperado é um requisito explícito de identificação de IA no início da chamada, além de uma linguagem de consentimento que nomeia especificamente a IA.

Na UE, o artigo 50.º da Lei da IA ​​é aplicável desde 2 de agosto de 2026 e exige que as pessoas sejam informadas de que estão a interagir com a IA. A nível estadual nos EUA, a Lei Colorado AI entra em vigor em 2026 e pode classificar grande parte desta categoria como de alto risco.

A postura prática é simples e não custa nada: divulgar na linha de abertura, manter o registro de consentimento, honrar imediatamente os opt-outs e tornar a transferência humana sempre disponível. Cada um deles é mais barato para construir agora do que para modernizar.

Compare você mesmo

Dado que dois estudos confiáveis inverteram as mesmas classificações, os únicos números sobre os quais você deve agir são os seus. Este protocolo leva um dia.

  1. Crie um script fixo. Vinte a trinta voltas cobrindo seu caso de uso real, incluindo pelo menos um número longo, uma correção e uma solicitação humana.
  2. Grave ambas as pernas em um relógio. Não use horários informados pela plataforma; eles excluem partes do caminho que seu chamador percorre. Capture o áudio real da chamada.
  3. Meça o tempo até o primeiro byte de áudio desde o final da fala do chamador, usando um VAD na gravação em vez do fluxo de eventos de qualquer fornecedor.
  4. Padronize o endpoint em todas as plataformas testadas ou você está comparando a configuração em vez da arquitetura.
  5. Relate p50 e p95 separadamente, mais a proporção da cauda e a contagem de turnos que você teve que descartar. Uma plataforma que ocasionalmente não produz nada é pior do que uma plataforma que é uniformemente um pouco mais lenta.
  6. Execute as seis classes de interrupção da tabela acima como casos de teste separados e pontuar paradas falsas e paradas perdidas de forma independente.
  7. Teste sob carga. Cada plataforma fica bem em uma única chamada. A simultaneidade é onde as medianas se degradam e as caudas explodem.
  8. Teste em uma conexão ruim e de um aparelho celular em um carro em movimento, não de uma mesa com fibra.

O resultado final

As plataformas nesta categoria estão mais próximas umas das outras do que o seu marketing sugere, e a diferença entre quaisquer duas delas é menor do que a diferença entre uma implementação bem ajustada e uma implementação mal ajustada de qualquer uma delas.

Três coisas são mais importantes do que o fornecedor que você escolhe. Vire a detecção, porque é a maior fatia recuperável de latência e a diferença entre um agente que se sente presente e outro que parece uma árvore telefônica. Política de interrupção, porque determina se o chamador confia na coisa após o primeiro mal-entendido. E latência de cauda, ​​porque o p95 é o que seus clientes realmente experimentam e é mais ou menos onde eles desligam.

Cada fornecedor mostrará uma mediana. Peça o p95, pergunte como foi medido e depois meça você mesmo.

Seu primeiro assistente está a poucos minutos de distância

Coloque seu conhecimento de negócios para trabalhar.

Comece com uma conta Cody gratuita. Adicione seu conteúdo, crie um assistente e compartilhe a primeira resposta útil hoje.