Todos os artigos
IA em tempo real

Modelos de avatar de IA em tempo real comparados: latência, arquitetura e custo

Arquitetura, definições de latência, transporte, preços e uma maneira repetível de avaliá-los você mesmo. Cada fornecedor de avatar em tempo real publica um número de latência. Anam diz conversa em menos de 1 segundo com geração no lado do servidor de aproximadamente 150 ms. Tavus diz sub-600… Leia mais »

Por Om KamathTempo de leitura: 20 minutos
Um retrato humano digital meio fotorrealista e meio dissolvido em uma nuvem de pontos luminosos

Arquitetura, definições de latência, transporte, preços e uma maneira repetível de avaliá-los você mesmo

Cada fornecedor de avatar em tempo real publica um número de latência. Anam diz conversa em menos de 1 segundo com geração no lado do servidor de aproximadamente 150 ms. Tavus indica sub-600 ms. Beyond Presence indica menos de 100 ms. Simli indica menos de 300 ms. LemonSlice diz 471 ms. Ojin indica menos de 200 ms.

Nenhum desses números é mentira. Quase nenhum deles mede a mesma coisa.

Esse é o problema central da escolha de um provedor de avatar em tempo real em 2026, e é por isso que as equipes rotineiramente escolhem um em uma folha de especificações, integram-no e então descobrem que a experiência parece mais lenta do que o número prometido. Este artigo é uma tentativa de corrigir isso: o que esses sistemas realmente são, como os modelos diferem arquitetonicamente, o que cada valor de latência publicado realmente mede, quanto eles custam quando você olha além da taxa de manchete e - o mais útil - um protocolo de teste que você mesmo pode executar em uma tarde.

Dois produtos com o mesmo nome

Antes de comparar qualquer coisa, separe a categoria em duas. Quase todos os fornecedores vendem um ou ambos os itens a seguir e eles não são substitutos.

A API do Agente. O provedor possui toda a pilha: reconhecimento de fala, modelo de linguagem, conversão de texto em fala, renderização, transporte e, geralmente, um painel com um campo de prompt e uma base de conhecimento. Você configura uma persona e coloca um widget em uma página. Entrega rápida, controle mínimo e a qualidade da conversa é limitada pela escolha de modelos do fornecedor.

A API de áudio para vídeo. O escopo do provedor termina em uma tarefa: pegar o áudio do agente e retornar um stream de vídeo sincronizado com os lábios em tempo real. Você traz sua própria fala para texto, seu próprio LLM, sua própria voz e sua própria orquestração - normalmente Pipecat ou Agentes LiveKit. Esse é o modelo de “camada facial”, e é o que a maioria das equipes que constroem um produto sério acaba usando, porque o avatar se torna uma camada de interface opcional sobre um agente de voz que já funciona.

A distinção também é importante comercialmente. Beyond Presence cobra exatamente o dobro pelo modo Agente em comparação ao modo Fala para Vídeo. O modo Lite do HeyGen (você traz o cérebro) custa aproximadamente metade do preço do modo Full.

Uma regra útil: primeiro construa o agente de voz e deixe-o bem, depois adicione o rosto. Equipes que começam com o avatar tendem a acabar com um sistema bonito que diz coisas inúteis.

Como esses modelos realmente funcionam

Três abordagens de renderização fundamentalmente diferentes estão em produção neste momento, e as diferenças aparecem de maneiras importantes.

Diagrama abstrato de uma forma de onda de áudio passando pelas camadas do modelo e emergindo como uma sequência de quadros de vídeo resolvidos progressivamente

Cada avatar em tempo real tem o mesmo formato por baixo: direcionando o áudio, gerando quadros, rápido o suficiente para permanecer sincronizado. Imagem gerada com GPT Image 2.

Difusão no espaço de pixels

A abordagem dominante. Um modelo de difusão gera quadros de vídeo diretamente, condicionados ao áudio de condução e a uma identidade de referência. Tavus descreve Phoenix-4 como um modelo de difusão gaussiana; LemonSlice usa um transformador de difusão. Como o modelo gera pixels em vez de acionar um equipamento, ele pode produzir expressões, micromovimentos e gestos manuais que nenhum modelo manipulado foi criado para ter. É também a abordagem que mais exige computação, e é por isso que o preço por minuto nesta categoria é o que é.

Respingos gaussianos e representações aprendidas

Simli é renderizado a partir de uma representação de respingos gaussianos em vez da geração completa de espaço de pixel. A compensação é visível em ambas as direções: o custo por minuto do Simli é aproximadamente uma ordem de magnitude abaixo dos provedores de difusão de pixels, e revisores independentes sinalizaram consistentemente seu comportamento ocioso – movimento circular dos olhos, rotação mecânica da cabeça, transições ruins entre ouvir e falar.

Renderização 3D

Uneeq constrói humanos digitais volumétricos no Unreal Engine e os entrega em WebRTC com streaming de pixels. A pilha ACE da NVIDIA segue um caminho relacionado: seu Áudio2Face-3D O microsserviço converte a fala em blendshapes do ARKit que conduzem um personagem 3D e é enviado como um contêiner NIM auto-hospedável sob uma licença NVIDIA AI Enterprise. Você também não confundirá com uma fotografia. Em troca, você obtém direção de arte completa, comportamento determinista, personagens não humanos estilizados e – com a rota NVIDIA – a única opção genuinamente auto-hospedada de última geração.

Criação de avatar: foto versus vídeo

Isso silenciosamente se tornou o maior diferencial prático. Há dois anos, todos os provedores exigiam uma gravação de estúdio de dois minutos. Agora, Cara-4, Simli, LemonSlice, Hedra, Ojin e bitHuman de Anam podem gerar um avatar a partir de uma única fotografia, sem nenhuma etapa de treinamento. Tavus e HeyGen ainda constroem seus avatares personalizados da mais alta qualidade a partir de um vídeo gravado, que leva dias em vez de segundos, mas captura dados faciais em vários ângulos que os modelos de imagem única precisam inferir.

A compensação é real. A geração de uma única foto permite criar cem personas em uma tarde. As réplicas treinadas em vídeo ainda tendem a resistir melhor ao exame minucioso, porque o modelo viu a cabeça real da pessoa virar.

As seis coisas diferentes chamadas “latência”

Aqui está a tabela que deveria existir na página de preços de cada fornecedor e não existe.

O que é medido De → até Intervalo típico publicado O usuário sente isso?
Geração do lado do servidor Chega um pedaço de áudio → quadro de vídeo produzido 100–250ms Apenas como parte do total. Menor componente.
Latência de inferência de streaming Somente dentro do loop de renderização Menos de 100 ms Não. Exclui totalmente a rede.
Inferência TTFB Solicitação → primeiro byte de saída ~470 ms reivindicados Parcialmente. Exclui o LLM e o TTS antes dele.
Latência global do avatar Inclui saída de rede para o cliente ~250ms Mais perto. Ainda exclui a pilha de raciocínio.
Latência de conversa de ponta a ponta O usuário para de falar → o avatar começa a falar 600ms – 1,5s Sim. Este é o que importa.
Previsão de piso / tomada de turno Quão rápido o sistema decide que você terminou 55–300ms Sim, e muitas vezes é o maior pedaço recuperável.

Um fornecedor que cita 100 ms e outro que cita 1 segundo podem estar descrevendo o mesmo sistema. A primeira é medir seu loop de renderização; a segunda é medir todo um rumo conversacional. Ao comparar provedores, insista na quinta linha, medida a partir de áudio e vídeo gravados em um único relógio – e peça p95, não apenas mediana.

Há mais um número que ninguém publica e todos deveriam: tempo para o primeiro quadro na entrada da sessão. Em um ambiente de quiosque ou cabine, a lacuna entre alguém se aproximando e o rosto aparecendo é a latência mais importante em todo o sistema, e revisores independentes observaram que vários provedores demoram para aderir, mesmo quando a latência na conversa é boa.

Qual latência realmente prevê a satisfação

A única avaliação cega de terceiros desta categoria publicada até agora incluiu 178 participantes e descobriu que a capacidade de resposta era o preditor individual mais forte da experiência geral – uma correlação de Spearman de 0,697 – à frente da qualidade visual, que ficou em segundo lugar. Vale a pena internalizar esse resultado antes de passar uma semana comparando a textura da pele. Os usuários não percebem com segurança qual modelo apresenta melhor renderização. Eles percebem, instantaneamente, qual deles responde mais rápido.

Os provedores

Os números abaixo são publicados por cada fornecedor ou relatados por revisores terceirizados em agosto de 2026. Os preços dos avatares em tempo real mudaram rapidamente e continuarão mudando; trate cada número como um ponto de partida para sua própria medição, não como uma especificação.

Se você ainda não viu um desses em uma conversa, este é o formato: um rosto renderizado conduzido ao vivo pelo áudio de um agente. Demonstração do fornecedor publicada por Simli, um dos fornecedores comparados abaixo.

Anam

Anam é uma spin-out de Londres fundada em 2023 por ex-funcionários da Synthesia. Seu modelo Cara-4, lançado em julho de 2026, gera um avatar conversacional a partir de uma única foto a 25 fps, produzindo 1152×768 em paisagem e 768×1152 em retrato. Anam publica latência média de conversação inferior a 1 segundo com aproximadamente 150–180 ms de geração no lado do servidor, suporta mais de 70 idiomas, traz seu próprio LLM e lista cobertura SOC 2 Tipo II, HIPAA e GDPR com retenção de dados zero. O transporte é WebRTC sobre Pion. Ficou em primeiro lugar em qualidade visual, sincronização labial, naturalidade e capacidade de resposta no estudo cego com 178 participantes.

A crítica independente consistente não é o modelo – os revisores descrevem as microexpressões do Cara-4 como as melhores da categoria – mas o encanamento: entrada lenta na sessão e mau comportamento sob largura de banda restrita. Sua integração LiveKit historicamente exigiu uma solução alternativa.

Tavus

Um laboratório de pesquisa de São Francisco, ex-aluno do YC, fundado em 2020. Tavus vende um completo Interface de vídeo conversacional em vez de uma camada de renderização, construída a partir de três modelos proprietários: Fênix-4 para renderização, Raven-1 para percepção (olhar, expressão, contexto ambiental) e Sparrow-1 para fluxo de conversação, que Tavus relata com latência média de previsão mínima de 55 ms. As reivindicações de latência pública ficam abaixo de 600 ms. O transporte é WebRTC diário; foi um dos primeiros a lançar um plugin de avatar LiveKit. As réplicas personalizadas vêm de uma gravação de dois minutos e levam de 3 a 5 dias nos planos padrão e 24 horas nos planos empresariais.

Tavus é a opção mais verticalmente integrada aqui – percepção, turnos, renderização, LLM, TTS e WebRTC, todos incluídos no preço por minuto – e também o mais caro. A avaliação de um comprador relatou que a geração de avatar personalizado atingiu aproximadamente 66% de conclusão antes de cometer erros e exigir novas tentativas.

HeyGen LiveAvatar

HeyGen passou da tradução do vídeo para a geração do avatar e definiu o padrão visual para a categoria. LiveAvatar substitui seu antigo produto Interactive Avatar e oferece uma API de agente e uma API de áudio para vídeo em beta, através de WebSockets ou WebRTC na infraestrutura LiveKit, com suporte de estrutura LiveKit, Pipecat e TEN. Os clientes de produção nomeados incluem Coursera, HP e Bosch.

Seu ponto forte na avaliação independente é o comportamento ocioso – os micromovimentos e padrões de piscar mais naturais de qualquer provedor testado – além do retorno automático para voz ou texto se o avatar não estiver disponível, o que é um recurso de produção genuinamente cuidadoso. Sua fraqueza distintiva é o alcance emocional: o rosto pronuncia as palavras com precisão, mas o registro é monótono.

Avatares personalizados exigem uma gravação sem cortes de dois minutos, além de um vídeo de consentimento, e fora dos planos Enterprise, esse consentimento deve ser capturado ao vivo via webcam.

Simli

Simli é uma empresa YC de 2023 que se posiciona explicitamente como infraestrutura – a camada facial para agentes de voz, nada mais. Ele oferece APIs de agente e de áudio para vídeo, criação de avatar de imagem única, suporte LiveKit e Pipecat e um preço que não é próximo ao de ninguém: US$ 0,009 por minuto contra um mercado que fica principalmente entre 8 e 35 centavos. As reivindicações de latência ficam abaixo de 300 ms.

O custo vem da arquitetura, não dos subsídios, e o mesmo acontece com o teto de qualidade. Os revisores sinalizam repetidamente o estado inativo – o avatar “nunca se sente em repouso”. Se a sua sessão for curta e principalmente falada, isso pode não importar. Se alguém ficar na frente dele em silêncio por quinze segundos, isso acontecerá.

Beyond Presence

Beyond Presence foi fundada na Alemanha em 2024 e tem como foco agentes gerenciados de vendas, RH e coaching, com modelo de avatar Genesis. Ele publica inferência de streaming abaixo de 100 ms e latência global de avatar ≤250 ms – duas medidas diferentes, que vale a pena observar dada a seção acima. O transporte é WebRTC em LiveKit, com suporte para LiveKit e Pipecat e uma incorporação de iframe. O preço tem uma propriedade incomum e bem-vinda: as taxas incluídas e excedentes são idênticas em cada nível, portanto não há precipício.

Revisores independentes classificam a qualidade do vídeo e a adaptação da largura de banda entre as melhores da categoria. A crítica é representacional: por codificar a partir de uma imagem estática, uma avaliação descreveu o resultado como tendo um teto rígido e “leitura como um mascote” para uso B2B sério.

LemonSlice

LemonSlice — anteriormente Infinity AI — relançado em 2024/25 como um laboratório de pesquisa de ponta para vídeo interativo. Construídos em um transformador de difusão, os avatares vêm de uma única foto e – de forma única – lidam bem com personagens estilizados e não fotorrealistas, não apenas com humanos realistas. Os revisores destacam seu gesto e movimento das mãos como os mais expressivos disponíveis. O transporte é WebRTC diário; há um widget e uma API REST, além de suporte para pipelines autogerenciados LiveKit, Pipecat ou Daily.

LemonSlice publica um tempo de resposta de 471 ms e o considera o mais rápido de qualquer grande provedor. Observe que pelo menos a página de comparação pública de um concorrente atribui um valor idêntico de 471 ms a HeyGen. Ambos não podem descrever a mesma medição e nenhum deles é verificado de forma independente – que é precisamente o problema que este artigo existe para sinalizar.

Ojin

Construído pela Jornee Technologies, Ojin executa dois modelos de rosto atrás uma API: Retrato para escala e Presença em termos de expressividade, ambos impulsionados pelo modelo de voz para vídeo Oris 1.0. Personas são criadas a partir de uma única imagem de referência, sem etapa de treinamento. Ojin publica latência inferior a 200 ms e se conecta por meio de WebSocket, o que facilita a entrada em um pipeline existente, mas significa que você é responsável pelo transporte do lado do cliente. O preço é baseado em créditos nos níveis Creator (US$ 8/mês), Studio (US$ 82/mês), Growth (US$ 232/mês) e Enterprise, com limites de minutos separados para a API do modelo e os dois modos de agente.

bitHumano

bitHumano é a participante da computação de ponta, fundada em 2023 em São Francisco, com base na premissa de que os avatares não serão onipresentes até que sejam executados no dispositivo. Ele vem com um modelo “essencial” que pode ser auto-hospedado ou executado na nuvem e um modelo “expressivo” que é somente na nuvem. O preço relatado é de aproximadamente US$ 0,04/min na nuvem e US$ 0,01/min auto-hospedado. O transporte é WebRTC sobre LiveKit, com base de conhecimento, webhooks, análises e eventos de gestos do lado do cliente.

A qualidade é classificada como aceitável em vez de excelente. Mas é o único fornecedor convencional que oferece implantação local, o que muda totalmente o cálculo para quiosques off-line, ambientes isolados e qualquer coisa onde o faturamento por minuto na nuvem em uma instalação de oito horas seja insustentável.

Hedra, D-ID e Uneeq

Hedra (2023, São Francisco) constrói modelos básicos para personagens digitais com foco criativo em vez de utilitário. Avatares de imagem única, WebRTC em LiveKit, aproximadamente US$ 0,07/min. Testes independentes sinalizam baixa resolução e taxa de bits e latência lenta.

D-ID (Israel, 2017) é o veterano, conhecido publicamente por Deep Nostalgia, agora focado em streaming corporativo. WebRTC sobre Janus, sem suporte de estrutura e uma API de baixo nível sem SDK. Aproximadamente US$ 0,35/min, com latência classificada como lenta em testes independentes.

Uneeq antecede inteiramente o boom generativo, fornecendo humanos digitais do Unreal Engine em streaming de pixels sob uma licença, em vez de preços por minuto. Os avatares são construídos manualmente pela Uneeq. A latência é boa; a resiliência da largura de banda não; e você pode dizer que é renderizado em 3D.

Synthesia, a categoria responsável por vídeos corporativos assíncronos, demonstrou uma oferta ao vivo, mas não a disponibilizou publicamente até a pesquisa independente mais recente.

A tabela de comparação

Provedor Formato da API Renderização Fonte do avatar Transporte Estruturas Latência publicada
Anam Agente Difusão (Cara-4) Foto única WebRTC (Pion) LiveKit (solução alternativa) Conversa sub-1s; Servidor de aproximadamente 150–180 ms
Tavus Agente Difusão gaussiana (Phoenix-4) Vídeo de 2 minutos WebRTC (diariamente) LiveKit, Pipecat Sub-600ms; Previsão de piso de 55 ms
HeyGen LiveAvatar Agente + A2V Proprietário Vídeo de 2 minutos + consentimento WebSocket ou WebRTC (LiveKit) LiveKit, Pipecat, DEZ ~471 ms TTFB (disputado)
Simli Agente + A2V Respingos gaussianos Foto única WebRTC (diariamente) LiveKit, Pipecat Menos de 300 ms
Beyond Presence Agente + A2V Proprietário (Gênesis) Vídeo curto WebRTC (LiveKit) LiveKit, Pipecat Inferência <100 ms; ≤250ms globais
LemonSlice Agente Transformador de difusão Foto única WebRTC (diariamente) Autogerenciado 471 ms (auto-relatado)
Ojin API de agente + modelo Oris 1.0 fala para vídeo Imagem única WebSocket Agnóstico de pipeline Menos de 200 ms
bitHumano Agente ou local Proprietário Imagem ou vídeo WebRTC (LiveKit) LiveKit Não publicado
Hedra Agente Proprietário Imagem única WebRTC (LiveKit) LiveKit (solução alternativa) Não publicado
D-ID Agente Proprietário Imagem WebRTC (Jano) Nenhum "Baixa latência", sem valor
Uneeq Agente Motor irreal 3D Construído por Uneeq WebRTC (transmissão de pixels) Nenhum Não publicado

Quanto custa

Dois terços desta categoria agrupam-se entre US$ 0,08 e US$ 0,35 por minuto. Vale a pena compreender os valores discrepantes, porque são discrepantes por razões estruturais.

Provedor Efetivo por minuto Estrutura Cuidado com
Simli $0.009 Pagamento conforme o uso, crédito de inscrição de US$ 10 Qualidade de estado ocioso
bitHumano ~$0,01 auto-hospedado / ~$0,04 nuvem Por minuto ou local Auto-hospedagem significa que você possui as GPUs
Hedra ~$0.07 Por minuto Resolução e taxa de bits
Beyond Presence 0,087–0,175€ (S2V) / 0,175–0,35€ (agente) Créditos; incluído = taxa excedente O modo de agente é exatamente 2× S2V
HeyGen LiveAvatar US$ 0,095 (Lite, Business) – US$ 0,25 (Completo, Iniciante) Créditos, $ 100 = 1.000 Unidades de preços mistos; o excedente pode exceder o custo do crédito do plano
Anam $ 0,18–0,24 misturado Assinatura + minutos Os minutos expiram mensalmente; o nível de US$ 999 tem uma taxa por minuto pior do que o nível de US$ 299
LemonSlice ~$0.21 Assinatura + pré-carga de sessão Modelo de pré-carga baseado em sessão
Tavus US$ 0,32 combinado (crescimento) / US$ 0,59 (inicial) Assinatura + minutos Arredondamento de 6 segundos, mínimo de 30 segundos, maior excedente na categoria
D-ID ~$0.35 Assinatura + créditos Sem SDK; custo de integração é o custo real

Dois pontos estruturais que importam mais do que a taxa global:

A simultaneidade é a restrição oculta. O preço por minuto implica que você pode escalar, mas os planos limitam as sessões simultâneas e os limites são baixos. Uma avaliação publicada descobriu que Tavus permite 15 sessões simultâneas em um plano de US$ 395/mês, Anam permite 5 em um plano de aproximadamente US$ 299 e HeyGen permite 20 em seu nível Essential. Se você estiver colocando um avatar na frente de um público de conferência ou campanha de marketing, simultaneidade – e não minutos – é o que você realmente está comprando. Pergunte sobre isso antes de perguntar sobre o preço.

Pacote versus traga o seu próprio altera totalmente a comparação. A taxa por minuto do Tavus inclui percepção, turno, renderização, LLM, TTS e WebRTC. Os US$ 0,009 do Simli incluem renderização e nada mais – você ainda paga por STT, LLM, TTS e transporte separadamente. Compare iguais ou a opção barata parecerá 35 vezes mais barata do que é.

Consentimento, semelhança e as regras que se aplicam agora

Cada provedor exige consentimento para criar um avatar de uma pessoa real, e a mecânica difere o suficiente para afetar seu fluxo de trabalho. HeyGen requer um vídeo de consentimento gravado da pessoa retratada e, fora dos planos Enterprise, esse consentimento deve ser capturado ao vivo via webcam – o que significa que você não pode criar avatares em lote a partir de imagens arquivadas em um plano padrão.

Separadamente, desde 2 de agosto de 2026, aplica-se o artigo 50.º da Lei da UE sobre IA. Os sistemas que interagem diretamente com as pessoas devem deixar claro que a interação é com IA, e os conteúdos sintéticos ou manipulados devem ser divulgados de forma clara e na primeira exposição. Um avatar fotorrealista de um ser humano está perfeitamente dentro de ambas as obrigações. A implicação prática é direta: divulgue na primeira troca e inclua a divulgação na experiência, em vez de fixá-la no rodapé.

Como avaliar você mesmo

As demonstrações dos fornecedores estão ajustadas. Os números dos fornecedores são incomparáveis. Aqui está um protocolo que leva cerca de um dia e produz números que você pode realmente comparar.

1. O teste de inatividade

Inicie uma sessão e não diga nada por quinze segundos. Observe o rosto. Este é o sinal mais honesto de qualidade de renderização, porque não há áudio para se esconder – e é onde a maioria dos provedores falha primeiro. Observe a taxa de piscadas, a respiração, os micromovimentos da cabeça e a transição entre ouvir e falar. Repita com 30 segundos. Na implantação de um quiosque, o avatar passa a maior parte de sua vida nesse estado.

Três camadas fantasmas do mesmo rosto renderizado se deslocam ligeiramente, com linhas de contorno ciano rastreando micromovimentos ao redor dos olhos e da mandíbula

Três momentos amostrados de quinze segundos de silêncio. A taxa de piscar, a respiração e o micro-movimento da cabeça são onde a qualidade da renderização é mais difícil de falsificar. Imagem gerada com GPT Image 2.

2. O teste do relógio

Grave ambos os lados da interação em um relógio – a entrada do microfone e a saída renderizada, capturadas juntas. Não use os horários informados pelo fornecedor. Meça desde o final do seu discurso até a primeira palavra audível da resposta, em pelo menos 30 voltas, e relate p50 e p95 separadamente. Espere que o p95 seja consideravelmente pior do que a demonstração e que esse seja o número que seus usuários experimentarão.

3. O teste de adesão

Inicie uma sessão a frio vinte vezes e meça o tempo do relógio desde o início até o primeiro quadro renderizado. Ninguém publica isso e domina as primeiras impressões em ambientes walk-up.

4. O teste de invasão

Interrompa no início, meio e fim da frase do avatar. Separadamente, teste um backchannel (“mm-hm”), uma correção genuína (“não, sexta-feira”) e ruído de fundo puro. Verifique três coisas: ele para quando deveria, para não pare quando não deveria e retome com o contexto intacto.

5. O teste de largura de banda

Acelere para 1,5 Mbps, depois 500 ms de jitter adicionado e depois 500 kbps. É aqui que os provedores se separam de forma mais dramática e é invisível em uma conexão de escritório. Testes independentes encontraram vários provedores que parecem excelentes quando a fibra congela ou se desconecta sob largura de banda restrita – que é exatamente o que é uma rede Wi-Fi de conferência.

6. O teste cego

Coloque dois ou três candidatos diante de dez pessoas que não sabem qual é qual e peça-lhes que classifiquem a experiência e não a aparência. Dado que a capacidade de resposta prevê mais satisfação do que a qualidade visual, não se surpreenda quando o modelo mais bonito perder.

Como escolher

Comprimido nas decisões que realmente se ramificam:

  • Você já tem um agente de voz ativo. Compre uma API de áudio para vídeo, não uma API de agente. Beyond Presence, Simli e HeyGen vendem apenas a camada de renderização e você mantém o controle daquilo que determina se a conversa é boa.
  • Você precisa da mais alta qualidade visual e expressiva. O Cara-4 do Anam e o Phoenix-4 do Tavus lideram avaliações independentes, no topo da faixa de preço. Orçamento para simultaneidade, não apenas para minutos.
  • Você precisa de alto volume com baixo custo. Simli, em uma ordem de magnitude genuína abaixo do campo — desde que você tenha validado o estado inativo em relação ao seu padrão de sessão real.
  • Você precisa de economia de instalação off-line, com isolamento de ar ou durante todo o dia. modelo local do bitHuman ou NVIDIA ACE com Audio2Face-3D se você puder transportar o pipeline 3D.
  • Você precisa de um personagem estilizado ou não humano. LemonSlice para estilos gerados; Uneeq ou NVIDIA ACE para 3D de autoria.
  • Você precisa dele incorporado em um produto esta semana. Uma API de agente com um widget. Aceite o teto e planeje a migração para uma camada de renderização para quando a qualidade da conversa se tornar a restrição vinculativa.

O resultado final

Os modelos nesta categoria estão convergindo mais rapidamente do que o marketing ao seu redor. Analistas independentes que avaliaram dez fornecedores lado a lado concluíram que as diferenças de qualidade entre eles são reais, mas não grandes, que a tecnologia está pronta para casos de uso de treinamento, recrutamento e vendas, e que os custos abrangem uma faixa de 35x que está mudando rapidamente.

O que não está convergindo é a medição. Até que alguém publique um benchmark compartilhado que todos os fornecedores executem – latência de conversação ponta a ponta, p50 e p95, de áudio gravado, sob largura de banda realista – o único número em que você pode confiar é aquele que você mesmo mediu.

Passe o dia. Execute os seis testes. Os resultados não corresponderão às folhas de especificações e a diferença é o ponto principal.

Seu primeiro assistente está a poucos minutos de distância

Coloque seu conhecimento de negócios para trabalhar.

Comece com uma conta Cody gratuita. Adicione seu conteúdo, crie um assistente e compartilhe a primeira resposta útil hoje.