Tous les articles
IA en temps réel

Comparaison des modèles d'avatars d'IA en temps réel : latence, architecture et coût

Architecture, définitions de latence, transport, tarification et moyen reproductible de les évaluer vous-même. Chaque fournisseur d'avatars en temps réel publie un numéro de latence. Anam indique une conversation de moins d'une seconde avec une génération côté serveur d'environ 150 ms. Tavus indique inférieur à 600… Lire la suite »

Par Om KamathTemps de lecture: 21 minutes
Un portrait humain numérique à moitié photoréaliste et à moitié dissolvant dans un nuage de points lumineux

Architecture, définitions de latence, transport, tarification et moyen reproductible de les évaluer vous-même

Chaque fournisseur d'avatars en temps réel publie un numéro de latence. Anam indique une conversation de moins d'une seconde avec une génération côté serveur d'environ 150 ms. Tavus indique moins de 600 ms. Beyond Presence indique moins de 100 ms. Simli indique moins de 300 ms. LemonSlice indique 471 ms. Ojin indique moins de 200 ms.

Aucun de ces chiffres n’est un mensonge. Presque aucun d’entre eux ne mesure la même chose.

C’est le problème central du choix d’un fournisseur d’avatars en temps réel en 2026, et c’est pourquoi les équipes en choisissent régulièrement un sur une fiche technique, l’intègrent, puis découvrent que l’expérience semble plus lente que le nombre promis. Cet article est une tentative de résoudre ce problème : ce que sont réellement ces systèmes, comment les modèles diffèrent sur le plan architectural, ce que chaque chiffre de latence publié mesure réellement, ce qu'ils coûtent une fois que vous regardez au-delà du taux global et, le plus utile, un protocole de test que vous pouvez exécuter vous-même dans un après-midi.

Deux produits portant le même nom

Avant de comparer quoi que ce soit, séparez la catégorie en deux. Presque tous les fournisseurs vendent l’un ou les deux des produits suivants, et ils ne constituent pas des substituts.

L'API des agents. Le fournisseur possède l'ensemble de la pile : la reconnaissance vocale, le modèle de langage, la synthèse vocale, le rendu, le transport et généralement un tableau de bord avec un champ d'invite et une base de connaissances. Vous configurez un persona et déposez un widget sur une page. Rapide à expédier, contrôle minimal et la qualité de votre conversation est limitée par le choix de modèles du fournisseur.

L'API audio-vidéo. La portée du fournisseur s'arrête à une seule tâche : prendre l'audio de l'agent et renvoyer un flux vidéo synchronisé sur les lèvres en temps réel. Vous apportez votre propre synthèse vocale, votre propre LLM, votre propre voix et votre propre orchestration - généralement Pipecat ou Agents LiveKit. Il s'agit du modèle de « couche de visage », et c'est ce que la plupart des équipes qui construisent un produit sérieux finissent par utiliser, car l'avatar devient une couche d'interface facultative au-dessus d'un agent vocal qui fonctionne déjà.

La distinction est également importante sur le plan commercial. Le Beyond Presence facture exactement le double pour le mode Agent par rapport à son mode Speech-to-Video. Le mode Lite du HeyGen (vous apportez le cerveau) coûte environ la moitié du prix de son mode Full.

Une règle utile : créez d'abord l'agent vocal et faites-le bien, puis ajoutez le visage. Les équipes qui commencent par l’avatar ont tendance à se retrouver avec un beau système qui dit des choses inutiles.

Comment fonctionnent réellement ces modèles

Trois approches de rendu fondamentalement différentes sont actuellement en production, et les différences apparaissent de manière importante.

Diagramme abstrait d'une forme d'onde audio traversant les couches du modèle et émergeant sous la forme d'une séquence d'images vidéo progressivement résolues

Chaque avatar en temps réel a la même forme en dessous : entrée audio, images générées, suffisamment rapide pour rester synchronisé. Image générée avec GPT Image 2.

Diffusion dans l'espace pixel

L'approche dominante. Un modèle de diffusion génère directement des images vidéo, conditionnées par l'audio de conduite et une identité de référence. Tavus décrit Phoenix-4 comme un modèle de diffusion gaussienne ; LemonSlice utilise un transformateur de diffusion. Étant donné que le modèle génère des pixels plutôt que de piloter un rig, il peut produire des expressions, des micro-mouvements et des gestes de la main qu'aucun modèle truqué n'a été conçu pour avoir. Il s’agit également de l’approche la plus gourmande en calcul, c’est pourquoi la tarification à la minute dans cette catégorie est ce qu’elle est.

Éclaboussures gaussiennes et représentations apprises

Simli effectue le rendu à partir d'une représentation gaussienne plutôt que d'une génération d'espace de pixels complet. Le compromis est visible dans les deux sens : le coût par minute de Simli est à peu près d'un ordre de grandeur inférieur à celui des fournisseurs de diffusion de pixels, et les évaluateurs indépendants ont systématiquement signalé son comportement au repos : mouvements oculaires circulaires, rotation mécanique de la tête, mauvaises transitions entre l'écoute et la parole.

Rendu 3D

Uneeq crée des humains numériques volumétriques dans Unreal Engine et les diffuse sur WebRTC avec streaming de pixels. La pile ACE de NVIDIA emprunte un chemin connexe : son Audio2Face-3D le microservice convertit la parole en formes de mélange ARKit qui pilotent un personnage 3D et est livré sous forme de conteneur NIM auto-hébergable sous une licence NVIDIA AI Enterprise. Vous ne prendrez pas non plus pour une photo. En échange, vous bénéficiez d'une direction artistique complète, d'un comportement déterministe, de personnages non humains stylisés et, avec la voie NVIDIA, de la seule option véritablement auto-hébergée haut de gamme.

Création d'avatar : photo versus vidéo

C’est progressivement devenu le plus grand différenciateur pratique. Il y a deux ans, chaque fournisseur exigeait un enregistrement en studio de deux minutes. Désormais, les Cara-4, Simli, LemonSlice, Hedra, Ojin et bitHuman de Anam peuvent tous générer un avatar à partir d'une seule photo, sans étape de formation. Tavus et HeyGen continuent de créer leurs avatars personnalisés de la plus haute qualité à partir d'une vidéo enregistrée, ce qui prend des jours plutôt que des secondes, mais capture des données faciales sous plusieurs angles que les modèles à image unique doivent déduire.

Le compromis est réel. La génération d'une seule photo vous permet de créer une centaine de personnages en un après-midi. Les répliques entraînées par vidéo ont toujours tendance à mieux résister à un examen minutieux, car le modèle a vu la tête de la personne tourner.

Les six choses différentes appelées « latence »

Voici le tableau qui devrait exister sur la page de tarification de chaque fournisseur et qui n'existe pas.

Ce qui est mesuré De → à Gamme publiée typique L'utilisateur le ressent-il ?
Génération côté serveur Le morceau audio arrive → image vidéo produite 100 à 250 ms Uniquement dans le cadre du total. Le plus petit composant.
Latence d'inférence de streaming À l'intérieur de la boucle de rendu uniquement Moins de 100 ms Non. Exclut entièrement le réseau.
Inférence TTFB Requête → premier octet de sortie ~470 ms réclamés Partiellement. Exclut le LLM et le TTS qui le précèdent.
Latence globale de l'avatar Inclut la sortie réseau vers le client ~250 ms Plus près. Exclut toujours la pile de raisonnement.
Latence des conversations de bout en bout L'utilisateur arrête de parler → l'avatar commence à parler 600 ms – 1,5 s Oui. C'est celui-là qui compte.
Prédiction au sol / prise de tour À quelle vitesse le système décide que vous avez terminé 55 à 300 ms Oui, et il s’agit souvent du plus gros morceau récupérable.

Un fournisseur citant 100 ms et un fournisseur citant 1 seconde peuvent décrire le même système. La première consiste à mesurer sa boucle de rendu ; la seconde mesure tout un tour de conversation. Lorsque vous comparez les fournisseurs, insistez sur la cinquième ligne, mesurée à partir de l’audio et de la vidéo enregistrés sur une seule horloge – et demandez p95, pas seulement la médiane.

Il y a encore un numéro que personne ne publie et que tout le monde devrait : temps de première image lors de la connexion à la session. Dans un kiosque ou un stand, l'intervalle entre l'arrivée d'une personne et l'apparition du visage constitue la latence la plus importante de tout le système, et des évaluateurs indépendants ont noté que plusieurs prestataires mettent du temps à se joindre, même lorsque leur latence en conversation est bonne.

Quelle latence prédit réellement la satisfaction

La seule évaluation aveugle par un tiers de cette catégorie publiée jusqu'à présent a porté sur 178 participants et a révélé que la réactivité était le prédicteur le plus puissant de l'expérience globale – une corrélation de Spearman de 0,697 – devant la qualité visuelle, qui arrive en deuxième position. Ce résultat mérite d’être internalisé avant de passer une semaine à comparer la texture de la peau. Les utilisateurs ne remarquent pas de manière fiable quel modèle offre le meilleur rendu. Ils remarquent instantanément lequel répond le plus rapidement.

Les fournisseurs

Les chiffres ci-dessous sont tels que publiés par chaque fournisseur ou rapportés par des évaluateurs tiers en août 2026. Les prix des avatars en temps réel ont évolué rapidement et continueront d'évoluer ; traitez chaque nombre comme un point de départ pour votre propre mesure, et non comme une spécification.

Si vous n'en avez jamais vu lors d'une conversation, voici le format : un visage rendu en direct par l'audio d'un agent. Démo du fournisseur publiée par Simli, l'un des fournisseurs comparés ci-dessous.

Anam

Anam est une spin-out londonienne fondée en 2023 par d'anciens collaborateurs de Synthesia. Son modèle Cara-4, sorti en juillet 2026, génère un avatar conversationnel à partir d'une seule photo à 25 ips, produisant 1152×768 en paysage et 768×1152 en portrait. Anam publie une latence médiane de conversation inférieure à 1 seconde avec environ 150 à 180 ms de génération côté serveur, prend en charge plus de 70 langues, apporte votre propre LLM et répertorie la couverture SOC 2 Type II, HIPAA et GDPR sans rétention de données. Le transport s'effectue WebRTC via Pion. Il s'est classé premier en termes de qualité visuelle, de synchronisation labiale, de naturel et de réactivité dans l'étude aveugle portant sur 178 participants.

La critique indépendante constante ne porte pas sur le modèle (les critiques décrivent les micro-expressions de Cara-4 comme les meilleures de leur catégorie) mais sur la plomberie : lenteur à rejoindre les sessions et mauvais comportement sous une bande passante limitée. Son intégration LiveKit a toujours nécessité une solution de contournement.

Tavus

Un laboratoire de recherche de San Francisco, ancien élève de YC, fondé en 2020. Tavus vend un plein Interface vidéo conversationnelle plutôt qu'une couche de rendu, construite à partir de trois modèles propriétaires : Phénix-4 pour le rendu, Corbeau-1 pour la perception (regard, expression, contexte environnemental) et Sparrow-1 pour le flux conversationnel, que Tavus rapporte avec une latence médiane de prévision du plancher de 55 ms. Les revendications de latence publique sont inférieures à 600 ms. Le transport s'effectue WebRTC quotidiennement ; il a été parmi les premiers à proposer un plugin d'avatar LiveKit. Les répliques personnalisées proviennent d'un enregistrement de deux minutes et prennent 3 à 5 jours sur les forfaits standards, 24 heures sur les forfaits Entreprise.

Tavus est ici l’option la plus intégrée verticalement – perception, tour de rôle, rendu, LLM, TTS et WebRTC, tous inclus dans le prix à la minute – et également la plus chère. L'évaluation d'un acheteur a indiqué que la génération d'avatars personnalisés atteignait environ 66 % d'achèvement avant de commettre des erreurs et de nécessiter de nouvelles tentatives.

HeyGen LiveAvatar

HeyGen est passé de la traduction vidéo à la génération d'avatars et a défini la barre visuelle de la catégorie. LiveAvatar remplace son ancien produit Interactive Avatar et propose à la fois une API d'agent et une API audio-vidéo en version bêta, sur WebSockets ou WebRTC sur l'infrastructure LiveKit, avec prise en charge des frameworks LiveKit, Pipecat et TEN. Les clients de production nommés incluent Coursera, HP et Bosch.

Sa force distinctive en matière d'évaluation indépendante réside dans son comportement inactif - les micro-mouvements et les schémas de clignement les plus naturels de tous les fournisseurs testés - ainsi que le retour automatique à la voix ou au texte si l'avatar n'est pas disponible, ce qui est une fonctionnalité de production véritablement réfléchie. Sa faiblesse distinctive est la portée émotionnelle : le visage prononce les mots avec précision, mais le registre est plat.

Les avatars personnalisés nécessitent un enregistrement non coupé de deux minutes plus un vidéo de consentement, et en dehors des forfaits Entreprise, ce consentement doit être capturé en direct via webcam.

Simli

Simli est une entreprise YC 2023 qui se positionne explicitement comme une infrastructure – la couche faciale pour les agents vocaux, rien de plus. Il offre à la fois des API d'agent et audio-vidéo, la création d'avatars à image unique, la prise en charge de LiveKit et Pipecat, et un prix qui n'est proche de celui de personne d'autre : 0,009 $ par minute contre un marché qui se situe généralement entre 8 et 35 cents. Les revendications de latence sont inférieures à 300 ms.

Le coût vient de l’architecture et non des subventions, tout comme le plafond de qualité. Les critiques signalent à plusieurs reprises l'état d'inactivité - l'avatar "ne se sent jamais au repos". Si votre séance est courte et principalement orale, cela n'a peut-être pas d'importance. Si quelqu’un reste devant lui en silence pendant quinze secondes, ce sera le cas.

Beyond Presence

Beyond Presence a été fondée en Allemagne en 2024 et se concentre sur les agents gérés pour les ventes, les ressources humaines et le coaching, avec un modèle d'avatar Genesis. Il publie une inférence de streaming inférieure à 100 ms et une latence globale de l'avatar ≤ 250 ms – deux mesures différentes, qui méritent d'être notées compte tenu de la section ci-dessus. Le transport est WebRTC sur LiveKit, avec la prise en charge de LiveKit et Pipecat et une intégration iframe. La tarification a une propriété inhabituelle et bienvenue : les tarifs inclus et excédentaires sont identiques à chaque niveau, il n'y a donc pas de falaise.

Des évaluateurs indépendants classent sa qualité vidéo et son adaptation à la bande passante parmi les meilleures de la catégorie. La critique est représentative : parce qu'elle code à partir d'une image statique, une évaluation a décrit le résultat comme ayant un plafond dur et "lu comme une mascotte" pour une utilisation B2B sérieuse.

LemonSlice

LemonSlice — anciennement Infinity AI — relancé en 2024/25 en tant que laboratoire de recherche de pointe pour la vidéo interactive. Construits sur un transformateur de diffusion, les avatars proviennent d'une seule photo et, de manière unique, ils gèrent bien les personnages stylisés et non photoréalistes, pas seulement les humains réalistes. Les critiques distinguent son geste et son mouvement de la main comme étant les plus expressifs disponibles. Le transport s'effectue WebRTC quotidiennement ; il existe un widget et une API REST, ainsi que la prise en charge des pipelines LiveKit, Pipecat ou quotidiens autogérés.

LemonSlice publie un temps de réponse de 471 ms et le qualifie de plus rapide que tous les principaux fournisseurs. Notez qu'au moins la page de comparaison publique d'un concurrent attribue un chiffre identique de 471 ms à HeyGen. Les deux ne peuvent pas décrire la même mesure, et aucune n’est vérifiée de manière indépendante – ce qui est précisément le problème que cet article vise à signaler.

Ojin

Construit par Journée Technologies, Ojin dirige deux modèles de visage derrière une API: Portrait pour l'échelle et Présence pour l'expressivité, tous deux pilotés par son modèle parole-vidéo Oris 1.0. Les personas sont créés à partir d’une seule image de référence sans étape de formation. Ojin publie une latence inférieure à 200 ms et se connecte via WebSocket, ce qui facilite le passage à un pipeline existant mais signifie que vous êtes responsable du transport côté client. La tarification est basée sur le crédit pour les niveaux Créateur (8 $/mois), Studio (82 $/mois), Croissance (232 $/mois) et Entreprise, avec des allocations de minutes distinctes pour l'API modèle et les deux modes d'agent.

bitHumain

bitHumain est le nouveau venu dans le domaine de l'informatique de pointe, fondé en 2023 à San Francisco, construit sur le principe que les avatars ne seront pas omniprésents tant qu'ils ne fonctionneront pas sur l'appareil. Il propose un modèle « essentiel » qui peut être auto-hébergé ou exécuté dans le cloud et un modèle « expressif » uniquement cloud. Le prix indiqué est d'environ 0,04 $/min dans le cloud et de 0,01 $/min en auto-hébergement. Le transport s'effectue WebRTC sur LiveKit, avec base de connaissances, webhooks, analyses et événements gestuels côté client.

La qualité est jugée acceptable plutôt qu’excellente. Mais il s’agit du seul fournisseur grand public proposant un déploiement local, ce qui change complètement la donne pour les kiosques hors ligne, les environnements isolés et tout ce pour quoi la facturation cloud à la minute sur une installation de huit heures est intenable.

Hedra, D-ID et Uneeq

Hedra (2023, San Francisco) construit des modèles de base pour les personnages numériques axés sur la créativité plutôt que sur l'utilité. Avatars à image unique, WebRTC sur LiveKit, environ 0,07 $/min. Des tests indépendants signalent une résolution et un débit binaire faibles, ainsi qu'une latence lente.

D-ID (Israël, 2017) est le vétéran, connu publiquement pour Deep Nostalgia, désormais axé sur le streaming d'entreprise. WebRTC sur Janus, pas de prise en charge du framework et une API de bas niveau sans SDK. Environ 0,35 $/min, avec une latence jugée lente lors de tests indépendants.

Uneeq est entièrement antérieur au boom génératif, offrant des humains numériques Unreal Engine via un streaming de pixels sous licence plutôt qu'un prix à la minute. Les avatars sont construits manuellement par Uneeq. La latence est bonne ; la résilience de la bande passante ne l’est pas ; et vous pouvez dire qu'il s'agit d'un rendu 3D.

Synthesia, la catégorie en charge de la vidéo d'entreprise asynchrone, a présenté une offre en direct mais ne l'avait pas rendue publique lors de la dernière enquête indépendante.

Le tableau de comparaison

Fournisseur Forme de l'API Rendu Source des avatars Transports Cadres Latence publiée
Anam Agent Diffusion (Cara-4) Photo unique WebRTC (Pion) LiveKit (solution de contournement) Conversation du Sous-1 ; ~150-180 ms serveur
Tavus Agent Diffusion gaussienne (Phoenix-4) vidéo de 2 minutes WebRTC (quotidiennement) LiveKit, Pipecat Sous-600 ms ; Prédiction du plancher à 55 ms
HeyGen LiveAvatar Agent + A2V Propriétaire Vidéo de 2 minutes + consentement WebSocket ou WebRTC (LiveKit) LiveKit, Pipecat, DIX ~ 471 ms TTFB (contesté)
Simli Agent + A2V Éclaboussures gaussiennes Photo unique WebRTC (quotidiennement) LiveKit, Pipecat Moins de 300 ms
Beyond Presence Agent + A2V Propriétaire (Genesis) Courte vidéo WebRTC (LiveKit) LiveKit, Pipecat Inférence <100 ms ; ≤250 ms globale
LemonSlice Agent Transformateur de diffusion Photo unique WebRTC (quotidiennement) Autogéré 471 ms (autodéclaré)
Ojin API agent + modèle Oris 1.0 parole-vidéo Image unique WebSocket Indépendant du pipeline Moins de 200 ms
bitHumain Agent ou local Propriétaire Image ou vidéo WebRTC (LiveKit) LiveKit Non publié
Hedra Agent Propriétaire Image unique WebRTC (LiveKit) LiveKit (solution de contournement) Non publié
D-ID Agent Propriétaire Images WebRTC (janvier) Aucun "Faible latence", pas de chiffre
Uneeq Agent Moteur irréel 3D Construit par Uneeq WebRTC (diffusion de pixels) Aucun Non publié

Ce que ça coûte

Les deux tiers de cette catégorie se situent entre 0,08 $ et 0,35 $ par minute. Les valeurs aberrantes méritent d’être comprises, car elles le sont pour des raisons structurelles.

Fournisseur Efficace par minute Structure Attention à
Simli $0.009 Paiement à l'utilisation, crédit d'inscription de 10 $ Qualité au repos
bitHumain ~ 0,01 $ auto-hébergé / ~ 0,04 $ dans le cloud Par minute ou local L'auto-hébergement signifie que vous possédez les GPU
Hedra ~$0.07 Par minute Résolution et débit
Beyond Presence 0,087 à 0,175 € (S2V) / 0,175 à 0,35 € (agent) Crédits ; inclus = tarif excédentaire Le mode agent est exactement 2× S2V
HeyGen LiveAvatar 0,095 $ (Lite, Business) – 0,25 $ (Complet, Starter) Crédits, 100 $ = 1 000 Unités de prix mixtes ; le dépassement peut dépasser le coût du crédit du plan
Anam 0,18 à 0,24 $ mélangés Abonnement + minutes Les minutes expirent mensuellement ; le niveau 999 $ a un tarif à la minute pire que le niveau 299 $
LemonSlice ~$0.21 Abonnement + précharge séance Modèle de précharge basé sur la session
Tavus 0,32 $ mixte (Croissance) / 0,59 $ (Démarreur) Abonnement + minutes Arrondi de 6 secondes, minimum de 30 secondes, dépassement le plus élevé de la catégorie
D-ID ~$0.35 Abonnement + crédits Pas de SDK ; le coût d'intégration est le coût réel

Deux points structurels qui comptent plus que le taux global :

La concurrence est la contrainte cachée. La tarification à la minute implique que vous pouvez évoluer, mais les forfaits plafonnent les sessions simultanées et les plafonds sont faibles. Une évaluation publiée a révélé que Tavus autorisant 15 sessions simultanées sur un forfait à 395 $/mois, Anam autorisant 5 sur un forfait d'environ 299 $ et HeyGen autorisant 20 sur son niveau Essentiel. Si vous placez un avatar devant le public d'une conférence ou d'une campagne marketing, c'est la simultanéité (et non les minutes) que vous achetez réellement. Renseignez-vous avant de demander le prix.

Les offres groupées ou à emporter changent complètement la comparaison. Le tarif par minute de Tavus inclut la perception, le tour de rôle, le rendu, le LLM, le TTS et le WebRTC. Les 0,009 $ de Simli incluent le rendu et rien d'autre : vous payez toujours les frais STT, LLM, TTS et le transport séparément. Comparez ce qui est comparable ou l’option bon marché semblera 35 fois moins chère qu’elle ne l’est.

Consentement, ressemblance et règles applicables actuellement

Chaque fournisseur nécessite le consentement pour créer l’avatar d’une personne réelle, et les mécanismes diffèrent suffisamment pour affecter votre flux de travail. HeyGen nécessite une vidéo de consentement enregistrée de la personne représentée et, en dehors des forfaits Entreprise, ce consentement doit être capturé en direct via webcam, ce qui signifie que vous ne pouvez pas créer par lots d'avatars à partir de séquences archivées sur un forfait standard.

Par ailleurs, depuis le 2 août 2026, l’article 50 de la loi européenne sur l’IA s’applique. Les systèmes qui interagissent directement avec les gens doivent indiquer clairement que l’interaction s’effectue avec l’IA, et le contenu synthétique ou manipulé doit être divulgué clairement dès la première exposition. Un avatar photoréaliste d’un être humain relève carrément des deux obligations. L’implication pratique est simple : divulguer dès le premier échange et intégrer la divulgation dans l’expérience plutôt que de la placer dans un pied de page.

Comment les évaluer vous-même

Les démos des fournisseurs sont optimisées. Les numéros de fournisseurs sont incomparables. Voici un protocole qui prend environ une journée et produit des chiffres que vous pouvez réellement comparer.

1. Le test du ralenti

Démarrez une séance et ne dites rien pendant quinze secondes. Regardez le visage. Il s’agit du signal le plus honnête en matière de qualité de rendu, car il n’y a pas d’audio derrière lequel se cacher – et c’est là que la plupart des fournisseurs échouent en premier. Recherchez le rythme des clignements, la respiration, les mouvements de la micro-tête et la transition entre l'écoute et la parole. Répétez avec 30 secondes. Dans un déploiement en kiosque, l'avatar passe la majeure partie de sa vie dans cet état.

Trois couches fantômes du même visage rendu légèrement décalées, avec des lignes de contour cyan suivant les micro-mouvements autour des yeux et de la mâchoire.

Trois instants échantillonnés à partir de quinze secondes de silence. Le taux de clignement, la respiration et les mouvements de la micro-tête sont les domaines où la qualité du rendu est la plus difficile à simuler. Image générée avec GPT Image 2.

2. Le test de l'horloge

Enregistrez les deux côtés de l’interaction sur une seule horloge : l’entrée de votre microphone et la sortie rendue, capturées ensemble. N'utilisez pas les horaires indiqués par le fournisseur. Mesurez depuis la fin de votre discours jusqu'au premier mot audible de la réponse, sur au moins 30 tours, et rapportez p50 et p95 séparément. Attendez-vous à ce que le p95 soit considérablement pire que la démo, et attendez-vous à ce que ce soit le chiffre rencontré par vos utilisateurs.

3. Le test de jointure

Démarrez une session à froid vingt fois et mesurez le temps d'horloge murale depuis l'initiation jusqu'à la première image rendue. Personne ne publie cela et cela domine les premières impressions dans les contextes sans rendez-vous.

4. Le test d'intrusion

Interrompez au début, au milieu et à la fin de la phrase de l'avatar. Séparément, testez un canal arrière ("mm-hm"), une véritable correction ("non, vendredi") et un bruit de fond pur. Vérifiez trois choses : est-ce qu'il s'arrête quand il le devrait, est-ce qu'il pas s'arrête alors qu'il ne devrait pas, et reprend-il avec le contexte intact.

5. Le test de la bande passante

Réduisez la vitesse à 1,5 Mbit/s, puis 500 ms de gigue supplémentaire, puis 500 kbit/s. C’est là que les fournisseurs se séparent le plus radicalement, et cela est invisible sur une connexion bureautique. Des tests indépendants ont révélé que plusieurs fournisseurs semblent excellents en matière de gel ou de déconnexion de la fibre avec une bande passante limitée – ce qui est exactement ce qu'est un réseau wifi de conférence.

6. Le test à l'aveugle

Mettez deux ou trois candidats devant dix personnes qui ne savent pas lequel est lequel, et demandez-leur de classer l'expérience plutôt que l'apparence. Étant donné que la réactivité prédit plus fortement la satisfaction que la qualité visuelle, ne soyez pas surpris lorsque le plus joli modèle perd.

Comment choisir

Comprimé aux décisions qui se branchent réellement :

  • Vous disposez déjà d'un agent vocal fonctionnel. Achetez une API audio-vidéo, pas une API d'agent. Beyond Presence, Simli et HeyGen vendent tous la couche de rendu seule, et vous gardez le contrôle de ce qui détermine si la conversation est bonne.
  • Vous avez besoin de la plus haute qualité visuelle et expressive. Le Cara-4 de Anam et le Phoenix-4 de Tavus mènent des évaluations indépendantes, dans le haut de la fourchette de prix. Prévoyez la simultanéité, pas seulement les minutes.
  • Vous avez besoin d’un volume élevé à faible coût. Simli, à un véritable ordre de grandeur inférieur au champ, à condition que vous ayez validé l'état d'inactivité par rapport à votre modèle de session réel.
  • Vous avez besoin d’une installation hors ligne, en espace clos ou sur une journée entière. Le modèle local de bitHuman, ou NVIDIA ACE avec Audio2Face-3D si vous pouvez transporter le pipeline 3D.
  • Vous avez besoin d'un personnage stylisé ou non humain. LemonSlice pour les styles générés ; Uneeq ou NVIDIA ACE pour la 3D créée.
  • Vous en avez besoin intégré dans un produit cette semaine. Une API d'agent avec un widget. Acceptez le plafond et planifiez la migration vers une couche de rendu lorsque la qualité de la conversation devient la contrainte contraignante.

L'essentiel

Les modèles de cette catégorie convergent plus rapidement que le marketing qui les entoure. Des évaluateurs indépendants évaluant dix fournisseurs côte à côte ont conclu que les différences de qualité entre eux sont réelles mais pas importantes, que la technologie est prête pour les cas d'utilisation de formation, de recrutement et de vente, et que les coûts couvrent une fourchette de 35 fois qui évolue rapidement.

Ce qui ne converge pas, c'est la mesure. Jusqu'à ce que quelqu'un publie une référence commune utilisée par tous les fournisseurs – latence conversationnelle de bout en bout, p50 et p95, à partir de l'audio enregistré, avec une bande passante réaliste – le seul chiffre auquel vous pouvez faire confiance est celui que vous avez mesuré vous-même.

Passez la journée. Exécutez les six tests. Les résultats ne correspondront pas aux fiches techniques, et l’écart est tout le problème.

Votre premier assistant est à quelques minutes

Mettez vos connaissances commerciales à profit.

Commencez avec un compte Cody gratuit. Ajoutez votre contenu, créez un assistant et partagez la première réponse utile dès aujourd'hui.