KI-Telefonanrufagenten im Vergleich: Latenz, Abbiegeerkennung und Unterbrechungen
Warum alle veröffentlichten Benchmarks anderer Meinung sind, was die Abbiegeerkennung wirklich kostet und wie Sie sie selbst messen können. Hier sind zwei Fakten über KI-Telefonagenten im Jahr 2026, beide gut beschafft, beide wahr und scheinbar inkompatibel. Fakt eins: Vapi zielt auf p50 unter… Weiterlesen »

Warum alle veröffentlichten Benchmarks anderer Meinung sind, was die Abbiegeerkennung wirklich kostet und wie Sie sie selbst messen können
Hier sind zwei Fakten über KI-Telefonagenten im Jahr 2026, beide gut beschafft, beide wahr und scheinbar unvereinbar.
Fakt eins: Vapi zielt auf p50 unter 500 ms ab. Retell veröffentlicht ungefähr 600 ms. Auf der Homepage von Bland steht 400 ms. Der interne ConversationRelay-Test von Twilio meldet einen Median von 491 ms.
Fakt zwei: Ein unabhängiger Benchmark, der diese Plattformen über echte Telefonleitungen anwählte und anhand der aufgezeichneten Audiodaten maß, ergab Mediane zwischen 1.296 ms und 1.740 ms – jede einzelne Plattform war zwei- bis viermal langsamer als ihre eigene veröffentlichte Zahl.
Niemand lügt. Sie messen unterschiedliche Dinge, über unterschiedliche Transporte hinweg, mit unterschiedlichen Annahmen darüber, wo die Uhr beginnt. Und solange Sie nicht genau verstehen, was jede Zahl beschreibt, können Sie keine davon zur Auswahl einer Plattform verwenden.
Dieser Artikel nimmt das Messproblem ernst, stellt die veröffentlichten Benchmarks mit den dazugehörigen Methoden gegenüber, erklärt, warum die Abbiegeerkennung – und nicht das Sprachmodell – jetzt die dominierende Variable ist, und endet mit einem Protokoll zur Erzeugung von Zahlen, denen Sie tatsächlich vertrauen können.
Wo die Zeit vergeht
Ein Sprachwechsel bei einem Telefonanruf ist ein Staffellauf mit fünf Etappen, bei dem der Staffelstab zwischen jedem Läuferpaar abgelegt wird.

Ein Voice Turn ist ein Staffellauf in fünf Etappen. Einer von ihnen ist immer viel breiter als die anderen. Bild generiert mit GPT Image 2.
| Bühne | Zusammengelegter Stapel | Typischer genähter Stapel |
|---|---|---|
| Netzwerk / SIP | 45 ms | 150 ms |
| Speech-to-Text | 100 ms | 225 ms |
| LLM-Schlussfolgerung | 225 ms | 650 ms |
| Text-zu-Sprache | 80 ms | 185 ms |
| Insgesamt | 450 ms | 1.210 ms |
Zwei Beobachtungen. Das LLM dominiert beide Säulen – weshalb die Umleitung gewöhnlicher Gesprächsrunden auf ein kleines, schnelles Modell und die Eskalation nur dann, wenn eine Argumentation wirklich erforderlich ist, für die meisten Teams die Änderung mit dem höchsten Hebelwirkungsgrad ist. Und der Abstand von 760 ms zwischen den Spalten stellt keinen Unterschied in der Modellqualität dar. Es kommt auf die Geografie, die Hop-Anzahl und die Anzahl der Netzwerke verschiedener Anbieter an, die das Audiosignal durchquert.
Was diese Tabelle außer Acht lässt, ist der Schritt, der normalerweise am meisten kostet: die Entscheidung, ob der Anrufer mit dem Sprechen fertig ist. Dies geschieht, bevor das Relay startet, und ein schlecht konfigurierter Endpointing-Schwellenwert kann zu mehr Verzögerung führen als die gesamte Pipeline darunter.
Die Benchmarks mit ihren beigefügten Methoden
Vier unabhängige Studien haben Zahlen für diese Plattformen im Jahr 2026 veröffentlicht. Sie sind anderer Meinung und kehren die Rangfolge manchmal sogar völlig um. Hier sind sie mit der Methodik, die sie hervorgebracht hat, nämlich der Methodik ist das Ergebnis.
Studie 1: Echte Telefonanrufe, gemessen anhand aufgezeichneter Audiodaten
Der methodisch transparenteste öffentliche Benchmark wählte den Agenten jeder Plattform über einen echten Telefonanruf an, wobei ein Anruferroboter ein festes Skript vorlas, beide Seiten des Anrufs auf einer einzigen Uhr aufzeichnete und Sprachgrenzen in der Aufzeichnung mithilfe von Silero VAD mit einer Energieverfeinerung lokalisierte. Es wurden keine von der Plattform gemeldeten Zeitstempel verwendet. 2.078 nutzbare Kurven auf fünf Plattformen; Endpointing standardisiert auf 0,1 s, sofern konfigurierbar. Die Metrik ist die Zeit bis zum ersten Audiobyte.
| Plattform | S. 50 | S. 95 | Heckverhältnis | Nutzbare Kurven |
|---|---|---|---|---|
| Telnyx | 1.296 ms | 1.856 ms | 1.43× | 419/432 |
| ElevenLabs | 1.424 ms | 1.768 ms | 1.24× | 429/432 |
| Bland AI | 1.520 ms | 2.248 ms | 1.48× | 429/432 |
| Vapi | 1.558 ms | 2.008 ms | 1.29× | 382/432 |
| Retell AI | 1.740 ms | 2.259 ms | 1.30× | 419/430 |
Beachten Sie die letzte Spalte. Vapi hat 50 Runden verworfen – mehr als zehn Prozent – im Vergleich zu einer Handvoll bei den anderen. Eine Plattform, die gelegentlich überhaupt keinen nutzbaren Turn erzeugt, sagt Ihnen etwas, das kein Latenzperzentil erfasst.
Studie 2: Produktionsanrufe, Voice-to-Voice
In einer Studie vom März 2026 wurden 500 Produktionsanrufe pro Plattform durchgeführt und dabei die Voice-to-Voice gemessen.
| Plattform | Median | S. 95 |
|---|---|---|
| Retell | 680 ms | 920 ms |
| Vapi | 720 ms | 1.050 ms |
| Bland | 850 ms | 1.180 ms |
Retell belegt in Studie 1 den letzten und in Studie 2 den ersten Platz. Gleiche Plattform, gleiches Jahr, entgegengesetzte Schlussfolgerung. Das ist das Wichtigste an diesem Artikel: Beim aktuellen Stand der Technik verschiebt die Messmethode das Ergebnis stärker als die Plattform.
Studie 3: Drittanbieter-Stack behoben
Ein anderer Ansatz: Halten Sie die Modelle konstant (GPT-4.1, Deepgram Nova-3, ElevenLabs Flash) und messen Sie die gesamte Drehung, wobei Sie die Orchestrierungsebene isolieren:
| Plattform | Volle Umdrehung, S. 50 |
|---|---|
| ElevenLabs | 1,73 s |
| Retell | 1,96 s |
| Vapi | 2,34 s |
Jede Zahl hier liegt weit über dem, was ein Anbieter bewirbt, da eine vollständige Umstellung auf einem festen Drittanbieter-Stack die Teile umfasst, die Anbieter ausschließen, wenn sie ihren eigenen optimierten Pfad angeben.
Studie 4: Das Trägerbein allein
Abschließend ein Test im Juni 2026 mit 120 ausgehenden Anrufen pro Mobilfunkanbieter und isolierter Hin- und Rücklaufzeit auf der Telefonstrecke:
| Träger | S. 50 RTT | S. 95 RTT |
|---|---|---|
| Telnyx | 71 ms | 118 ms |
| Twilio | 89 ms | 161 ms |
| Vonage | 94 ms | 152 ms |
Nützlicher Kontext: Der Träger trägt weniger als 100 ms bei. Wenn Ihr Agent das Gefühl hat, langsam zu sein, ist das Telefonnetz fast nie der Grund.

Ein Objekt, vier Instrumente, vier Lesungen. Alle Latenzangaben in diesem Artikel sind korrekt; Sie messen einfach nicht die gleiche Spanne. Bild generiert mit GPT Image 2.
So lesen Sie alle vier zusammen
| Nummerntyp | Was es beinhaltet | Was es verbirgt | Vertrauen Sie darauf |
|---|---|---|---|
| Anspruch des Anbieters auf p50 | Optimierter Weg, oft WebSocket keine Telefonie | Endpunktwarten, Trägerbein, Schwanz | Grobe Architekturqualität |
| Komponentenlatenz (z. B. 75 ms TTS) | Die Synthesezeit eines Modells | Alles andere | Auswahl dieser Komponente |
| Aufgezeichnetes Audio TTFAB | Alles, was der Anrufer hört | Nichts – aber inklusive Aufnahmeaufwand | Ranking echte Erfahrung |
| Volle Drehung mit festem Stapel | Orchestrierungs-Overhead, isoliert | Für jede Plattform eigene abgestimmte Modelle | Vergleich der Orchestrierungsebenen |
| Träger RTT | Nur Telefontransport | Der Agent völlig | Einen Spediteur auswählen |
Und die Schwellenwerte, die wahrnehmungsbezogen wichtig sind: Die Übergabe menschlicher Gespräche liegt bei etwa 200 ms; nach etwa 800 ms registriert ein Anrufer die Verzögerung; nach etwa 1.500 ms wird es als defekt angezeigt. Beachten Sie, dass die meisten p95-Zahlen in Studie 1 auf der falschen Seite dieses zweiten Schwellenwerts liegen. Der Median gibt an, wie sich Ihre Demo anfühlt. Das p95 ist das, wonach sich Ihre Anrufer fühlen.
Die Abbiegeerkennung ist das eigentliche Unterscheidungsmerkmal
Jede der oben genannten Plattformen kann Modelle der GPT-Klasse aufrufen und Stimmen der ElevenLabs-Klasse streamen. Das sind Waren. Was einen natürlichen Wirkstoff von einem anstrengenden unterscheidet, ist der Teil, der entscheidet wann man spricht, und hier liegen nun die echten technischen Unterschiede.
Die Endpunktsteuer
Der naive Ansatz wartet auf Stille. Legen Sie den Schwellenwert auf 800 ms fest, und Sie haben jeder Antwort fast eine volle Sekunde hinzugefügt, bevor mit der Verarbeitung begonnen wird. Über ein zehnminütiges Gespräch ist das echte tote Luft, bezahlt durch einen Konfigurationswert. Senken Sie den Schwellenwert, und der Agent beginnt, jeden zu unterbrechen, der innehält, um nachzudenken – also jeden, der sich mitten in einer Kontonummer befindet.
Der Stapel, der das Problem behebt
| Schicht | Was es bewirkt | Repräsentative Implementierungen |
|---|---|---|
| VAD | Klassifiziert jeden Audio-Frame als Sprache oder nicht | Silero VAD – nahezu universeller Zahlungsausfall |
| Endpunktierung | Überwacht den Transkript-Stream auf Abschlusssignale | Endpunktkonfiguration des STT-Anbieters |
| Semantische Wendeerkennung | Vorhersagen verwandeln Vollendung von Bedeutung, können vor Stillschweigen begehen | LiveKit Wendedetektor (Qwen2.5-0.5B Feinabstimmung, CPU-Inferenz, 14 Sprachen); Pipecat Smart Turn |
| Konversations-STT | Erkennen und Abwechseln in einem Modell | Deepgram Flux; Tavus Sparrow-1 |
Flux von eot_threshold um Latenz gegen Genauigkeit abzuwägen, und meldet eine Reduzierung der Agentenreaktionslatenz um 200–600 ms im Vergleich zu herkömmlichem STT-plus-VAD. Tavus meldet sein Sparrow-1-Flussmodell mit einer mittleren Latenz zur Bodenvorhersage von 55 ms.
Konkret ausgedrückt: Der Wechsel von einem 800-ms-Stille-Timeout zu einem semantischen Abbiegedetektor kann mehr Latenz einsparen als alle anderen Optimierungen auf dieser Seite zusammen. Wenn Sie auf der Grundlage der Latenz einkaufen, fragen Sie, welche Abbiegeerkennung die Plattform verwendet und ob Sie diese ändern können – diese Antwort sagt Ihr Erlebnis besser voraus als jeder veröffentlichte p50.
Unterbrechungsbehandlung: Eine Richtlinie, kein Schalter
Barge-In wird normalerweise als ein boolescher Wert angezeigt. Das ist die falsche Form für das Problem und der häufigste Grund dafür, dass ein Agent, der bei der Latenz gut abschneidet, sich immer noch falsch fühlt, mit ihm zu sprechen.
Der Grund dafür ist, dass die Audioqualität eingehender Anrufer keine Rolle spielt. Eine nützliche Taxonomie unterteilt es in sechs Arten, die jeweils ein unterschiedliches Verhalten erfordern:
| Eingabeklasse | Beispiel | Richtiges Verhalten | Fehlersignal |
|---|---|---|---|
| Wahre Korrektur | „Nein, Freitag“ | Stoppen Sie, akzeptieren Sie die Wendung, bewahren Sie den Aufgabenkontext | Der Anrufer wiederholt die gleiche Korrektur |
| Rückkanal | „Ja“, „mm-hm“ | Reden Sie weiter; nicht als Absicht behandeln | Der Agent bricht seine Antwort ab und setzt ihn zurück |
| Hintergrundgeräusche | Tastatur, Verkehr, zweite Stimme | Weiter; eine falsche Unterbrechung protokollieren | Die Wiedergabe stoppt ohne Anrufermitschrift |
| DTMF | Der Anrufer drückt während eines Menüs die 2 | Route nach Ziffer, nicht nach Transkript | Ziffer wird ignoriert oder als Sprache behandelt |
| Lange Entitätspause | Pause mitten in der Kontonummer | Warten; Reagieren Sie nicht zu früh | Der Agent unterbricht, bevor die Entität abgeschlossen ist |
| Eskalation | „Ich will einen Menschen“ | Sofort anhalten und umsteigen | Agent argumentiert |
Der Fehler, der das Vertrauen am schnellsten zerstört, ist der falsche Stopp: Der Anrufer sagt „Okay“, während der Agent mitten im Satz ist, der Agent hält inne und behandelt „Okay“ dann als neue Frage. Bei einem Anruf ist es ein Fehler. Bei Tausenden von Anrufen handelt es sich um einen messbaren Rückgang der Abschlussrate, der sich in keiner Latenzmetrik niederschlägt.
Die richtige Struktur ist eine Richtlinie pro Nachrichtentyp. Begrüßungen können nach einer Kulanzfrist unterbrochen werden; Menüs, die DTMF und Sprache akzeptieren; Entitätserfassung des Patienten; Rechts-, Einwilligungs- und Zahlungsangaben unterbrechungsfrei; Tool-Warte-Füller sofort kündbar; Die Absicht des Menschentransfers wird immer berücksichtigt.
Und instrumentiere es. Die vier Ereignisse, die es wert sind, in jeder Runde protokolliert zu werden, sind der Unterbrechungskandidat, die Entscheidung und die Richtlinienversion, die sie hervorgerufen hat, die Wiederherstellungsposition und bestätigte Fehlalarme. Verfolgen Sie die Rate falscher Unterbrechungen und die Rate verpasster Unterbrechungen als separate Dashboards – sie bewegen sich in entgegengesetzte Richtungen und durch die Mittelung werden beide ausgeblendet. Es gibt ein offenes Szenariopaket für Barge-In-Tests GitHub Das funktioniert mit Vapi, Retell, Bland, Pipecat und dem selbstgehosteten LiveKit.
Die Plattformen
Vapi
Vapi ist die flexibelste Orchestrierungsschicht: Bringen Sie Ihr eigenes STT, LLM, TTS und Ihre eigene Telefonie mit, tauschen Sie diese aus und optimieren Sie die Pipeline. Der Preis für die Orchestrierung beträgt etwa 0,05 $/Minute, wobei jeder zugrunde liegende Anbieter separat abgerechnet wird. Unabhängige Tests belegen, dass ein abgestimmter Stack im Median 500–700 ms und die Standardpipeline deutlich langsamer ist. Wählen Sie es, wenn Sie jede Komponente steuern möchten und bereit sind, die Abstimmung selbst in die Hand zu nehmen; Die Flexibilität ist real, ebenso wie der Konfigurationsaufwand.
Retell AI
Retell ist ein verwalteter Stack mit Schwerpunkt auf strukturierten Dialogabläufen und Unternehmens-Compliance. Etwa 0,055 $/Min. für die Sprachinfrastruktur, mit Pay-as-you-go ab etwa 0,07 $/Min. In einer Studie wurden ca. 600 ms out of the box gemeldet und in einer anderen der letzte Platz – siehe Abschnitt oben. Wählen Sie diese Option, wenn Sie eine unterstützte verwaltete Pipeline mit starker Flusskontrolle anstelle eines Komponentenkits wünschen.
Bland AI
Bland nutzt gebündelte Preise – Speech-to-Text, LLM, Text-to-Speech und Telefonie in einem Tarif von 0,09–0,14 $/Min. und ist speziell für ausgehende Anrufe mit hohem Volumen konzipiert. Je nach Pathway-Komplexität werden etwa 700–900 ms gemessen. Das Paket ist kommerziell wirklich einfacher zu verstehen; Der Nachteil besteht darin, dass die Kontrolle über jede Ebene geringer ist.
ElevenLabs Agents
Basierend auf der angesehensten Sprachsynthese in dieser Kategorie, deren Flash-Modell die Synthese in etwa 75 ms durchführt. Agenten berechnen ab etwa 0,08 $/Minute für Jahresgeschäftspläne und etwa 0,10 $/Minute für Creator und Pro, wobei die LLM-Tokens separat weitergegeben werden und die Minutenkontingente auf jeder Stufe gebündelt sind. SIP-Trunking verbindet bestehende Telefonanlagen – Twilio, Bemerkenswert ist, dass es im Recorded-Audio-Benchmark das engste Tail-Ratio verzeichnete, was wichtiger ist als ein guter Median.
Telnyx
Die Unterscheidungseigenschaft ist die vertikale Integration: Telnyx besitzt das Trägernetzwerk, über das die Audiodaten übertragen werden, und sein Architekturbudget von 450 ms ergibt sich aus der gemeinsamen Anordnung des Stapels und nicht aus schnelleren Modellen. Es verzeichnete den niedrigsten Medianwert in der Audioaufzeichnungsstudie und den niedrigsten Carrier-RTT in der Verkehrsstudie. Wählen Sie es, wenn die Telefonie ein erstklassiges Anliegen ist.
OpenAI Realtime
Keine Plattform, sondern ein Modell und zunehmend das, worauf Plattformen aufbauen. Die Echtzeit-API unterstützt drei Transporte – WebRTC für Browser, WebSocket für Server und SIP, um einen echten Telefonanruf direkt in eine Sitzung weiterzuleiten. Es handelt sich um natives Speech-to-Speech: Audioeingang, Audioausgang, kein zwischenzeitlicher Textengpass und die Prosodie bleibt während der gesamten Runde erhalten. Die Preise basieren auf Tokens und nicht auf Minutenbasis, was zu einer großen effektiven Spanne führt, je nachdem, wie diszipliniert Sie mit Kontext und Caching umgehen. Wählen Sie es, wenn Sie die niedrigste erreichbare Turn-Latenz wünschen und die umgebende Orchestrierung aufbauen können; Vermeiden Sie es, wenn Sie die Zwischenbegründung protokollieren, prüfen oder einschränken müssen, da kein Text zu prüfen ist.
Synthflow, Twilio ConversationRelay und der Rest
Synthflow Die Sprach-Engine kostet etwa 0,09 US-Dollar pro Minute und verfügt über einen No-Code-Builder, der sich eher an Bediener als an Ingenieure richtet. Twilio's ConversationRelay fügt einen KI-Agenten an die bestehende Telefonieanlage von Twilio an, mit intern gemeldeten 491 ms p50 und 713 ms p95 – attraktiv, wenn Ihre Anrufinfrastruktur bereits dort angesiedelt ist.
Selbst bauen: Pipecat- und LiveKit-Agenten
Beide sind Open Source und beide sind wirklich produktionstauglich.
Pipecat, ursprünglich von Daily entwickelt, modelliert einen Sprachagenten als eine Pipeline von Prozessoren, durch die Audio und Text fließen, mit einer sehr großen Plugin-Bibliothek und nahezu täglicher Entwicklung. Pipecat Cloud erreichte im Jahr 2026 nach einer Beta mit mehr als tausend Teams die allgemeine Verfügbarkeit, sodass der verwaltete Pfad vorhanden ist, wenn Sie ihn wünschen.
LiveKit-Agenten basiert auf dem Medienserver WebRTC von Ein Team berichtete öffentlich über den Umbau eines Telefonagenten von Pipecat auf LiveKit-Agenten, als ein Client von 20 auf 400 gleichzeitige Anrufe skaliert wurde.
Selbsthosting kann bei einem Volumen von deutlich unter 0,05 $/Min. landen. Sie tauschen Plattformgebühren für Infrastruktur-, Bereitschafts- und Latenzoptimierungsarbeiten ein – was in großem Maßstab ein guter Handel ist, aber ein schlechter, bevor Sie die Produktmarkttauglichkeit gefunden haben.
Was es tatsächlich kostet
Der häufigste Budgetierungsfehler in dieser Kategorie ist der Vergleich eines reinen Plattformtarifs mit einem Pakettarif.
| Plattform | Schlagzeilenrate | Was das abdeckt | Realistisches All-In |
|---|---|---|---|
| Vapi | 0,05 $/Min | Nur Orchestrierung | ~0,25–0,33 $/Min., sobald STT, LLM, TTS und Telefonie hinzugefügt werden |
| Retell | 0,055 $/Min | Sprachinfrastruktur | Ab ca. 0,07 $/Min. bei nutzungsbasierter Bezahlung |
| Bland | 0,09–0,14 $/Min | Alles gebündelt | Ungefähr die Schlagzeilenrate |
| Synthflow | 0,09 $/Min | Sprachmotor | Plus LLM und Telefonie |
| ElevenLabs Agents | 0,08–0,10 $/Min | Plattform + Stimme | Plus weitergeleitete LLM-Token |
| OpenAI Realtime | Tokenbasiert | Nur das Modell | Sehr variabel; Caching und Kontextdisziplin dominieren |
| Selbstgehostet (Pipecat / LiveKit) | Infrastruktur | Nichts gebündelt | Kann bei Volumen unter 0,05 $/Minute zuzüglich Entwicklungszeit liegen |
Komponenten-Referenzpunkte für die Erstellung Ihrer eigenen Schätzung: Telefonie etwa 0,014 $/Min., Sprach-zu-Text-Streaming etwa 0,008 $/Min., Premium-TTS etwa 0,05 $/Min. und ein kleines, schnelles LLM etwa 0,01 $/Min. Auf dem gesamten Markt liegen die Tarife für Vollversionen im Jahr 2026 in etwa einer sechsfachen Spanne, von etwa 0,05 $/Minute bei den aggressivsten Selbstbedienungsplänen bis zu etwa 0,31 $/Minute bei den Premium-Enterprise-Tarifen.
Eine strukturelle Anmerkung: Prompt-Caching ist kein Rundungsfehler bei einem Sprachagenten. Ihre Systemaufforderung – Persona, Leitplanken, Geschäftsregeln, Wissen – ist bei jedem einzelnen Anruf identisch. Der Preis für zwischengespeicherte Eingaben in Echtzeitmodellen beträgt nur einen Bruchteil der Standardeingabe. Durch die Aktivierung des Cachings ändern sich die Modellkosten häufig um eine Größenordnung, und dies ist das Erste, was überprüft werden sollte, bevor jemand ein Downgrade auf ein schlechteres Modell vorschlägt, um Geld zu sparen.
Compliance ist hier nicht optional
Telefon-Agenten sind regulatorischen Risiken ausgesetzt, die bei Browser-Agenten nicht der Fall sind.
In den Vereinigten Staaten die FCC Feststellungsurteil vom Februar 2024 bestätigte, dass KI-generierte Stimmen gemäß TCPA eine „künstliche oder aufgezeichnete Stimme“ sind. Dazu gehören Einwilligungsanforderungen für Anrufe zu Mobilfunk- und Privatanschlüssen, Identifizierungs- und Offenlegungspflichten sowie die Handhabung des Opt-out – mit einem gesetzlichen Schadensersatz von 500 US-Dollar pro Verstoß, der bei vorsätzlichen Verstößen auf 1.500 US-Dollar ansteigt. Es wird erwartet, dass gegen Ende 2026 oder Anfang 2027 eine weitere FCC-Regelung zu KI-generierten Anrufen abgeschlossen wird. Das weithin erwartete Ergebnis ist eine explizite Anforderung zur KI-Identifizierung zu Beginn des Anrufs sowie eine Einwilligungserklärung, die KI spezifisch benennt.
In der EU gilt Artikel 50 des KI-Gesetzes seit dem 2. August 2026 und verlangt, dass Menschen darüber informiert werden, dass sie mit KI interagieren. Auf Bundesstaatsebene in den USA tritt der Colorado AI Act im Jahr 2026 in Kraft und könnte einen Großteil dieser Kategorie als hochriskant einstufen.
Die praktische Vorgehensweise ist einfach und kostet Sie nichts: Geben Sie in der Eröffnungszeile Bescheid, führen Sie die Einwilligungsaufzeichnung, respektieren Sie Opt-outs sofort und sorgen Sie dafür, dass die Übertragung jederzeit möglich ist. Der Einbau ist heute bei jedem dieser Systeme günstiger als die Nachrüstung.
Benchmarken Sie es selbst
Angesichts der Tatsache, dass zwei glaubwürdige Studien die gleichen Rankings umgekehrt haben, sollten Sie sich nur auf Ihre eigenen Zahlen stützen. Dieses Protokoll dauert einen Tag.
- Erstellen Sie ein festes Skript. Zwanzig bis dreißig Runden decken Ihren tatsächlichen Anwendungsfall ab, einschließlich mindestens einer langen Nummer, einer Korrektur und einer Anfrage für einen Menschen.
- Zeichnen Sie beide Etappen auf einer Uhr auf. Verwenden Sie keine von der Plattform gemeldeten Zeitvorgaben. Sie schließen Teile des Weges aus, den Ihr Anrufer erlebt. Erfassen Sie das eigentliche Gesprächsaudio.
- Messen Sie die Zeit bis zum ersten Audiobyte ab dem Ende der Anruferrede, wobei ein VAD für die Aufzeichnung anstelle des Ereignisstroms eines Anbieters verwendet wird.
- Endpointing standardisieren auf jeder Plattform, die Sie testen, oder Sie vergleichen eher die Konfiguration als die Architektur.
- Melden Sie p50 und p95 separat. plus das Heckverhältnis und die Anzahl der Runden, die du abwerfen musstest. Eine Plattform, die gelegentlich nichts produziert, ist schlechter als eine Plattform, die durchweg etwas langsamer ist.
- Führen Sie die sechs Unterbrechungskurse durch aus der Tabelle oben als separate Testfälle und bewerten Sie Fehlstopps und verpasste Stopps unabhängig voneinander.
- Test unter Last. Jede Plattform sieht bei einem einzigen Anruf gut aus. Bei der Parallelität verschlechtern sich die Mediane und die Enden explodieren.
- Testen Sie bei einer schlechten Verbindung und von einem Mobiltelefon in einem fahrenden Auto, nicht von einem Schreibtisch über Glasfaser.
Das Fazit
Die Plattformen in dieser Kategorie liegen näher beieinander, als ihr Marketing vermuten lässt, und die Lücke zwischen zwei von ihnen ist kleiner als die Lücke zwischen einer gut abgestimmten und einer schlecht abgestimmten Bereitstellung einer der beiden.
Drei Dinge sind wichtiger als der Anbieter, den Sie auswählen. Turn-Erkennung, weil sie den größten wiederherstellbaren Teil der Latenz darstellt und den Unterschied zwischen einem Agenten, der sich präsent anfühlt, und einem Agenten, der sich wie ein Telefonbaum anfühlt, ausmacht. Unterbrechungsrichtlinie, denn sie entscheidet darüber, ob Anrufer der Sache nach dem ersten Missverständnis vertrauen. Und die Endlatenz, denn Ihr p95 ist das, was Ihre Kunden tatsächlich erleben, und das ist ungefähr der Punkt, an dem sie auflegen.
Jeder Anbieter zeigt Ihnen einen Median. Fragen Sie nach dem p95, fragen Sie, wie es gemessen wurde, und messen Sie es dann selbst.
