Alle Artikel
Echtzeit-KI

Wie Live-KI-Agent-Erfahrungen tatsächlich funktionieren: Ein Praxisleitfaden

Ein herstellerneutraler Leitfaden für Echtzeit-Konversationsagenten bei Veranstaltungen, in Schulungsräumen und im öffentlichen Raum. Es gibt eine Kategorie von KI-Produkten, die sich anders verhält als die, die die meisten Teams entwickelt haben. Es gibt kein Chat-Fenster, keine Senden-Schaltfläche und keine… Weiterlesen »

Von Om KamathLesezeit: 15 Minuten
Ein Messebesucher spricht mit einem Live-KI-Agentenkiosk, der eine leuchtende Hörkugel zeigt

Ein herstellerneutraler Leitfaden für Echtzeit-Konversationsagenten bei Veranstaltungen, in Schulungsräumen und im öffentlichen Raum

Es gibt eine Kategorie von KI-Produkten, die sich anders verhält als die, die die meisten Teams entwickelt haben. Es gibt kein Chatfenster, keinen Senden-Button und keine Geduld. Jemand kommt hinzu, öffnet den Mund und die Uhr beginnt. Wenn die Antwort innerhalb einer halben Sekunde eintrifft, fühlt es sich an wie ein Gespräch. Wenn es innerhalb von zwei Sekunden landet, geht die Person, die dort steht, davon aus, dass es kaputt ist, und geht weg.

Hierbei handelt es sich um Live-Agenten: sprachgesteuerte Echtzeitsysteme, die ein Gespräch im selben Raum oder im selben Anruf wie ein Mensch führen. Sie tauchen an Messeständen, in Schulungssimulationen, an Museumskiosken, an Hotelrezeptionen und hinter Telefonnummern auf. Und sie scheitern auf eine Art und Weise, wie es ein Text-Chatbot niemals tut.

In diesem Artikel geht es darum, wie diese Kategorie tatsächlich funktioniert. Es handelt sich nicht um einen Produkt-Pitch und es handelt sich nicht um eine Auflistung von Tools. Es ist die technische und gestalterische Realität, etwas zu bauen, das einem Fremden in weniger als einer Sekunde antworten muss, in einem lauten Raum, ohne eine zweite Chance.

Was „leben“ eigentlich bedeutet

Die bestimmende Einschränkung ist nicht die Intelligenz. Es ist Zeit.

Im Jahr 2009 veröffentlichte ein Team von Linguisten unter der Leitung von Tanya Stivers eine Studie in PNAS Messung der Kluft zwischen Sprechern in gewöhnlichen Gesprächen in zehn Sprachen auf fünf Kontinenten – Englisch, Japanisch, Dänisch, Laotisch, Italienisch, Koreanisch, Niederländisch, Tzeltal, Yélî-Dnye und ‡Ākhoe Hai||om. Der Befund war bemerkenswert einheitlich. Jede Sprache zeigte eine einstufige Verteilung der Antwortoffsets, wobei der Modus zwischen 0 und +200 Millisekunden lag und der sprachübergreifende Median bei etwa +100 ms lag.

An dieser Zahl wird Ihr System gemessen. Nicht durch einen Maßstab, sondern durch ein Nervensystem, das seit der Kindheit darauf kalibriert wurde.

Niemand erwartet, dass eine Maschine 100 ms erreicht. Aber die Wahrnehmungsklippe ist real und in der Praxis gut dokumentiert: Etwa 800 ms beginnt eine Reaktion als merklich verzögert zu lesen; Nach etwa 1.500 ms kommen die meisten Menschen zu dem Schluss, dass etwas schief gelaufen ist, und wiederholen sich entweder oder schalten ab. In einer Live-Umgebung, in der eine Person physisch vor einem Bildschirm steht, ist dieser Schwellenwert höher als beim Telefonieren, da die Umgebung keine Netzwerkverzögerung erwartet, um ihn aufzufangen.

Dies ist keine subjektive Präferenz. In einer unabhängigen Blindstudie mit 178 Teilnehmern zu Echtzeit-Avatarsystemen war die Reaktionsfähigkeit der stärkste Prädiktor für das gesamte Benutzererlebnis – eine Spearman-Korrelation von 0,697, vor der visuellen Qualität. Die Nutzer konnten nicht sagen, welches Modell das bessere Gesicht darstellte. Sie konnten einem sofort und zuverlässig sagen, wer sich lebendig fühlte.

Die Anatomie eines Live-Agenten

Unter der Haube ist fast jeder Live-Agent eine von zwei Architekturen.

Die kaskadierte Pipeline Verkettet diskrete Modelle: Audio geht ein, ein Speech-to-Text-Modell transkribiert es, eine Logik entscheidet, dass der Benutzer mit dem Sprechen fertig ist, ein Sprachmodell erzeugt eine Antwort, ein Text-to-Speech-Modell synthetisiert Audio und das Audio wird abgespielt. Jede Stufe ist austauschbar, beobachtbar und unabhängig einstellbar. Jede Stufe erhöht auch die Latenz.

Das Speech-to-Speech-Modell bricht diese Kette zusammen. Audio geht in ein einziges multimodales Modell und Audio kommt heraus, ohne zwischenzeitlichen Textengpass. Dies bieten die Realtime API von OpenAI und Gemini Live von Google. Es ist schneller und bewahrt die Prosodie – Ton, Zögern, Betonung –, die ein Transkript wegwirft. Außerdem haben Sie dadurch deutlich weniger Kontrolle darüber, was in der Mitte passiert, was wichtig ist, wenn Sie das Verhalten protokollieren, prüfen oder einschränken müssen.

Die meisten Produktionssysteme im Jahr 2026 sind Hybride: ein Echtzeitmodell, das die Konversationsoberfläche verwaltet, wobei Tool-Aufrufe für alles, was echte Arbeit erfordert, an langsamere, leistungsfähigere Modelle weitergeleitet werden.

Wo die Zeit vergeht

Telnyx hat eine nützliche Zerlegung eines Voice-Turns veröffentlicht, in der ein dicht nebeneinander angeordneter Stapel mit einem typischen Stapel verglichen wird, der von verschiedenen Anbietern in verschiedenen Regionen zusammengestellt wird:

Bühne Zusammengelegter Stapel Typischer genähter Stapel
Netzwerk / Verkehr 45 ms 150 ms
Speech-to-Text 100 ms 225 ms
LLM-Schlussfolgerung 225 ms 650 ms
Text-zu-Sprache 80 ms 185 ms
Insgesamt 450 ms 1.210 ms

Zwei Dinge fallen auf. Erstens ist das LLM der größte Einzelposten in beiden Spalten – weshalb die Umleitung einfacher Gesprächsrunden auf ein kleines, schnelles Modell und die Reservierung eines größeren Modells für echte Argumentation die Optimierung mit dem höchsten verfügbaren Hebel ist. Zweitens besteht der Unterschied zwischen den beiden Spalten nicht in der Intelligenz. Es ist Geographie und Sanitär. Die gleichen Modelle, schlecht arrangiert, kosten Sie eine Dreiviertelsekunde.

Wenn Sie ein gerendertes Gesicht hinzufügen, planen Sie zusätzlich 150–200 ms für die Avatar-Generierung ein und gehen Sie davon aus, dass die visuelle Ebene eine eigene Sitzungsbeitrittsverzögerung hinzufügt, bevor der erste Frame erscheint.

Das schwierigste Problem besteht darin, zu wissen, wann man sprechen muss

Fragen Sie jeden, der einen Live-Agenten geschickt hat, was zuerst kaputt gegangen ist, und er wird nicht das Sprachmodell nennen. Sie werden Abwechseln sagen.

Das System muss eine Frage beantworten, die Menschen unbewusst lösen und Maschinen schlecht lösen: Hat diese Person aufgehört zu reden oder denkt sie nur nach? Wenn Sie in einer Richtung etwas falsch machen, unterbricht der Agent jemanden mitten im Satz. Wenn der andere etwas falsch macht, sitzt der Agent schweigend da, während die Person wartet, und dann fangen beide gleichzeitig an zu reden.

Es gibt vier allgemeine Ansätze, die eher aufeinander aufbauen als miteinander konkurrieren.

1. Sprachaktivitätserkennung (VAD)

Ein kleines Modell klassifiziert jeden Audio-Frame als Sprache oder Nicht-Sprache. Silero VAD ist die nahezu universelle Standardeinstellung. VAD ist schnell, günstig und robust gegenüber ständigen Hintergrundgeräuschen – aber es funktioniert ausschließlich mit Audio. Es weiß, dass der Ton aufgehört hat. Es hat keine Ahnung, ob der Satz zu Ende ist.

2. Endpunktierung

Logik, die das Streaming-Transkript überwacht und entscheidet, dass die Äußerung abgeschlossen ist, normalerweise nach einer Schweigeschwelle. Das Problem ist arithmetischer Natur: Ein Stille-Timeout von 800 ms fügt fast eine ganze Sekunde hinzu jede einzelne Antwort, bevor mit der Verarbeitung begonnen wird. Bei einem zehnminütigen Gespräch sind das Minuten toter Luft, die Sie durch die Konfiguration bezahlt haben.

3. Semantische Wendeerkennung

Ein kleiner Klassifikator liest das Teiltranskript und sagt den Abschluss der Runde eher anhand der Bedeutung als anhand der Stille voraus. „Meine Kontonummer ist vier sieben …“ ist offensichtlich unvollständig; „Das ist alles, danke“ ist es offensichtlich nicht. LiveKit liefert ein Drehdetektor für offene Gewichte Feinabstimmung von Qwen2.5-0.5B-Instruct für CPU-Inferenz mit geringer Latenz, Abdeckung von 14 Sprachen. Pipecat behält Smart Turn als offene Alternative bei. Denn diese Modelle können eine Wendung begehen vor Das Schweigen vergeht, sie fordern die Endpunktsteuer zurück.

4. Speziell entwickelte Konversationssprachmodelle

Der neueste Ansatz wandelt die Erkennung in das Erkennungsmodell selbst um. Deepgram's Flussmittel, das seit April 2026 allgemein in mehrsprachiger Form verfügbar ist, meldet eine mittlere End-of-Turn-Erkennung bei 260 ms mit einem konfigurierbaren Schwellenwert, um Latenz gegen Genauigkeit auszugleichen, und gibt eine Reduzierung der Agentenreaktionslatenz um 200–600 ms im Vergleich zu herkömmlichem STT plus VAD an. Tavus verfolgt mit seinem Sparrow-Konversationsflussmodell einen ähnlichen Ansatz und nutzt lexikalische, semantische, prosodische und akustische Hinweise zusammen.

Ansatz Signal verwendet Latenz hinzugefügt Charakteristischer Fehler
Nur VAD Audioenergie Entspricht der Stilleschwelle Unterbricht jeden, der innehält, um nachzudenken
STT-Endpunktierung Transkript-Stream Mäßig Das Gleiche, etwas schlauer
Semantisches Modell Teilweise Transkriptbedeutung Niedrig; kann Schweigen verhindern Falsche Commits bei unvollständigen Sätzen
Konversations-STT Audio + lexikalisch + prosodisch Am niedrigsten Weniger Kontrolle; neuer, weniger kampferprobt

Unterbrechung ist eine Richtlinie, keine Einstellung

Barge-in – der Benutzer lässt den Agenten mitten im Satz abschneiden – wird normalerweise als einzelner boolescher Wert angezeigt. Das ist ein Fehler und die häufigste Ursache dafür, dass sich ein Agent „falsch anfühlt“, ohne dass jemand sagen kann, warum.

Das Problem besteht darin, dass nicht alle eingehenden Audiosignale dasselbe bedeuten. Eine nützliche Taxonomie, die aus dem Unterbrechungs-Runbook von Hamming übernommen wurde, unterteilt es in sechs Klassen:

Eingabe Beispiel Richtiges Verhalten
Wahre Korrektur „Nein, Freitag“ Stoppen Sie sofort, akzeptieren Sie die neue Runde und behalten Sie den Aufgabenkontext bei
Rückkanal „mm-hm“, „ja“, „richtig“ Reden Sie weiter; nicht als neue Absicht behandeln
Zufälliger Lärm Tastatur, HVAC, angrenzendes Gespräch Ignorieren und an einem sicheren Punkt fortfahren
Lange Entitätspause Mitten in einer Kontonummer Warte; Reagieren Sie nicht zu früh
Stille-Timeout Person ist abgewandert Einmal erneut auffordern und dann zurücksetzen
Sicherheitseskalation „Ich will einen Menschen“ Halten Sie an und geben Sie sofort ab

Der Fehler, der das Vertrauen am schnellsten untergräbt, ist der falsche Stopp: ein Agent, der mitten im Satz anhält, weil jemand „okay“ gesagt hat, und dann „okay“ als neue Frage behandelt. Es liest sich wie ein Agent, der nicht zuhört. In einer lauten Umgebung, in der VAD ständig auf Umgebungsgeräusche feuert, wird eine naive Einschalteinstellung dies Dutzende Male pro Stunde erzeugen.

Der Fix ist eine Richtlinie pro Nachrichtentyp. Eine Begrüßung sollte nach einer kurzen Nachfrist unterbrechbar sein. Ein Menü sollte DTMF und Sprache akzeptieren. Die Entitätserfassung sollte geduldig sein. Eine rechtliche Offenlegung oder Einwilligungserklärung sollte überhaupt nicht unterbrechbar sein. Ein „Lass mich mal nachschauen“-Füller sollte sofort stornierbar sein.

Wo Live-Agenten tatsächlich passen

Die ehrliche Version dieses Abschnitts enthält die Stellen, an denen das Format seinen Preis nicht verdient.

Einstellung Warum das Format passt Was eigentlich kaputt geht
Messen und Konferenzen Neuheit stoppt Fußgängerverkehr; Der Agent qualifiziert sich, während das Personal beschäftigt ist. erfasst, was die Leute tatsächlich fragen Umgebungsgeräusche nahe 80 dB; unzuverlässiges WLAN am Veranstaltungsort; Besucher kommen in Gruppen, nicht einzeln
Training & Probe Unbegrenzte Wiederholungen eines schwierigen Gesprächs ohne soziale Kosten; konsistente Wertung; In der Nachbesprechung geschieht das Lernen Szenariorealismus ist schwierig; Lernende spielen den Simulator; Die Qualität des Feedbacks ist wichtiger als die Simulation
Öffentliche Kioske (Museen, Transit, Bürger) Standardmäßig mehrsprachig; nie müde; echte Zugänglichkeitsgewinne für Menschen, die keinen Touchscreen verwenden können Erwartungen an die Privatsphäre im öffentlichen Raum; Vandalismus und Missbrauch; lange unbeaufsichtigte Betriebszeit; muss offline ordnungsgemäß abgebaut werden
Rezeption und Concierge Deckt Nebenzeiten und Überlastung ab; beantwortet die gleichen fünfzehn Fragen perfekt Alles Interessante ist eine Ausnahme; Der Eskalationspfad ist das gesamte Produkt
Telefonleitungen Unendliche Parallelität; keine visuelle Ebene zum Rendern; ein ausgereiftes, gut verstandenes Transportmittel Regulatorische Belastung; Trägerlatenz; Anrufer legen schneller auf, als sie weggehen
Verkaufsfläche Produktsuche und -vergleich am Regal Lärm, Gedränge und eine starke Tendenz der Menschen, einen Menschen zu bevorzugen, der drei Meter entfernt ist
Wo es nicht passt Alles, was eine kontinuierliche Lektüre, eine präzise Dateneingabe, eine komplexe Dokumentenprüfung oder eine Entscheidung erfordert, über die der Besucher länger als eine Minute nachdenken muss. Live-Konversation ist eine schlechte Schnittstelle für alles, was nicht konversationell ist.
Eine Person probt ein Gespräch mit einem echten KI-Agenten auf einem Wanddisplay in einem ruhigen Übungsraum

Beim Training geht es für Live-Agenten am wenigsten um Neuheiten und vor allem um Wiederholungen. Bild generiert mit GPT Image 2.

Eine Durchfahrtsbestellung ist ein nützlicher Anhaltspunkt für die Einschränkungen in diesem Artikel: Motorgeräusche, eine Warteschlange hinter dem Auto und ein Anrufer, der sich mitten im Satz korrigiert. Demo veröffentlicht von Deepgram.

Das Muster, das gute Bereitstellungen von Demos unterscheidet

In allen oben genannten Einstellungen haben die Bereitstellungen, die Ergebnisse liefern, eine gemeinsame Eigenschaft: den Agenten macht etwas während des Gesprächs, anstatt nur Fragen zu beantworten.

Ein Standagent, der antwortet: „Was macht Ihr Produkt?“ ist eine sprechende Broschüre. Ein Standagent, der die Firmen-URL eines Besuchers nimmt und in sechzig Sekunden eine einseitige Analyse auf dem Bildschirm erstellt, hat die Transaktion geändert: Der Besucher hat nun einen Grund, Ihnen eine E-Mail-Adresse zu geben, und einen Grund, das Erlebnis anschließend einem Kollegen zu schildern. Ein Trainingsagent, der ein Rollenspiel durchführt, ist nützlich; Ein Schulungsagent, der mit einer bewerteten, spezifischen Nachbesprechung endet, ist ein Produkt.

Das Gespräch ist die Schnittstelle. Das Artefakt ist der Wert.

Der Raum ist der schwierigste Teil

Dies ist der Abschnitt, der übersprungen wird und der bestimmt, ob das Ding an dem Tag funktioniert.

Overhead-Flatlay der Installationshardware für Live-KI-Agenten: Touchscreen-Panel, Richtmikrofon, USB-Freisprecheinrichtung, Webcam, Mobilfunk-Hotspot, Ethernet-Kabel und VESA-Halterung

Die Stückliste, die darüber entscheidet, ob die Software am jeweiligen Tag funktioniert. Die Freisprecheinrichtung mit Hardware-Echounterdrückung ist die günstigste Lösung mit dem größten Risiko. Bild generiert mit GPT Image 2.

Lärm. In einer Messehalle ist es so laut, dass die Spracherkennung am offenen Mikrofon häufiger scheitert als gelingt. Die praktischen Antworten sind ein Richt- oder Beamforming-Mikrofon, eine Push-to-Talk- oder Tap-to-Talk-Funktion und ein sichtbarer Text-Fallback. Eine USB-Konferenz-Freisprecheinrichtung mit akustischer Hardware-Echounterdrückung ist die kostengünstigste Lösung für das größte Risiko, da ohne sie die Lautsprecher des Bildschirms in das Mikrofon zurückgekoppelt werden und der Agent sich selbst unterbricht.

Konnektivität. WLAN am Veranstaltungsort ist ein Münzwurf. Bringen Sie einen Mobilfunk-Hotspot mit, verbinden Sie das Gerät über Ethernet damit und speichern Sie eine Reihe vorgefertigter Antworten zwischen, damit die Anziehungsschleife und die Basisantworten einen Ausfall überstehen.

Sitzungshygiene. Ein Hard-Reset zwischen Besuchern ist nicht optional. Niemand sollte jemals die E-Mail-Adresse, den Firmennamen oder das Gespräch der vorherigen Person auf dem Bildschirm sehen. Erstellen Sie eine Zeitüberschreitung, die die Anzeige wieder in den Anziehungsmodus versetzt, wenn jemand mitten im Satz abweicht – was er ständig tun wird.

Sitzungslimits. Für Echtzeitsitzungen gibt es eine zeitliche Obergrenze und diese sinkt. Bauen Sie eine Wiederverbindung auf, die eine kurze Zusammenfassung in die neue Sitzung einfügt, sonst vergisst der Agent mitten im Gespräch vor einer Menschenmenge den Namen einer Person.

Leitplanken. Ein Live-Agent sollte niemals individuelle Preise anbieten, einen Zeitplan versprechen oder eine Verpflichtung eingehen. Alles, was in Deal-Form geht, überlassen Sie es einem Menschen. Es lohnt sich, dies in der Systemeingabeaufforderung durchzusetzen und in einer Post-Generierungsprüfung, da der Fehler öffentlich und zitierfähig ist.

Sollte es dich sehen?

Kameras sind die verlockendste und gefährlichste Ergänzung zu einem Live-Agenten.

Die wirklich nützlichen Anwendungen sind begrenzt: Erkennen, dass sich jemand genähert hat und auf den Bildschirm blickt, damit das System aufwachen kann; Zählen, wie viele Personen anwesend sind, damit es sich anpassen kann; bemerken, dass jemand weggeschaut hat, sodass es innehalten kann; und das Lesen von etwas, das eine Person absichtlich hochhält – ein Abzeichen, eine Visitenkarte, ein Telefon, auf dem ihre Website angezeigt wird. Letzteres ist das stärkste, da es sich ausdrücklich um eine Opt-in-Option handelt. „Halten Sie Ihren Ausweis in die Kamera“ ist eine natürliche Anweisung, mit der Sie einen Firmennamen erhalten, ohne dass jemand tippen muss.

Zwei Dinge sollte es nicht tun: das Aussehen von jemandem kommentieren und jemanden erkennen, der ihn früher besucht hat. Beides liest sich zwei Sekunden lang als Partytrick und danach als Überwachung.

Es gibt auch eine Kostenfalle, die Teams zu spät erwischt. Multimodale Echtzeit-APIs rechnen pro Runde anhand des akkumulierten Sitzungskontexts ab. Bei einer kontinuierlich streamenden Kamera steht jedes Bild, das Sie bereits gesendet haben, in diesem Kontext und wird bei jedem weiteren Durchgang neu berechnet. Eine achtstündige Sitzung mit offener Kamera führt zu einer Rechnung, die wirklich beunruhigend ist. Die architektonische Antwort besteht darin, die Anwesenheitserkennung lokal zu halten – ein geräteinternes Modell wie das von MediaPipe Pose Wahrzeichen oder Gesicht Wahrzeichen läuft offline und sofort – und öffnet die kostenpflichtige Echtzeitsitzung erst, wenn eine Person tatsächlich beteiligt ist. Senden Sie Frames sparsam, vielleicht einen pro Sekunde, während sie aktiv sind, oder nur bei Bedarf, und schließen Sie die Sitzung sofort, wenn sie verlassen werden. Als Bonus kostet der Attract-Modus dann nichts und benötigt kein Netzwerk.

Offenlegung, Einwilligung und die neuen Regeln

Ab dem 2. August 2026 gilt Artikel 50 des EU-KI-Gesetzes. Es erfordert, dass KI-Systeme, die direkt mit natürlichen Personen interagieren, so konzipiert sind, dass die Menschen darüber informiert werden, dass sie mit KI interagieren, und dass synthetische oder manipulierte Inhalte klar und bei der ersten Offenlegung offengelegt werden. Eine Organisation, die überhaupt keine Hochrisiko-KI hat, kann diesen Verpflichtungen dennoch voll und ganz nachkommen, indem sie einfach einen kundenorientierten Gesprächsagenten oder einen synthetischen Präsentator einsetzt. Die Europäische Kommission hat veröffentlicht Richtlinien darüber, wie die Verpflichtungen gelten.

Bei den Telefonanschlüssen in den Vereinigten Staaten ist die Situation seit der FCC geklärt Feststellungsurteil vom Februar 2024, die bestätigte, dass KI-generierte Stimmen gemäß TCPA als „künstliche oder aufgezeichnete Stimmen“ gelten. Das bringt Einwilligungs-, Identifizierungs-, Offenlegungs- und Opt-out-Anforderungen sowie gesetzliche Schadensersatzforderungen mit sich, die bei 500 US-Dollar pro Verstoß beginnen.

Jenseits des rechtlichen Rahmens sind die Praktiken, die in einem physischen Raum Bestand haben, unrühmlich:

  • Geben Sie im ersten Satz an, dass es sich um eine KI handelt, nicht in einer Fußzeile.
  • Bringen Sie mit einer Kamera oder einem Mikrofon eine sichtbare Beschilderung an jeder Installation an.
  • Kamerabilder verarbeiten und verwerfen; Beharren Sie nicht darauf und seien Sie in der Lage, dies ehrlich zu sagen, wenn jemand danach fragt.
  • Verwenden Sie eine Hardware-Anzeige – einen physischen Verschluss oder eine LED, die nur während einer aktiven Sitzung leuchtet.
  • Überprüfen Sie den Veranstaltungsortvertrag. Einige Konferenzvereinbarungen schränken die Aufzeichnung vor Ort ein, und „wir streamen nur, nicht aufnehmen“ ist eine Unterscheidung, die der Veranstalter möglicherweise nicht akzeptiert.
  • Wenn Sie in einem Land, in dem es ein biometrisches Datenschutzgesetz gibt, Gesichts- oder Stimmabdrücke erfassen, holen Sie zunächst eine schriftliche Einwilligung ein. Insbesondere BIPA von Illinois verfügt über ein privates Klagerecht.

Was zu messen ist

Die meisten Live-Agent-Bereitstellungen werden anhand von Vibes bewertet. Die Instrumentierung, die Ihnen tatsächlich etwas sagt:

Metrisch Warum es wichtig ist
Zeit bis zum ersten Audiobyte, S. 50 und S. 95 Der Median gibt an, wie sich Ihre Demo anfühlt; p95 ist das, worauf Ihre Benutzer Lust haben. Bei der Tail-Latenz ziehen sich Menschen zurück.
Falsche Unterbrechungsrate Rauschen oder Rückkanäle werden mit einer echten Kurve verwechselt. Der Hauptgrund für „es fühlt sich kaputt an“.
Rate verpasster Unterbrechungen Echte Korrekturen werden ignoriert. Bringt Menschen dazu, sich zu wiederholen und aufzugeben.
Umdrehungen pro Sitzung One-Turn-Sitzungen bedeuten, dass die Eröffnung fehlgeschlagen ist. Sitzungen mit 15 Runden können bedeuten, dass der Agent keine Lösung findet.
Abbruchpunkt Wo im Strom die Leute weggehen oder auflegen. Normalerweise eine bestimmte Aufforderung.
Eskalationsrate und Qualität Die Übergabe ist ein Erfolg und kein Misserfolg – vorausgesetzt, die Übergabe trägt einen Kontext.
Protokoll unbeantworteter Fragen Das wertvollste Ergebnis einer öffentlichen Bereitstellung. Es handelt sich um eine kostenlose Positionierungsforschung.

Protokollieren Sie beide Seiten des Audios auf einer Uhr. Ohne eine gemeinsame Uhr können Sie die tatsächliche Latenz nicht messen, sondern nur das, was Ihr eigener Stack über sich selbst meldet – und diese beiden Zahlen können um eine ganze Sekunde voneinander abweichen.

Eine Checkliste vor dem Flug

Vor jeder Live-Bereitstellung laufen die Dinge ungefähr in der folgenden Reihenfolge schief:

  1. Messen Sie die P50- und P95-Turn-Latenz anhand aufgezeichneter Audiodaten, nicht anhand Ihrer eigenen Protokolle.
  2. Testen Sie mit echten Hintergrundgeräuschen und der tatsächlichen Lautstärke des Veranstaltungsortes.
  3. Testen Sie das Eingreifen für alle sechs Unterbrechungsklassen separat.
  4. Bestätigen Sie, dass die Sitzung zwischen Benutzern vollständig zurückgesetzt wird, auch auf dem Bildschirm.
  5. Bestätigen Sie, dass das Timeout im Anziehungsmodus ausgelöst wird, wenn jemand mitten im Satz weggeht.
  6. Ziehen Sie am Netzwerkkabel und vergewissern Sie sich, dass der Fehler ordnungsgemäß ist.
  7. Bestätigen Sie, dass die erneute Verbindung nach einer abgebrochenen Sitzung Kontext enthält.
  8. Versuchen Sie, den Agenten dazu zu bringen, einen Preis anzugeben, einen Termin zu versprechen oder etwas Zitierbares zu sagen.
  9. Stellen Sie sicher, dass die KI-Offenlegung beim ersten Austausch erfolgt.
  10. Stellen Sie sicher, dass die Beschilderung, die Kameraanzeigen und die Geschichte der Datenaufbewahrung mit Ihren tatsächlichen Aktivitäten übereinstimmen.
  11. Machen Sie einen Rollback: einen statischen Bildschirm, einen QR-Code und einen Menschen.

Das Fazit

Live-Agenten sind keine Chatbots mit angeschlossenem Mikrofon. Die Chat-Oberfläche verbirgt Latenz, Unklarheiten und Fehler hinter einem Textfeld, auf das die Leute gerne warten. Nehmen Sie das weg und jede Schwäche im Stapel wird zu einem gesellschaftlichen Ereignis, das vor einem Fremden stattfindet.

Die Teams, die das richtig machen, optimieren für die langweiligen Dinge: das Turn-Taking-Modell, das Mikrofon, das Netzwerk, den Reset, die Übergabe. Sie halten den Job des Maklers klein und geben ihn frühzeitig ab. Sie sorgen dafür, dass die Person mit etwas geht. Und sie betrachten die Gesprächslücke von 200 Millisekunden, auf die jeder Mensch von Geburt an trainiert wurde, als die tatsächliche Spezifikation – nicht als eine nette Sache.

Alles andere ist eine Demo.

Ihr erster Assistent ist nur wenige Minuten entfernt

Setzen Sie Ihr betriebswirtschaftliches Wissen ein.

Beginnen Sie mit einem kostenlosen Cody-Konto. Fügen Sie Ihre Inhalte hinzu, erstellen Sie einen Assistenten und teilen Sie noch heute die erste nützliche Antwort.