Todos los artículos
IA en tiempo real

Cómo funcionan realmente las experiencias de agentes de IA en vivo: una guía de campo

Una guía neutral para los proveedores sobre agentes conversacionales en tiempo real en eventos, salas de capacitación y espacios públicos. Existe una categoría de producto de IA que no se parece en nada a la que han creado la mayoría de los equipos. No tiene ventana de chat, ni botón de enviar, ni… Leer más »

Por Om Kamathtiempo de lectura: 18 minutos
Un visitante de una feria comercial hablando con un quiosco de agentes de IA en vivo que muestra un orbe de escucha brillante

Una guía neutral para los proveedores sobre agentes conversacionales en tiempo real en eventos, salas de capacitación y espacios públicos

Existe una categoría de producto de IA que no se parece en nada a la que han creado la mayoría de los equipos. No tiene ventana de chat, ni botón de enviar, ni paciencia. Alguien se acerca, abre la boca y el reloj se pone en marcha. Si la respuesta llega en medio segundo, parece una conversación. Si aterriza en dos segundos, la persona que está allí asume que está roto y se aleja.

Se trata de agentes en vivo: sistemas en tiempo real basados ​​en la voz que mantienen una conversación en la misma habitación, o en la misma llamada, como un ser humano. Aparecen en stands de ferias comerciales, en simulaciones de capacitación, en quioscos de museos, en las recepciones de hoteles y detrás de números de teléfono. Y fallan de una manera que nunca lo hace un chatbot de texto.

Este artículo trata sobre cómo funciona realmente esa categoría. No es una presentación de producto ni una lista de herramientas. Es la realidad de la ingeniería y el diseño de construir algo que tiene que responder a un extraño en menos de un segundo, en una habitación ruidosa, sin una segunda oportunidad.

Lo que realmente significa "vivir"

La limitación definitoria no es la inteligencia. Es hora.

En 2009, un equipo de lingüistas dirigido por Tanya Stivers publicó un estudio en PNAS midiendo la brecha entre hablantes en conversaciones ordinarias en diez idiomas en cinco continentes: inglés, japonés, danés, laosiano, italiano, coreano, holandés, tzeltal, yélî-dnye y ‡Ākhoe hai||om. El hallazgo fue notablemente uniforme. Cada idioma mostró una distribución de compensación de respuesta de un solo pico, con el modo entre 0 y +200 milisegundos y una mediana translingüística de aproximadamente +100 ms.

Ese es el número con el que se está juzgando su sistema. No por un punto de referencia, sino por un sistema nervioso que ha sido calibrado sobre él desde la infancia.

Nadie espera que una máquina alcance los 100 ms. Pero el abismo perceptual es real y está bien documentado en la práctica: alrededor de 800 ms, una respuesta comienza a leerse como notablemente retrasada; Después de aproximadamente 1.500 ms, la mayoría de las personas concluyen que algo salió mal y repiten lo mismo o se desconectan. En un entorno en vivo con una persona físicamente parada frente a una pantalla, ese umbral es más estricto que en el teléfono, porque no hay una expectativa ambiental de retraso de la red que lo absorba.

Esta no es una preferencia subjetiva. En un estudio independiente ciego con 178 participantes sobre sistemas de avatar en tiempo real, la capacidad de respuesta fue el predictor más fuerte de la experiencia general del usuario: una correlación de Spearman de 0,697, por delante de la calidad visual. Los usuarios no pudieron decir qué modelo tenía la mejor cara. Podían decirte, de forma inmediata y fiable, cuál se sentía vivo.

La anatomía de un agente vivo

Debajo del capó, casi todos los agentes en vivo tienen una de dos arquitecturas.

El oleoducto en cascada encadena modelos discretos: llega el audio, un modelo de voz a texto lo transcribe, alguna lógica decide que el usuario ha terminado de hablar, un modelo de lenguaje produce una respuesta, un modelo de texto a voz sintetiza el audio y el audio se reproduce. Cada etapa es intercambiable, observable y sintonizable de forma independiente. Cada etapa también agrega latencia.

El modelo discurso a discurso colapsa esa cadena. El audio entra en un único modelo multimodal y el audio sale, sin cuello de botella de texto intermedio. Esto es lo que ofrecen la API Realtime de OpenAI y Gemini Live de Google. Es más rápido y preserva la prosodia (tono, vacilación, énfasis) que una transcripción desecha. También le brinda mucho menos control sobre lo que sucedió en el medio, lo cual es importante cuando necesita registrar, auditar o restringir el comportamiento.

La mayoría de los sistemas de producción en 2026 son híbridos: un modelo en tiempo real que maneja la superficie conversacional, con llamadas de herramientas disparadas a modelos más lentos y más capaces para cualquier cosa que requiera trabajo real.

donde va el tiempo

Telnyx publicó una descomposición útil de un giro de voz, comparando una pila estrechamente ubicada con una típica ensamblada por proveedores separados en regiones separadas:

etapa Pila coubicada Pila cosida típica
Red / transporte 45 ms 150 ms
Voz a texto 100 ms 225 ms
inferencia LLM 225 ms 650 ms
Texto a voz 80 ms 185 ms
totales 450 ms 1.210 ms

Destacan dos cosas. En primer lugar, el LLM es el elemento de línea más grande en ambas columnas, razón por la cual enrutar giros conversacionales simples a un modelo pequeño y rápido y reservar un modelo más grande para un razonamiento genuino es la optimización de mayor apalancamiento disponible. En segundo lugar, la diferencia entre las dos columnas no es la inteligencia. Es geografía y plomería. Los mismos modelos, mal dispuestos, te cuestan tres cuartos de segundo.

Si agrega una cara renderizada a esto, presupuesta otros 150 a 200 ms para la generación del avatar en la parte superior y espere que la capa visual agregue su propio retraso de entrada a la sesión antes de que aparezca el primer fotograma.

El problema más difícil es saber cuándo hablar

Pregúntele a cualquiera que haya enviado un agente en vivo qué se rompió primero y no le dirán el modelo de lenguaje. Dirán turnos.

El sistema tiene que responder a una pregunta que los humanos resuelven inconscientemente y las máquinas resuelven mal: ¿Esta persona ha terminado de hablar o simplemente está pensando? Si se equivoca en una dirección, el agente interrumpirá a alguien a mitad de la frase. Si se equivoca en el otro, el agente se sienta en silencio mientras la persona espera, luego ambos empiezan a hablar a la vez.

Hay cuatro enfoques generales que se acumulan en lugar de competir.

1. Detección de actividad de voz (VAD)

Un modelo pequeño clasifica cada cuadro de audio como habla o no habla. Silero VAD es el valor predeterminado casi universal. VAD es rápido, económico y resistente contra el ruido de fondo constante, pero funciona únicamente con audio. Sabe que el sonido se detuvo. No tiene idea si la frase terminó.

2. Puntualización

Lógica que observa la transcripción de la transmisión y decide que la expresión está completa, generalmente después de un umbral de silencio. El problema es aritmético: un tiempo de espera de silencio de 800 ms añade casi un segundo completo a cada respuesta, antes de que haya comenzado cualquier procesamiento. Durante una conversación de diez minutos, es decir, minutos de aire muerto que pagaste por configuración.

3. Detección de giro semántico

Un pequeño clasificador lee la transcripción parcial y predice la finalización del significado en lugar del silencio. "Mi número de cuenta es cuatro siete—" está obviamente incompleto; "Eso es todo, gracias" obviamente no lo es. LiveKit envía un detector de giro de pesas abiertas ajustado desde Qwen2.5-0.5B-Instruct para inferencia de CPU de baja latencia, que cubre 14 idiomas. Pipecat mantiene Smart Turn como una alternativa abierta. Porque estos modelos pueden cometer un giro. antes Transcurre el silencio final y recuperan el impuesto de terminación.

4. Modelos de habla conversacional diseñados específicamente

El enfoque más nuevo convierte la detección en el modelo de reconocimiento en sí. Deepgram flujo, generalmente disponible en formato multilingüe desde abril de 2026, informa una detección media de final de turno de 260 ms con un umbral configurable para intercambiar latencia con precisión y afirma una reducción de 200 a 600 ms en la latencia de respuesta del agente en comparación con STT-plus-VAD convencional. Tavus adopta un enfoque similar con su modelo de flujo conversacional Sparrow, utilizando señales léxicas, semánticas, prosódicas y acústicas juntas.

Enfoque Señal utilizada Latencia agregada Fallo característico
Sólo VAD Energía de audio Umbral igual al silencio Interrumpe a cualquiera que se detenga a pensar
Punto final STT Flujo de transcripción moderado Igual, un poco más inteligente
Modelo semántico Significado de la transcripción parcial Bajo; puede adelantarse al silencio Falsos compromisos en oraciones incompletas
STT conversacional Audio + léxico + prosódico Más bajo Menos control; más nuevo, menos probado en batalla

La interrupción es una política, no un escenario

La irrupción (permitir al usuario interrumpir al agente a mitad de la frase) suele exponerse como un solo valor booleano. Esto es un error y es la causa más común de que un agente "se sienta mal" sin que nadie pueda decir por qué.

El problema es que no todo el audio entrante significa lo mismo. Una taxonomía útil, adaptada del runbook de interrupciones de Hamming, la divide en seis clases:

Entrada Ejemplo Comportamiento correcto
Corrección verdadera "No, viernes" Deténgase inmediatamente, acepte el nuevo turno, mantenga el contexto de la tarea
Canal trasero "mm-hm", "sí", "bien" Sigue hablando; no lo trates como una nueva intención
Ruido accidental Teclado, HVAC, conversación adyacente Ignorar y reanudar desde un punto seguro
Pausa larga de entidad A mitad de camino a través de un número de cuenta Espera; no respondas temprano
Tiempo de espera de silencio La persona se alejó Vuelva a preguntar una vez y luego reinicie
Escalada de seguridad "Quiero una persona" Deténgase y entregue inmediatamente

El fracaso que erosiona la confianza más rápidamente es la parada en falso: un agente que se detiene a mitad de una frase porque alguien dijo "está bien" y luego trata el "está bien" como una nueva pregunta. Se lee como un agente que no escucha. En un ambiente ruidoso, donde el VAD dispara constantemente el sonido ambiental, una configuración ingenua de irrupción producirá esto docenas de veces por hora.

La solución es una política por tipo de mensaje. Un saludo debería poder interrumpirse después de un breve período de gracia. Un menú debe aceptar DTMF y voz. La captura de entidades debe ser paciente. Una divulgación legal o una declaración de consentimiento no deberían ser interrumpibles en absoluto. Un relleno de "déjame buscar eso" debería poder cancelarse al instante.

Dónde encajan realmente los agentes en vivo

La versión honesta de esta sección incluye los lugares donde el formato no gana su costo.

Configuración Por qué encaja el formato lo que realmente se rompe
Ferias y conferencias La novedad detiene el tráfico peatonal; el agente califica mientras el personal está ocupado; capta lo que la gente realmente pregunta Ruido ambiental cercano a 80 dB; wifi del lugar poco confiable; Los visitantes llegan en grupos, no solos.
Entrenamiento y ensayo Repeticiones ilimitadas de una conversación difícil sin coste social; puntuación consistente; el informe es donde ocurre el aprendizaje El realismo del escenario es difícil; los alumnos juegan con el simulador; La calidad de la retroalimentación importa más que la simulación.
Quioscos públicos (museos, tránsito, cívico) Multilingüe por defecto; nunca cansado; Auténticas ganancias de accesibilidad para las personas que no pueden utilizar una pantalla táctil. Expectativas de privacidad del espacio público; vandalismo y abuso; largo tiempo de actividad sin supervisión; debe degradarse con gracia fuera de línea
Recepción y conserjería Cubre horas libres y excedentes; maneja las mismas quince preguntas perfectamente Todo lo interesante es una excepción; La ruta de escalada es el producto completo.
Líneas telefónicas Concurrencia infinita; sin capa visual para renderizar; un transporte maduro y bien entendido Exposición regulatoria; latencia del portador; las personas que llaman cuelgan más rápido de lo que se alejan
Piso comercial Búsqueda y comparación de productos en el lineal. Ruido, aglomeración y fuerte tendencia de la gente a preferir a un humano que esté a tres metros de distancia.
donde no cabe Cualquier cosa que requiera una lectura sostenida, una entrada precisa de datos, una revisión de documentos complejos o una decisión en la que el visitante deba pensar durante más de un minuto. La conversación en vivo es una mala interfaz para cualquier cosa que no sea conversacional.
Una persona ensayando una conversación con un agente de IA en vivo en una pantalla de pared en una sala de práctica tranquila.

La capacitación es el entorno donde los agentes en vivo se preocupan menos por la novedad y más por la repetición. Imagen generada con GPT Imagen 2.

Un pedido de autoservicio es un punto de referencia útil para las limitaciones de este artículo: ruido del motor, una cola detrás del automóvil y una persona que llama y se corregirá a mitad de la frase. Demostración publicada por Deepgram.

El patrón que separa las buenas implementaciones de las demostraciones

En todas las configuraciones anteriores, las implementaciones que producen resultados comparten una propiedad: el agente hace algo durante la conversación en lugar de sólo responder preguntas.

Un agente de stand que responde "¿para qué sirve su producto?" es un folleto parlante. Un agente del stand que toma la URL de la empresa de un visitante y produce un análisis de una página en pantalla en sesenta segundos ha cambiado la transacción: el visitante ahora tiene una razón para darle una dirección de correo electrónico y una razón para describir la experiencia a un colega después. Es útil un agente de formación que dirija un juego de roles; un agente de capacitación que termina con un informe específico y puntuado es un producto.

La conversación es la interfaz. El artefacto es el valor.

La habitación es la parte más difícil

Esta es la sección que se omite y es la que determina si algo funciona ese día.

Vista superior del hardware de instalación del agente de IA en vivo: panel de pantalla táctil, micrófono direccional, altavoz USB, cámara web, punto de acceso celular, cable Ethernet y soporte VESA

La lista de piezas que decide si el software funciona ese día. El altavoz con cancelación de eco por hardware es la solución más barata para el mayor riesgo. Imagen generada con GPT Imagen 2.

Ruido. Una sala de exposiciones tiene un volumen tan alto que la detección de voz del micrófono abierto falla con más frecuencia de lo que logra. Las respuestas prácticas son un micrófono direccional o con formación de haces, una opción de pulsar para hablar o tocar para hablar y un respaldo de texto visible. Un altavoz de conferencia USB con cancelación de eco acústico por hardware es la solución más barata para el mayor riesgo, porque sin él, los propios parlantes de la pantalla retroalimentan el micrófono y el agente se interrumpe.

Conectividad. El wifi del lugar es un lanzamiento de moneda. Traiga un punto de acceso celular, conecte la máquina a través de Ethernet y almacene en caché un conjunto de respuestas almacenadas para que el bucle de atracción y las respuestas básicas sobrevivan a una interrupción.

Higiene de la sesión. Un reinicio completo entre visitantes no es opcional. Nadie debería ver nunca la dirección de correo electrónico, el nombre de la empresa o la conversación de la persona anterior en la pantalla. Cree un tiempo de espera que devuelva la pantalla al modo de atracción cuando alguien se desvíe a mitad de una frase, lo que hará constantemente.

Límites de sesión. Las sesiones en tiempo real tienen límites de duración y disminuyen. Cree una reconexión que incluya un breve resumen de la nueva sesión, o el agente olvidará el nombre de alguien en mitad de la conversación, frente a una multitud.

Barandillas. Un agente en vivo nunca debe cotizar precios personalizados, prometer un cronograma ni asumir un compromiso. Cualquier cosa en forma de trato no pasa a manos de un humano. Vale la pena aplicar esto en el indicador del sistema. y en una verificación posterior a la generación, porque el error es público y citable.

¿Debería verte?

Las cámaras son la adición más tentadora y peligrosa a un agente en vivo.

Las aplicaciones realmente útiles son limitadas: detectar que alguien se ha acercado y está de cara a la pantalla, para que el sistema se despierte; contar cuántas personas hay presentes para poder adaptarse; notar que alguien ha desviado la mirada, por lo que puede hacer una pausa; y leer algo que una persona sostiene deliberadamente: una placa, una tarjeta de presentación, un teléfono que muestra su sitio web. Este último es el más fuerte, porque es explícitamente optativo. "Sostenga su credencial frente a la cámara" es una instrucción natural que le proporciona el nombre de la empresa sin que nadie tenga que escribirlo.

Dos cosas que no debería hacer: comentar sobre la apariencia de nadie y reconocer a alguien que lo visitó anteriormente. Ambos se leen como un truco de fiesta durante dos segundos y como vigilancia a partir de entonces.

También existe una trampa de costos que atrapa tarde a los equipos. Las API multimodales en tiempo real se facturan por turno en función del contexto de sesión acumulado. Con una cámara que transmite continuamente, cada fotograma que ya haya enviado se ubica en ese contexto y se vuelve a facturar en cada turno posterior. Una sesión de ocho horas con la cámara abierta produce una factura realmente alarmante. La respuesta arquitectónica es mantener la detección de presencia local: un modelo en el dispositivo como el MediaPipe. pose hito o cara de hito se ejecuta sin conexión y al instante, y solo abre la sesión paga en tiempo real una vez que la persona está realmente comprometida. Envíe fotogramas con moderación, tal vez uno por segundo mientras esté activo o solo cuando lo solicite, y cierre la sesión con fuerza cuando se vayan. Como beneficio adicional, el modo de atracción no cuesta nada y no necesita red.

Divulgación, consentimiento y las nuevas reglas

A partir del 2 de agosto de 2026, se aplica el artículo 50 de la Ley de IA de la UE. Requiere que los sistemas de IA que interactúan directamente con personas físicas se diseñen de manera que las personas estén informadas de que están interactuando con la IA, y que el contenido sintético o manipulado se divulgue con claridad y en la primera exposición. Una organización que no tenga ninguna IA de alto riesgo aún puede cumplir de lleno con estas obligaciones simplemente ejecutando un agente conversacional de cara al cliente o un presentador sintético. La Comisión Europea ha publicado pautas sobre cómo se aplican las obligaciones.

En las líneas telefónicas de Estados Unidos, la situación se ha resuelto desde la decisión de la FCC. Sentencia declarativa de febrero de 2024, que confirmó que las voces generadas por IA cuentan como una "voz artificial o pregrabada" según el TCPA. Eso conlleva requisitos de consentimiento, identificación, divulgación y exclusión voluntaria, y daños legales que comienzan en $500 por infracción.

Más allá del piso legal, las prácticas que se mantienen en un espacio físico no son glamorosas:

  • Indique que es una IA en la primera oración, no en el pie de página.
  • Poner señalización visible en cualquier instalación con cámara o micrófono.
  • Procese los fotogramas de la cámara y deséchelos; no persistir en ellas, y ser capaz de decirlo con sinceridad cuando alguien le pregunte.
  • Utilice un indicador de hardware: un obturador físico o un LED que se enciende solo durante una sesión activa.
  • Consulta el contrato del lugar. Algunos acuerdos de conferencias restringen la grabación en la sala, y "solo estamos transmitiendo, no grabando" es una distinción que el organizador puede no aceptar.
  • Si está capturando rostros o huellas de voz en una jurisdicción con un estatuto de privacidad biométrica, primero obtenga el consentimiento por escrito. En particular, el BIPA de Illinois conlleva un derecho de acción privado.

Qué medir

La mayoría de las implementaciones de agentes en vivo se evalúan según las vibraciones. La instrumentación que realmente te dice algo:

Métrica Por qué es importante
Tiempo hasta el primer byte de audio, p50 y p95 La mediana es cómo se siente tu demostración; p95 es lo que sienten sus usuarios. La latencia de cola es donde la gente se desconecta.
Tasa de falsas interrupciones Ruido o canales secundarios confundidos con un giro real. El principal impulsor de "se siente roto".
Tasa de interrupción perdida Se ignoran las correcciones reales. Hace que la gente se repita y se rinda.
Turnos por sesión Las sesiones de un turno significan que la apertura falló. Las sesiones de quince turnos pueden significar que el agente no está resolviendo nada.
Punto de abandono En qué parte del flujo la gente se aleja o cuelga. Generalmente un mensaje específico.
Tasa de escalada y calidad La transferencia es un éxito, no un fracaso, siempre que la transferencia tenga contexto.
Registro de preguntas sin respuesta El resultado más valioso de cualquier implementación pública. Es una investigación de posicionamiento gratuita.

Registre ambos lados del audio en un reloj. Sin un reloj compartido no se puede medir la latencia real, solo lo que su propia pila informa sobre sí misma, y ​​esos dos números pueden diferir en un segundo completo.

Una lista de verificación previa al vuelo

Antes de cualquier implementación en vivo, aproximadamente en el orden en que las cosas salen mal:

  1. Mida la latencia de giro de p50 y p95 a partir del audio grabado, no de sus propios registros.
  2. Pruebe con ruido de fondo real al volumen real del lugar.
  3. Pruebe la irrupción para las seis clases de interrupción por separado.
  4. Confirme que la sesión se restablece completamente entre los usuarios, incluso en la pantalla.
  5. Confirme que el tiempo de espera del modo de atracción se activa cuando alguien se aleja a mitad de una frase.
  6. Tire del cable de red y confirme que la falla es elegante.
  7. Confirmar que la reconexión lleva contexto después de una sesión interrumpida.
  8. Intente que el agente cotice un precio, prometa una fecha o diga algo que se pueda citar.
  9. Verifique que la divulgación de la IA se produzca en el primer intercambio.
  10. Verifique que la señalización, los indicadores de las cámaras y el historial de retención de datos coincidan con lo que realmente hace.
  11. Tener una reversión: una pantalla estática, un código QR y un humano.

La conclusión

Los agentes en vivo no son chatbots con un micrófono adjunto. La interfaz de chat oculta latencia, ambigüedad y fallas detrás de un cuadro de texto que la gente está dispuesta a esperar. Si eliminamos eso, cada debilidad en la pila se convierte en un evento social que sucede frente a un extraño.

Los equipos que hacen esto bien optimizan las cosas aburridas: el modelo de turnos, el micrófono, la red, el reinicio, el traspaso. Mantienen el trabajo del agente pequeño y lo dejan entregar antes de tiempo. Se aseguran de que la persona se vaya con algo. Y tratan la brecha conversacional de 200 milisegundos en la que todo ser humano ha sido entrenado desde su nacimiento como la especificación real, no como algo agradable de tener.

Todo lo demás es una demostración.

Tu primer asistente está a minutos de distancia.

Ponga a trabajar sus conocimientos empresariales.

Comience con una cuenta Cody gratuita. Agregue su contenido, cree un asistente y comparta la primera respuesta útil hoy.