Hacer que una IA responda en el chat es un problema resuelto. Hacer que una IA atienda una llamada de teléfono — hablar, escuchar, ser interrumpida, responder en tiempo real sin sonar robótica — es un juego completamente distinto. Es ingeniería de tiempo real de verdad, y la mayoría de la gente subestima cuántas piezas necesitan funcionar juntas en milisegundos. Este es el mapa del stack de voz para agentes de IA, de quien lo construye.
Por qué la voz es difícil (y el texto no)
En el texto, la latencia es tolerable. El cliente manda el mensaje, lo procesas con calma, respondes tres segundos después — nadie se queja. En la voz, tres segundos de silencio matan la conversación. El oído humano es implacable: la latencia alta se percibe al instante como "esta atención es mala".
Y no es solo velocidad. En una llamada, el cliente interrumpe, cambia de tema a la mitad, habla por encima, duda. Un agente de voz serio necesita lidiar con todo esto naturalmente — lo que exige una orquestación que el texto simplemente no necesita. Detallé parte de esto en la arquitectura de un call center de IA; aquí voy a fondo en las piezas.
Las capas del stack
1. Telefonía (SIP)
La llamada llega por el mundo de la telefonía tradicional — protocolo SIP, troncales de operadora, códecs de audio. Necesitas un borde robusto (componentes como Kamailio viven aquí) que haga de puente entre ese mundo y el resto del sistema: registro de troncal, enrutamiento de llamada, conversión del audio de la telefonía a algo que el pipeline entienda. Es la capa menos glamorosa y la que más se rompe si te equivocas.
2. Transporte de medios en tiempo real
Con la llamada establecida, el audio necesita fluir en ambos sentidos con latencia mínima. Aquí entra una capa de medios del mundo WebRTC/streaming (LiveKit es un ejemplo fuerte) — la "tubería" optimizada para tiempo real por donde viaja la voz.
3. STT — transcripción en tiempo real
El audio del cliente se convierte en texto, en streaming, mientras aún habla. Proveedores como Deepgram son referencia aquí. Lo que importa:
- Streaming, no batch. El STT empieza a transcribir antes de que el cliente termine la frase.
- Detección de fin de habla (endpointing). Saber cuándo terminó el cliente es decisivo — cortar temprano irrita, esperar demasiado suena lento.
- Idioma y acento. En español, la calidad del STT con acentos regionales marca toda la diferencia.
4. LLM — el cerebro
El texto transcrito va al modelo de lenguaje, que entiende la intención, decide la respuesta y — crucial — llama a herramientas cuando necesita actuar (consultar un sistema, generar una factura). En la voz, dos exigencias son innegociables:
- Bajísima latencia, porque el cliente está esperando en vivo.
- Fallback entre proveedores: en una llamada no existe el "intenta de nuevo". Si el LLM primario se atasca, cae al secundario en milisegundos.
5. TTS — la voz de vuelta
La respuesta del LLM se sintetiza en habla. Proveedores como ElevenLabs y Cartesia ofrecen voces neuronales que suenan humanas. Aquí la calidad define la percepción del cliente:
- Voz natural. Una voz robótica destruye la confianza al instante.
- Streaming. El TTS empieza a hablar en cuanto salen las primeras palabras del LLM — no espera la respuesta entera.
- Fallback de TTS también, porque ningún proveedor tiene un 100% de uptime.
La orquestación: donde vive la magia (y la dificultad)
Tener las cinco piezas no basta. Lo que hace que la conversación suene natural es la orquestación en streaming, con las etapas superpuestas en vez de secuenciales:
Cliente habla ─→ STT transcribe (streaming)
└─→ LLM ya empieza a procesar
└─→ TTS ya empieza a hablar
└─→ cliente escucha — y puede interrumpir (barge-in)
El barge-in — que el cliente interrumpa a la IA a mitad del habla — no es opcional. Sin él, el agente parece una IVR tonta. Y toda esa danza necesita ocurrir con una latencia total por debajo del umbral de incomodidad humana. Los frameworks de orquestación de agentes de voz (el ecosistema en torno a LiveKit Agents, por ejemplo) existen justamente para gestionar ese pipeline. Plataformas como Retell empaquetan buena parte de esto en un producto, cambiando flexibilidad por velocidad de implementación.
Cómo elegir las piezas
No existe un stack "mejor" — existe el correcto para tu caso. Los ejes de decisión:
- Latencia: cada proveedor añade milisegundos. El presupuesto total de latencia es ajustado.
- Idioma: la calidad de STT/TTS en español (con acentos) varía mucho entre proveedores.
- Costo: STT y TTS cobran por minuto; súmalo al costo de LLM y telefonía.
- Calidad de voz: lo que suena natural para tu público.
- Build vs. buy: montar el pipeline pieza por pieza (más control y optimización) o usar una plataforma que lo empaqueta (más rápido para empezar).
El resumen
Un agente de voz es 20% modelo de lenguaje y 80% ingeniería de tiempo real: telefonía que no se cae, STT y TTS en streaming, orquestación con barge-in y fallback, todo dentro de un presupuesto de latencia brutal. El LLM es la parte comoditizada; lo difícil — y donde está el valor — es hacer que las cinco capas bailen juntas en milisegundos.
Por eso la mayoría de los "atendedores de IA por voz" prometidos por ahí no entregan: se quedaron en el prototipo de texto y nunca enfrentaron el tiempo real de la voz. Enfrentar eso es exactamente lo que yo hago.
Construyo agentes de IA por voz en producción — del SIP al TTS, con la orquestación que aguanta una llamada de verdad. Si quieres una IA atendiendo el teléfono, hablemos.