Deep-dive

El stack de voz para agentes de IA: STT, LLM, TTS y la orquestación

Las piezas que hacen que una IA atienda una llamada telefónica: telefonía SIP, transcripción en tiempo real, LLM, síntesis de voz y la orquestación que une todo con baja latencia.

22 jul 2026·10 min de lectura·.md

Hacer que una IA responda en el chat es un problema resuelto. Hacer que una IA atienda una llamada de teléfono — hablar, escuchar, ser interrumpida, responder en tiempo real sin sonar robótica — es un juego completamente distinto. Es ingeniería de tiempo real de verdad, y la mayoría de la gente subestima cuántas piezas necesitan funcionar juntas en milisegundos. Este es el mapa del stack de voz para agentes de IA, de quien lo construye.

Por qué la voz es difícil (y el texto no)

En el texto, la latencia es tolerable. El cliente manda el mensaje, lo procesas con calma, respondes tres segundos después — nadie se queja. En la voz, tres segundos de silencio matan la conversación. El oído humano es implacable: la latencia alta se percibe al instante como "esta atención es mala".

Y no es solo velocidad. En una llamada, el cliente interrumpe, cambia de tema a la mitad, habla por encima, duda. Un agente de voz serio necesita lidiar con todo esto naturalmente — lo que exige una orquestación que el texto simplemente no necesita. Detallé parte de esto en la arquitectura de un call center de IA; aquí voy a fondo en las piezas.

Las capas del stack

1. Telefonía (SIP)

La llamada llega por el mundo de la telefonía tradicional — protocolo SIP, troncales de operadora, códecs de audio. Necesitas un borde robusto (componentes como Kamailio viven aquí) que haga de puente entre ese mundo y el resto del sistema: registro de troncal, enrutamiento de llamada, conversión del audio de la telefonía a algo que el pipeline entienda. Es la capa menos glamorosa y la que más se rompe si te equivocas.

2. Transporte de medios en tiempo real

Con la llamada establecida, el audio necesita fluir en ambos sentidos con latencia mínima. Aquí entra una capa de medios del mundo WebRTC/streaming (LiveKit es un ejemplo fuerte) — la "tubería" optimizada para tiempo real por donde viaja la voz.

3. STT — transcripción en tiempo real

El audio del cliente se convierte en texto, en streaming, mientras aún habla. Proveedores como Deepgram son referencia aquí. Lo que importa:

4. LLM — el cerebro

El texto transcrito va al modelo de lenguaje, que entiende la intención, decide la respuesta y — crucial — llama a herramientas cuando necesita actuar (consultar un sistema, generar una factura). En la voz, dos exigencias son innegociables:

5. TTS — la voz de vuelta

La respuesta del LLM se sintetiza en habla. Proveedores como ElevenLabs y Cartesia ofrecen voces neuronales que suenan humanas. Aquí la calidad define la percepción del cliente:

La orquestación: donde vive la magia (y la dificultad)

Tener las cinco piezas no basta. Lo que hace que la conversación suene natural es la orquestación en streaming, con las etapas superpuestas en vez de secuenciales:

Cliente habla ─→ STT transcribe (streaming)
                    └─→ LLM ya empieza a procesar
                            └─→ TTS ya empieza a hablar
                                    └─→ cliente escucha — y puede interrumpir (barge-in)

El barge-in — que el cliente interrumpa a la IA a mitad del habla — no es opcional. Sin él, el agente parece una IVR tonta. Y toda esa danza necesita ocurrir con una latencia total por debajo del umbral de incomodidad humana. Los frameworks de orquestación de agentes de voz (el ecosistema en torno a LiveKit Agents, por ejemplo) existen justamente para gestionar ese pipeline. Plataformas como Retell empaquetan buena parte de esto en un producto, cambiando flexibilidad por velocidad de implementación.

Cómo elegir las piezas

No existe un stack "mejor" — existe el correcto para tu caso. Los ejes de decisión:

El resumen

Un agente de voz es 20% modelo de lenguaje y 80% ingeniería de tiempo real: telefonía que no se cae, STT y TTS en streaming, orquestación con barge-in y fallback, todo dentro de un presupuesto de latencia brutal. El LLM es la parte comoditizada; lo difícil — y donde está el valor — es hacer que las cinco capas bailen juntas en milisegundos.

Por eso la mayoría de los "atendedores de IA por voz" prometidos por ahí no entregan: se quedaron en el prototipo de texto y nunca enfrentaron el tiempo real de la voz. Enfrentar eso es exactamente lo que yo hago.


Construyo agentes de IA por voz en producción — del SIP al TTS, con la orquestación que aguanta una llamada de verdad. Si quieres una IA atendiendo el teléfono, hablemos.

Preguntas frecuentes

¿Cuáles son las piezas de un agente de IA por voz?

Cinco capas: (1) el borde de telefonía (SIP) que conecta la llamada; (2) el transporte de medios en tiempo real que lleva el audio; (3) el STT (speech-to-text) que transcribe el habla; (4) el LLM que entiende y decide la respuesta, llamando herramientas cuando hace falta; (5) el TTS (text-to-speech) que sintetiza la respuesta en voz. La orquestación de estas piezas en streaming, con baja latencia, es lo que hace que la conversación suene natural.

¿Por qué la voz es más difícil que el texto para los agentes de IA?

Porque la voz es implacable con la latencia. En una llamada, cada milisegundo de retraso se percibe como una mala atención, y el cliente puede interrumpir, cambiar de tema o hablar por encima. Esto exige procesamiento en streaming (STT, LLM y TTS superpuestos), detección de fin de habla, barge-in (interrupción) y fallback — ingeniería de tiempo real que el texto no necesita.

¿Qué herramientas componen un stack de voz de IA?

En el ecosistema actual: telefonía/medios con componentes como Kamailio y LiveKit; STT de proveedores como Deepgram; LLMs de múltiples proveedores (con fallback); TTS de proveedores como ElevenLabs o Cartesia; y frameworks de orquestación de agentes de voz. Plataformas como Retell también empaquetan parte de ese pipeline. La elección depende de la latencia, el costo, el idioma y la calidad de voz.

LS
Escrito por Lucas Silva
Construyo productos de IA en producción — del diagnóstico al deploy.
VozSTTTTSLLMSIPLiveKitAgentes de IATelefonía

¿Tienes un problema de negocio para resolver con IA?

Cuéntame el problema y te devuelvo un producto funcionando de verdad.

Hablar conmigo

Sigue leyendo

Guía

Guardrails: cómo impedir que un agente de IA haga tonterías en producción

Un LLM alucina, obedece a quien lo manipula y se equivoca con confianza. La guía práctica de las barreras (guardrails) que separan un agente seguro de un accidente esperando a ocurrir.

Guía

MCP (Model Context Protocol): qué es y por qué importa para los agentes de IA

La guía directa para entender el Model Context Protocol: qué resuelve, cuándo usarlo y por qué se convirtió en el 'USB-C' que conecta los agentes de IA a las herramientas de tu negocio.