---
title: "El stack de voz para agentes de IA: STT, LLM, TTS y la orquestación"
description: "Las piezas que hacen que una IA atienda una llamada telefónica: telefonía SIP, transcripción en tiempo real, LLM, síntesis de voz y la orquestación que une todo con baja latencia."
slug: stack-de-voz-agentes-de-ia
lang: es
date: 2026-07-22
updated: 2026-07-22
author: Lucas Silva
category: deep-dive
tags: [Voz, STT, TTS, LLM, SIP, LiveKit, Agentes de IA, Telefonía]
reading_time: 10
featured: false
faq:
  - q: "¿Cuáles son las piezas de un agente de IA por voz?"
    a: "Cinco capas: (1) el borde de telefonía (SIP) que conecta la llamada; (2) el transporte de medios en tiempo real que lleva el audio; (3) el STT (speech-to-text) que transcribe el habla; (4) el LLM que entiende y decide la respuesta, llamando herramientas cuando hace falta; (5) el TTS (text-to-speech) que sintetiza la respuesta en voz. La orquestación de estas piezas en streaming, con baja latencia, es lo que hace que la conversación suene natural."
  - q: "¿Por qué la voz es más difícil que el texto para los agentes de IA?"
    a: "Porque la voz es implacable con la latencia. En una llamada, cada milisegundo de retraso se percibe como una mala atención, y el cliente puede interrumpir, cambiar de tema o hablar por encima. Esto exige procesamiento en streaming (STT, LLM y TTS superpuestos), detección de fin de habla, barge-in (interrupción) y fallback — ingeniería de tiempo real que el texto no necesita."
  - q: "¿Qué herramientas componen un stack de voz de IA?"
    a: "En el ecosistema actual: telefonía/medios con componentes como Kamailio y LiveKit; STT de proveedores como Deepgram; LLMs de múltiples proveedores (con fallback); TTS de proveedores como ElevenLabs o Cartesia; y frameworks de orquestación de agentes de voz. Plataformas como Retell también empaquetan parte de ese pipeline. La elección depende de la latencia, el costo, el idioma y la calidad de voz."
---

Hacer que una IA responda en el chat es un problema resuelto. Hacer que una IA **atienda una llamada de teléfono** — hablar, escuchar, ser interrumpida, responder en tiempo real sin sonar robótica — es un juego completamente distinto. Es ingeniería de tiempo real de verdad, y la mayoría de la gente subestima cuántas piezas necesitan funcionar juntas en milisegundos. Este es el mapa del stack de voz para agentes de IA, de quien lo construye.

## Por qué la voz es difícil (y el texto no)

En el texto, la latencia es tolerable. El cliente manda el mensaje, lo procesas con calma, respondes tres segundos después — nadie se queja. En la voz, tres segundos de silencio matan la conversación. El oído humano es implacable: la latencia alta se percibe al instante como "esta atención es mala".

Y no es solo velocidad. En una llamada, el cliente **interrumpe**, cambia de tema a la mitad, habla por encima, duda. Un agente de voz serio necesita lidiar con todo esto naturalmente — lo que exige una orquestación que el texto simplemente no necesita. Detallé parte de esto en la [arquitectura de un call center de IA](https://www.lucassilva.io/blog/arquitetura-call-center-ia-provedores); aquí voy a fondo en las piezas.

## Las capas del stack

### 1. Telefonía (SIP)

La llamada llega por el mundo de la telefonía tradicional — protocolo SIP, troncales de operadora, códecs de audio. Necesitas un borde robusto (componentes como **Kamailio** viven aquí) que haga de puente entre ese mundo y el resto del sistema: registro de troncal, enrutamiento de llamada, conversión del audio de la telefonía a algo que el pipeline entienda. Es la capa menos glamorosa y la que más se rompe si te equivocas.

### 2. Transporte de medios en tiempo real

Con la llamada establecida, el audio necesita fluir en ambos sentidos con latencia mínima. Aquí entra una capa de medios del mundo WebRTC/streaming (**LiveKit** es un ejemplo fuerte) — la "tubería" optimizada para tiempo real por donde viaja la voz.

### 3. STT — transcripción en tiempo real

El audio del cliente se convierte en texto, en streaming, mientras aún habla. Proveedores como **Deepgram** son referencia aquí. Lo que importa:

- **Streaming, no batch.** El STT empieza a transcribir antes de que el cliente termine la frase.
- **Detección de fin de habla (endpointing).** Saber *cuándo* terminó el cliente es decisivo — cortar temprano irrita, esperar demasiado suena lento.
- **Idioma y acento.** En español, la calidad del STT con acentos regionales marca toda la diferencia.

### 4. LLM — el cerebro

El texto transcrito va al modelo de lenguaje, que entiende la intención, decide la respuesta y — crucial — llama a [herramientas](https://www.lucassilva.io/blog/function-calling-llm-que-age) cuando necesita actuar (consultar un sistema, generar una factura). En la voz, dos exigencias son innegociables:

- **Bajísima latencia**, porque el cliente está esperando en vivo.
- **[Fallback entre proveedores](https://www.lucassilva.io/blog/fallback-llm-arquitetura)**: en una llamada no existe el "intenta de nuevo". Si el LLM primario se atasca, cae al secundario en milisegundos.

### 5. TTS — la voz de vuelta

La respuesta del LLM se sintetiza en habla. Proveedores como **ElevenLabs** y **Cartesia** ofrecen voces neuronales que suenan humanas. Aquí la calidad define la percepción del cliente:

- **Voz natural.** Una voz robótica destruye la confianza al instante.
- **Streaming.** El TTS empieza a hablar en cuanto salen las primeras palabras del LLM — no espera la respuesta entera.
- **Fallback de TTS también**, porque ningún proveedor tiene un 100% de uptime.

## La orquestación: donde vive la magia (y la dificultad)

Tener las cinco piezas no basta. Lo que hace que la conversación suene natural es la **orquestación en streaming**, con las etapas superpuestas en vez de secuenciales:

```
Cliente habla ─→ STT transcribe (streaming)
                    └─→ LLM ya empieza a procesar
                            └─→ TTS ya empieza a hablar
                                    └─→ cliente escucha — y puede interrumpir (barge-in)
```

El **barge-in** — que el cliente interrumpa a la IA a mitad del habla — no es opcional. Sin él, el agente parece una IVR tonta. Y toda esa danza necesita ocurrir con una latencia total por debajo del umbral de incomodidad humana. Los frameworks de orquestación de agentes de voz (el ecosistema en torno a LiveKit Agents, por ejemplo) existen justamente para gestionar ese pipeline. Plataformas como **Retell** empaquetan buena parte de esto en un producto, cambiando flexibilidad por velocidad de implementación.

## Cómo elegir las piezas

No existe un stack "mejor" — existe el correcto para tu caso. Los ejes de decisión:

- **Latencia:** cada proveedor añade milisegundos. El presupuesto total de latencia es ajustado.
- **Idioma:** la calidad de STT/TTS en español (con acentos) varía mucho entre proveedores.
- **Costo:** STT y TTS cobran por minuto; súmalo al [costo de LLM y telefonía](https://www.lucassilva.io/blog/quanto-custa-agente-ia-whatsapp).
- **Calidad de voz:** lo que suena natural para tu público.
- **Build vs. buy:** montar el pipeline pieza por pieza (más control y optimización) o usar una plataforma que lo empaqueta (más rápido para empezar).

## El resumen

Un agente de voz es **20% modelo de lenguaje y 80% ingeniería de tiempo real**: telefonía que no se cae, STT y TTS en streaming, orquestación con barge-in y fallback, todo dentro de un presupuesto de latencia brutal. El LLM es la parte comoditizada; lo difícil — y donde está el valor — es hacer que las cinco capas bailen juntas en milisegundos.

Por eso la mayoría de los "atendedores de IA por voz" prometidos por ahí no entregan: se quedaron en el prototipo de texto y nunca enfrentaron el tiempo real de la voz. Enfrentar eso es exactamente lo que yo hago.

---

*Construyo agentes de IA por voz en producción — del SIP al TTS, con la orquestación que aguanta una llamada de verdad. Si quieres una IA atendiendo el teléfono, [hablemos](https://www.lucassilva.io).*
