Un proveedor de internet (ISP) vive de dos cosas: cliente conectado y cliente atendido. La primera es red; la segunda, históricamente, es gente al teléfono. Y es aquí donde la cuenta no cierra: el volumen de llamadas de "se me cayó internet", "dónde está mi factura", "quiero la segunda copia" es gigante, repetitivo y crece junto con la base. Contratar agentes a la misma velocidad que crece la base es insostenible.
Fue ese problema el que me llevó a construir ConectaAI, un call center de IA que atiende por voz y por WhatsApp, las 24 horas del día, integrado al sistema del proveedor. Este post es la arquitectura detrás de eso. No es teoría: es lo que tiene que existir para que una IA atienda una llamada telefónica de verdad y resuelva el problema del cliente.
El problema real: la voz en tiempo real es difícil
Todo el mundo sabe hacer un chatbot de texto. La voz es otro juego. En una llamada, el cliente habla, espera respuesta, interrumpe, cambia de tema, y cada milisegundo de latencia se percibe como "esta atención es mala". Si la IA tarda 3 segundos en responder, la conversación muere.
Entonces el desafío central es: transformar una llamada telefónica en una conversación con IA con latencia lo suficientemente baja como para sonar humana. Esto se descompone en varias piezas que tienen que funcionar juntas en tiempo real.
Las capas del sistema
1. El borde de telefonía (SIP)
La llamada llega por el mundo de la telefonía tradicional: protocolo SIP, troncales de operadora, todo eso. Ese borde necesita un componente robusto que aguante el tráfico real y haga el puente entre la telefonía y el mundo de la multimedia en tiempo real. Es la capa más aburrida y menos glamorosa, y la que más se rompe si te equivocas. Se ocupa del registro de troncal, el ruteo de la llamada y la conversión del audio de la telefonía (codecs, RTP) a algo que el resto del sistema entienda.
2. El transporte de multimedia en tiempo real
Con la llamada establecida, el audio necesita fluir con latencia mínima entre el cliente y el agente de IA. Aquí entra una capa de multimedia en tiempo real (del mundo WebRTC/streaming) que transporta el audio en ambos sentidos. Piénsala como el "tubo" por donde circula la voz, optimizado para tiempo real, no para calidad de estudio.
3. El pipeline de voz del agente
Este es el corazón. En un loop continuo, para cada turno de habla del cliente:
Audio del cliente
→ STT (speech-to-text) transcribe en tiempo real, con detección de fin de habla
→ LLM entiende la intención, decide la respuesta y las herramientas
→ TTS (text-to-speech) sintetiza la respuesta en voz natural
→ Audio de vuelta al cliente
Cada etapa tiene que ser streaming. El STT no espera a que el cliente termine la frase para empezar a transcribir. El TTS empieza a hablar apenas las primeras palabras de la respuesta salen del LLM. Es esa superposición la que tumba la latencia percibida.
Algunos puntos que aprendí:
- La detección de fin de habla (endpointing) es decisiva. Cortar al cliente demasiado pronto irrita; esperar demasiado suena lento. Es un ajuste constante.
- El barge-in (que el cliente interrumpa a la IA en medio del habla) no es opcional. Sin eso, la IA parece un menú de IVR tonto.
- La voz importa. Una voz sintética robótica destruye la confianza. Las buenas voces neurales (con fallback entre proveedores de TTS) cambian por completo la percepción del cliente.
4. El cerebro: LLM con contexto y herramientas
El LLM no conversa en el vacío. Recibe:
- El historial de la llamada (y del cliente, si ya llamó antes).
- Los datos del cliente, traídos del ERP del proveedor al inicio de la llamada: plan, estado financiero, situación de la conexión.
- Las herramientas que puede accionar durante la conversación.
Y es en las herramientas donde ocurre la magia de negocio. El agente no describe cómo resolver: resuelve.
- Consulta el estado de la conexión (¿la ONU del cliente está online?) y hace el diagnóstico.
- Genera la segunda copia de la factura y manda el PIX al instante.
- Abre una orden de servicio y agenda la visita técnica.
- Verifica pagos y desbloquea el acceso.
Esto exige integración directa con el ERP del proveedor (en el mundo de los ISP, dominan sistemas como el IXC). Cada herramienta es una llamada de API validada, con confirmación en los pasos irreversibles y log de todo.
5. Fallback multi-LLM
Ya hablé de esto en el post sobre agentes en WhatsApp, pero en voz es todavía más crítico: en una llamada en vivo no tienes el lujo de "prueba de nuevo". Si el LLM primario se traba, el sistema cae al secundario en milisegundos, sin que el cliente lo perciba. Ningún punto único de falla en la respuesta.
Dos canales, un cerebro
ConectaAI atiende por voz y por WhatsApp. La tentación es construir dos sistemas. El error es construir dos sistemas. El canal (teléfono o WhatsApp) es solo la capa de entrada/salida: el cerebro, las herramientas y la lógica de negocio son compartidos.
Esto significa que el mismo agente que resuelve por voz resuelve por texto, con la misma integración con el ERP y las mismas reglas. Un cliente puede empezar en WhatsApp y llamar después, y el contexto lo acompaña. Arquitecturarlo así desde el inicio ahorra meses y evita que los dos canales divirjan en comportamiento.
Por qué no es "solo enchufar un chatbot"
Si sacas una sola lección de aquí, saca esta: un call center de IA de verdad es 20% modelo de lenguaje y 80% ingeniería de sistema en tiempo real e integración. El LLM es la parte fácil y comoditizada. Lo difícil —y donde está el valor— es:
- Hacer que la telefonía SIP no se caiga.
- Mantener la latencia de voz por debajo del umbral del malestar.
- Integrar de verdad con el ERP legado del proveedor.
- Garantizar resiliencia: cola, retry, fallback, observabilidad.
- Saber cuándo pasar al humano con el contexto entero.
Esto es software de infraestructura, no un wrapper de API. Y es exactamente por eso que la mayoría de los "call centers de IA" prometidos por ahí no entrega: se quedaron en el prototipo de texto y nunca encararon la voz en producción.
El resultado que importa
El proveedor no compra "IA". Compra: atención que no duerme, cola que no se desborda en el horario pico, segunda copia de la factura resuelta a las 2 de la mañana sin que nadie se despierte, y equipo humano liberado para resolver lo que es realmente complejo. La IA absorbe lo repetitivo —que es la mayoría— y el humano se ocupa de la excepción.
Esa es la arquitectura de un call center de IA que funciona. No porque el modelo sea inteligente, sino porque el sistema entero fue construido para aguantar el mundo real de un proveedor con miles de clientes llamando.
Construyo productos de IA en producción, incluyendo atención por voz y WhatsApp para proveedores. Si tienes un ISP ahogado en llamadas repetitivas, conversemos.