Deep-dive

Arquitectura de un call center de IA para proveedores de internet

Cómo se construye una atención por voz y WhatsApp que habla con el cliente 24/7: telefonía SIP, STT/TTS en tiempo real, LLM con fallback e integración con el ERP del proveedor.

22 jul 2026·13 min de lectura·.md

Un proveedor de internet (ISP) vive de dos cosas: cliente conectado y cliente atendido. La primera es red; la segunda, históricamente, es gente al teléfono. Y es aquí donde la cuenta no cierra: el volumen de llamadas de "se me cayó internet", "dónde está mi factura", "quiero la segunda copia" es gigante, repetitivo y crece junto con la base. Contratar agentes a la misma velocidad que crece la base es insostenible.

Fue ese problema el que me llevó a construir ConectaAI, un call center de IA que atiende por voz y por WhatsApp, las 24 horas del día, integrado al sistema del proveedor. Este post es la arquitectura detrás de eso. No es teoría: es lo que tiene que existir para que una IA atienda una llamada telefónica de verdad y resuelva el problema del cliente.

El problema real: la voz en tiempo real es difícil

Todo el mundo sabe hacer un chatbot de texto. La voz es otro juego. En una llamada, el cliente habla, espera respuesta, interrumpe, cambia de tema, y cada milisegundo de latencia se percibe como "esta atención es mala". Si la IA tarda 3 segundos en responder, la conversación muere.

Entonces el desafío central es: transformar una llamada telefónica en una conversación con IA con latencia lo suficientemente baja como para sonar humana. Esto se descompone en varias piezas que tienen que funcionar juntas en tiempo real.

Las capas del sistema

1. El borde de telefonía (SIP)

La llamada llega por el mundo de la telefonía tradicional: protocolo SIP, troncales de operadora, todo eso. Ese borde necesita un componente robusto que aguante el tráfico real y haga el puente entre la telefonía y el mundo de la multimedia en tiempo real. Es la capa más aburrida y menos glamorosa, y la que más se rompe si te equivocas. Se ocupa del registro de troncal, el ruteo de la llamada y la conversión del audio de la telefonía (codecs, RTP) a algo que el resto del sistema entienda.

2. El transporte de multimedia en tiempo real

Con la llamada establecida, el audio necesita fluir con latencia mínima entre el cliente y el agente de IA. Aquí entra una capa de multimedia en tiempo real (del mundo WebRTC/streaming) que transporta el audio en ambos sentidos. Piénsala como el "tubo" por donde circula la voz, optimizado para tiempo real, no para calidad de estudio.

3. El pipeline de voz del agente

Este es el corazón. En un loop continuo, para cada turno de habla del cliente:

Audio del cliente
   → STT (speech-to-text)   transcribe en tiempo real, con detección de fin de habla
   → LLM                    entiende la intención, decide la respuesta y las herramientas
   → TTS (text-to-speech)   sintetiza la respuesta en voz natural
   → Audio de vuelta al cliente

Cada etapa tiene que ser streaming. El STT no espera a que el cliente termine la frase para empezar a transcribir. El TTS empieza a hablar apenas las primeras palabras de la respuesta salen del LLM. Es esa superposición la que tumba la latencia percibida.

Algunos puntos que aprendí:

4. El cerebro: LLM con contexto y herramientas

El LLM no conversa en el vacío. Recibe:

Y es en las herramientas donde ocurre la magia de negocio. El agente no describe cómo resolver: resuelve.

Esto exige integración directa con el ERP del proveedor (en el mundo de los ISP, dominan sistemas como el IXC). Cada herramienta es una llamada de API validada, con confirmación en los pasos irreversibles y log de todo.

5. Fallback multi-LLM

Ya hablé de esto en el post sobre agentes en WhatsApp, pero en voz es todavía más crítico: en una llamada en vivo no tienes el lujo de "prueba de nuevo". Si el LLM primario se traba, el sistema cae al secundario en milisegundos, sin que el cliente lo perciba. Ningún punto único de falla en la respuesta.

Dos canales, un cerebro

ConectaAI atiende por voz y por WhatsApp. La tentación es construir dos sistemas. El error es construir dos sistemas. El canal (teléfono o WhatsApp) es solo la capa de entrada/salida: el cerebro, las herramientas y la lógica de negocio son compartidos.

Esto significa que el mismo agente que resuelve por voz resuelve por texto, con la misma integración con el ERP y las mismas reglas. Un cliente puede empezar en WhatsApp y llamar después, y el contexto lo acompaña. Arquitecturarlo así desde el inicio ahorra meses y evita que los dos canales divirjan en comportamiento.

Por qué no es "solo enchufar un chatbot"

Si sacas una sola lección de aquí, saca esta: un call center de IA de verdad es 20% modelo de lenguaje y 80% ingeniería de sistema en tiempo real e integración. El LLM es la parte fácil y comoditizada. Lo difícil —y donde está el valor— es:

Esto es software de infraestructura, no un wrapper de API. Y es exactamente por eso que la mayoría de los "call centers de IA" prometidos por ahí no entrega: se quedaron en el prototipo de texto y nunca encararon la voz en producción.

El resultado que importa

El proveedor no compra "IA". Compra: atención que no duerme, cola que no se desborda en el horario pico, segunda copia de la factura resuelta a las 2 de la mañana sin que nadie se despierte, y equipo humano liberado para resolver lo que es realmente complejo. La IA absorbe lo repetitivo —que es la mayoría— y el humano se ocupa de la excepción.

Esa es la arquitectura de un call center de IA que funciona. No porque el modelo sea inteligente, sino porque el sistema entero fue construido para aguantar el mundo real de un proveedor con miles de clientes llamando.


Construyo productos de IA en producción, incluyendo atención por voz y WhatsApp para proveedores. Si tienes un ISP ahogado en llamadas repetitivas, conversemos.

LS
Escrito por Lucas Silva
Construyo productos de IA en producción — del diagnóstico al deploy.
Call Center IATelefoníaSIPLiveKitISPProveedoresVozSTTTTS

¿Tienes un problema de negocio para resolver con IA?

Cuéntame el problema y te devuelvo un producto funcionando de verdad.

Hablar conmigo

Sigue leyendo

Guía

Guardrails: cómo impedir que un agente de IA haga tonterías en producción

Un LLM alucina, obedece a quien lo manipula y se equivoca con confianza. La guía práctica de las barreras (guardrails) que separan un agente seguro de un accidente esperando a ocurrir.

Guía

MCP (Model Context Protocol): qué es y por qué importa para los agentes de IA

La guía directa para entender el Model Context Protocol: qué resuelve, cuándo usarlo y por qué se convirtió en el 'USB-C' que conecta los agentes de IA a las herramientas de tu negocio.