Fazer uma IA responder no chat é problema resolvido. Fazer uma IA atender uma ligação de telefone — falar, ouvir, ser interrompida, responder em tempo real sem soar robótica — é um jogo completamente diferente. É engenharia de tempo real de verdade, e a maioria das pessoas subestima quantas peças precisam funcionar juntas em milissegundos. Este é o mapa do stack de voz para agentes de IA, de quem constrói isso.
Por que voz é difícil (e texto não)
No texto, latência é tolerável. O cliente manda a mensagem, você processa com calma, responde três segundos depois — ninguém reclama. Na voz, três segundos de silêncio matam a conversa. O ouvido humano é implacável: latência alta é percebida na hora como "esse atendimento é ruim".
E não é só velocidade. Numa ligação, o cliente interrompe, muda de assunto no meio, fala por cima, hesita. Um agente de voz sério precisa lidar com tudo isso naturalmente — o que exige uma orquestração que o texto simplesmente não precisa. Detalhei parte disso na arquitetura de um call center de IA; aqui vou fundo nas peças.
As camadas do stack
1. Telefonia (SIP)
A ligação chega pelo mundo da telefonia tradicional — protocolo SIP, troncos de operadora, codecs de áudio. Você precisa de uma borda robusta (componentes como o Kamailio vivem aqui) que faça a ponte entre esse mundo e o resto do sistema: registro de tronco, roteamento de chamada, conversão do áudio da telefonia para algo que o pipeline entende. É a camada menos glamourosa e a que mais quebra se você errar.
2. Transporte de mídia em tempo real
Com a chamada estabelecida, o áudio precisa fluir nos dois sentidos com latência mínima. Aqui entra uma camada de mídia do mundo WebRTC/streaming (o LiveKit é um exemplo forte) — o "cano" otimizado pra tempo real por onde a voz trafega.
3. STT — transcrição em tempo real
O áudio do cliente vira texto, em streaming, enquanto ele ainda fala. Provedores como o Deepgram são referência aqui. O que importa:
- Streaming, não batch. O STT começa a transcrever antes de o cliente terminar a frase.
- Detecção de fim de fala (endpointing). Saber quando o cliente terminou é decisivo — cortar cedo irrita, esperar demais soa lento.
- Idioma e sotaque. Em português, a qualidade do STT com sotaques regionais faz toda a diferença.
4. LLM — o cérebro
O texto transcrito vai pro modelo de linguagem, que entende a intenção, decide a resposta e — crucial — chama ferramentas quando precisa agir (consultar um sistema, gerar um boleto). Em voz, duas exigências são inegociáveis:
- Baixíssima latência, porque o cliente está esperando ao vivo.
- Fallback entre provedores: numa ligação, não existe "tenta de novo". Se o LLM primário engasga, cai pro secundário em milissegundos.
5. TTS — a voz de volta
A resposta do LLM é sintetizada em fala. Provedores como ElevenLabs e Cartesia oferecem vozes neurais que soam humanas. Aqui a qualidade define a percepção do cliente:
- Voz natural. Uma voz robótica destrói a confiança na hora.
- Streaming. O TTS começa a falar assim que as primeiras palavras saem do LLM — não espera a resposta inteira.
- Fallback de TTS também, porque nenhum provedor tem 100% de uptime.
A orquestração: onde a mágica (e a dificuldade) mora
Ter as cinco peças não basta. O que faz a conversa soar natural é a orquestração em streaming, com as etapas sobrepostas em vez de sequenciais:
Cliente fala ─→ STT transcreve (streaming)
└─→ LLM já começa a processar
└─→ TTS já começa a falar
└─→ cliente ouve — e pode interromper (barge-in)
O barge-in — o cliente interromper a IA no meio da fala — não é opcional. Sem ele, o agente parece uma URA burra. E toda essa dança precisa acontecer com latência total abaixo do limiar do desconforto humano. Frameworks de orquestração de agentes de voz (o ecossistema em torno do LiveKit Agents, por exemplo) existem justamente pra gerenciar esse pipeline. Plataformas como o Retell empacotam boa parte disso num produto, trocando flexibilidade por velocidade de implementação.
Como escolher as peças
Não existe stack "melhor" — existe o certo pro seu caso. Os eixos de decisão:
- Latência: cada provedor adiciona milissegundos. O orçamento total de latência é apertado.
- Idioma: qualidade de STT/TTS em português (com sotaques) varia muito entre provedores.
- Custo: STT e TTS cobram por minuto; some ao custo de LLM e telefonia.
- Qualidade de voz: o que soa natural pro seu público.
- Build vs. buy: montar o pipeline peça por peça (mais controle e otimização) ou usar uma plataforma que empacota (mais rápido pra começar).
O resumo
Um agente de voz é 20% modelo de linguagem e 80% engenharia de tempo real: telefonia que não cai, STT e TTS em streaming, orquestração com barge-in e fallback, tudo dentro de um orçamento de latência brutal. O LLM é a parte comoditizada; o difícil — e onde está o valor — é fazer as cinco camadas dançarem juntas em milissegundos.
É por isso que a maioria dos "atendentes de IA por voz" prometidos por aí não entrega: pararam no protótipo de texto e nunca encararam o tempo real da voz. Encarar isso é exatamente o que eu faço.
Construo agentes de IA por voz em produção — do SIP ao TTS, com a orquestração que aguenta ligação de verdade. Se você quer uma IA atendendo no telefone, vamos conversar.