Deep-dive

O stack de voz para agentes de IA: STT, LLM, TTS e a orquestração

As peças que fazem uma IA atender uma ligação telefônica: telefonia SIP, transcrição em tempo real, LLM, síntese de voz e a orquestração que junta tudo com baixa latência.

22 jul 2026·10 min de leitura·.md

Fazer uma IA responder no chat é problema resolvido. Fazer uma IA atender uma ligação de telefone — falar, ouvir, ser interrompida, responder em tempo real sem soar robótica — é um jogo completamente diferente. É engenharia de tempo real de verdade, e a maioria das pessoas subestima quantas peças precisam funcionar juntas em milissegundos. Este é o mapa do stack de voz para agentes de IA, de quem constrói isso.

Por que voz é difícil (e texto não)

No texto, latência é tolerável. O cliente manda a mensagem, você processa com calma, responde três segundos depois — ninguém reclama. Na voz, três segundos de silêncio matam a conversa. O ouvido humano é implacável: latência alta é percebida na hora como "esse atendimento é ruim".

E não é só velocidade. Numa ligação, o cliente interrompe, muda de assunto no meio, fala por cima, hesita. Um agente de voz sério precisa lidar com tudo isso naturalmente — o que exige uma orquestração que o texto simplesmente não precisa. Detalhei parte disso na arquitetura de um call center de IA; aqui vou fundo nas peças.

As camadas do stack

1. Telefonia (SIP)

A ligação chega pelo mundo da telefonia tradicional — protocolo SIP, troncos de operadora, codecs de áudio. Você precisa de uma borda robusta (componentes como o Kamailio vivem aqui) que faça a ponte entre esse mundo e o resto do sistema: registro de tronco, roteamento de chamada, conversão do áudio da telefonia para algo que o pipeline entende. É a camada menos glamourosa e a que mais quebra se você errar.

2. Transporte de mídia em tempo real

Com a chamada estabelecida, o áudio precisa fluir nos dois sentidos com latência mínima. Aqui entra uma camada de mídia do mundo WebRTC/streaming (o LiveKit é um exemplo forte) — o "cano" otimizado pra tempo real por onde a voz trafega.

3. STT — transcrição em tempo real

O áudio do cliente vira texto, em streaming, enquanto ele ainda fala. Provedores como o Deepgram são referência aqui. O que importa:

4. LLM — o cérebro

O texto transcrito vai pro modelo de linguagem, que entende a intenção, decide a resposta e — crucial — chama ferramentas quando precisa agir (consultar um sistema, gerar um boleto). Em voz, duas exigências são inegociáveis:

5. TTS — a voz de volta

A resposta do LLM é sintetizada em fala. Provedores como ElevenLabs e Cartesia oferecem vozes neurais que soam humanas. Aqui a qualidade define a percepção do cliente:

A orquestração: onde a mágica (e a dificuldade) mora

Ter as cinco peças não basta. O que faz a conversa soar natural é a orquestração em streaming, com as etapas sobrepostas em vez de sequenciais:

Cliente fala ─→ STT transcreve (streaming)
                    └─→ LLM já começa a processar
                            └─→ TTS já começa a falar
                                    └─→ cliente ouve — e pode interromper (barge-in)

O barge-in — o cliente interromper a IA no meio da fala — não é opcional. Sem ele, o agente parece uma URA burra. E toda essa dança precisa acontecer com latência total abaixo do limiar do desconforto humano. Frameworks de orquestração de agentes de voz (o ecossistema em torno do LiveKit Agents, por exemplo) existem justamente pra gerenciar esse pipeline. Plataformas como o Retell empacotam boa parte disso num produto, trocando flexibilidade por velocidade de implementação.

Como escolher as peças

Não existe stack "melhor" — existe o certo pro seu caso. Os eixos de decisão:

O resumo

Um agente de voz é 20% modelo de linguagem e 80% engenharia de tempo real: telefonia que não cai, STT e TTS em streaming, orquestração com barge-in e fallback, tudo dentro de um orçamento de latência brutal. O LLM é a parte comoditizada; o difícil — e onde está o valor — é fazer as cinco camadas dançarem juntas em milissegundos.

É por isso que a maioria dos "atendentes de IA por voz" prometidos por aí não entrega: pararam no protótipo de texto e nunca encararam o tempo real da voz. Encarar isso é exatamente o que eu faço.


Construo agentes de IA por voz em produção — do SIP ao TTS, com a orquestração que aguenta ligação de verdade. Se você quer uma IA atendendo no telefone, vamos conversar.

Perguntas frequentes

Quais são as peças de um agente de IA por voz?

Cinco camadas: (1) a borda de telefonia (SIP) que conecta a ligação; (2) o transporte de mídia em tempo real que carrega o áudio; (3) o STT (speech-to-text) que transcreve a fala; (4) o LLM que entende e decide a resposta, chamando ferramentas quando preciso; (5) o TTS (text-to-speech) que sintetiza a resposta em voz. A orquestração dessas peças em streaming, com baixa latência, é o que faz a conversa soar natural.

Por que voz é mais difícil que texto para agentes de IA?

Porque voz é implacável com latência. Numa ligação, cada milissegundo de atraso é percebido como atendimento ruim, e o cliente pode interromper, mudar de assunto ou falar por cima. Isso exige processamento em streaming (STT, LLM e TTS sobrepostos), detecção de fim de fala, barge-in (interrupção) e fallback — engenharia de tempo real que o texto não precisa.

Quais ferramentas compõem um stack de voz de IA?

No ecossistema atual: telefonia/mídia com componentes como Kamailio e LiveKit; STT de provedores como Deepgram; LLMs de múltiplos provedores (com fallback); TTS de provedores como ElevenLabs ou Cartesia; e frameworks de orquestração de agentes de voz. Plataformas como Retell também empacotam parte desse pipeline. A escolha depende de latência, custo, idioma e qualidade de voz.

LS
Escrito por Lucas Silva
Construo produtos de IA em produção — do diagnóstico ao deploy.
VozSTTTTSLLMSIPLiveKitAgentes de IATelefonia

Tem um problema de negócio pra resolver com IA?

Me conta o problema que eu te devolvo um produto rodando de verdade.

Falar comigo

Continue lendo

Guia

Guardrails: como impedir um agente de IA de fazer besteira em produção

Um LLM alucina, obedece a quem manipula e erra com confiança. O guia prático das travas (guardrails) que separam um agente seguro de um acidente esperando pra acontecer.

Guia

MCP (Model Context Protocol): o que é e por que importa pra agentes de IA

O guia direto pra entender o Model Context Protocol: o que resolve, quando usar, e por que ele virou o 'USB-C' que conecta agentes de IA às ferramentas do seu negócio.