"Quanto custa pra colocar uma IA atendendo meu WhatsApp?" É a primeira pergunta de quase todo cliente — e a resposta honesta é: depende, mas dá pra estimar direito. Quem te dá um número redondo sem perguntar nada está chutando ou escondendo custo. Vou abrir a conta de verdade, camada por camada, pra você orçar sem cair em armadilha.
O custo tem três camadas — e elas são diferentes
Muita gente pensa "custo de IA" como uma coisa só. São três, com comportamentos distintos:
- A plataforma (WhatsApp Business API): o que a Meta cobra pra mensagem trafegar.
- O cérebro (LLM): o que você paga pra IA pensar em cada mensagem.
- A construção e a infraestrutura: o que custa fazer o agente existir e ficar de pé.
As duas primeiras são custo variável (crescem com o uso). A terceira é majoritariamente investimento inicial. Misturar as três é o que gera orçamento errado.
Camada 1 — WhatsApp Business API (por conversa)
A WABA não é gratuita de operar. A Cloud API da Meta é gratuita de hospedar, mas a Meta cobra pelas conversas/mensagens, com regras que mudam o preço:
- Quem iniciou: conversa iniciada pelo cliente (dentro da janela de 24h) x iniciada por você (template) têm custos diferentes.
- Categoria do template: marketing, utility e authentication têm preços distintos.
- País: o preço varia por região.
Detalhei essas regras no guia da WhatsApp Business API. O importante pro orçamento: esse custo é por conversa e previsível. Se você sabe quantas conversas/mês espera, sabe estimar essa camada.
Camada 2 — O LLM (por mensagem processada)
Cada vez que o agente "pensa", ele consome tokens de um modelo de linguagem, e isso tem preço. O custo aqui depende de:
- Volume: mais mensagens = mais chamadas = mais custo.
- Tamanho do contexto: históricos longos e prompts gigantes custam mais por chamada.
- O modelo escolhido: modelos topo de linha custam múltiplas vezes o preço dos modelos menores.
Aqui mora a maior alavanca de otimização. A maioria das mensagens é simples ("qual meu boleto?") e não precisa do modelo mais caro. Um agente bem arquitetado usa modelo barato para o simples e o caro só quando a conversa exige raciocínio — e roda com fallback entre provedores. Isso pode reduzir o custo de LLM em ordens de grandeza sem perder qualidade.
Camada 3 — Construção e infraestrutura
Esta é a que ninguém coloca na planilha e depois se assusta. Um agente que aguenta produção não é um script de fim de semana. Ele precisa de:
- Integração real com os seus sistemas (CRM, ERP, gateway de pagamento) — as ferramentas que fazem o agente resolver, não só conversar.
- Arquitetura resiliente: fila, idempotência, fallback, observabilidade.
- Lógica de negócio, tratamento da janela de 24h, human handoff.
É aqui que está o grosso do investimento — e é o que separa um agente que gera resultado de um bot que frustra cliente. É investimento inicial, não custo recorrente: bem construído, ele roda barato e escala.
Se for por voz, some uma camada
Agente de voz (call center de IA por telefone) adiciona transcrição (STT) e síntese de fala (TTS), geralmente cobradas por minuto de áudio. Isso torna a operação de voz mais cara por interação que o texto — mas ainda absurdamente mais barata que um atendente humano na mesma escala. A arquitetura de voz tem suas próprias exigências.
Como orçar de verdade (o método honesto)
Antes de perguntar "quanto custa", responda:
- Volume: quantas conversas por mês? (define as camadas 1 e 2)
- Canal: texto (WhatsApp) ou voz? (voz soma STT/TTS)
- Complexidade: o agente só responde, ou precisa integrar com seus sistemas e agir? (define a camada 3)
- Uma pergunta comparativa: quanto essa operação custa hoje em horas de time humano?
Essa última pergunta é a que importa. Um agente de IA quase nunca é avaliado no vácuo — é avaliado contra o custo de fazer o mesmo com gente. E é aí que a conta costuma fechar com folga: o repetitivo, que é a maioria, sai por uma fração do custo humano, 24/7, sem fila.
A resposta curta
Não existe preço de tabela porque não existe agente genérico. Mas a estrutura é sempre essa: um custo variável por conversa (WABA + LLM) que otimização mantém baixo, mais um investimento inicial de construção que define se o agente resolve ou frustra. Fuja de quem te dá um número sem perguntar teu volume e teus sistemas — e fuja mais ainda de quem esconde a camada 3.
Faço o diagnóstico e te digo a conta real pro teu caso — volume, canal, integração. Se você quer orçar um agente de IA sem chute, me chama.