Guia

Guardrails: como impedir um agente de IA de fazer besteira em produção

Um LLM alucina, obedece a quem manipula e erra com confiança. O guia prático das travas (guardrails) que separam um agente seguro de um acidente esperando pra acontecer.

2 set 2026·11 min de leitura·.md

Um modelo de linguagem tem três defeitos que não dá pra ignorar quando ele vira um agente que age no mundo real: ele alucina (inventa com confiança), ele obedece (pode ser manipulado a fazer o que não devia) e ele não tem noção de consequência (pra ele, mandar um PIX e mandar um "bom dia" são a mesma operação de texto).

Enquanto o agente só conversa, isso é chato. Quando ele executa — paga, cancela, apaga, desbloqueia — isso é perigoso. Guardrails são as travas que garantem que, mesmo quando o modelo erra, ele não causa estrago. Este é o guia prático de quem opera agentes em produção.

A regra que rege tudo: o modelo não é a autoridade

Se você levar uma única frase deste texto, leve esta: o LLM decide o que fazer; quem executa, valida e permite é o seu código. Já escrevi isso no guia de function calling, e ele volta aqui como a base de toda segurança de agente.

O erro clássico é confiar no modelo pra se comportar porque você "pediu bonito no prompt". Prompt orienta; não garante. A trava de verdade é determinística e vive fora do modelo — na camada que recebe a decisão dele e escolhe se obedece. O modelo propõe; o seu código dispõe.

Com esse princípio no lugar, os guardrails se organizam em camadas.

1. Guardrail de entrada

Antes de a mensagem chegar ao modelo:

2. Guardrail de ferramenta (o mais crítico)

É aqui que o dano acontece, então é aqui que a trava tem que ser mais dura. Cada ação que muda estado no mundo real passa por validação antes de executar:

A regra de ouro: toda ferramenta que muda o mundo real precisa de validação, confirmação (quando irreversível) e log. O LLM pode alucinar; a camada de ferramentas não pode.

3. Guardrail de saída

Antes de a resposta chegar ao cliente:

4. Guardrail de operação

O que roda o tempo todo, por baixo:

O equilíbrio: trava demais também quebra o produto

Guardrail em excesso vira um agente que recusa tudo, pede confirmação pra respirar e frustra o cliente — aí ninguém usa, e um produto que ninguém usa não protege nada. A arte é calibrar pelo risco da ação: responder "qual meu boleto?" é baixo risco, libera; "cancela meu plano" é irreversível, confirma. Trave forte onde o estrago é grande; deixe fluir onde não é.

Isso conversa direto com a minha tese de produto no ar: segurança que impede o produto de existir não é segurança, é paralisia. O objetivo é um agente que aguenta o mundo real — inclusive os usuários mal-intencionados — sem deixar de ser útil pros de bem.

O resumo honesto

Um agente de IA em produção é confiável não porque o modelo é esperto, mas porque a arquitetura ao redor dele não confia cegamente nele. O modelo propõe; o código valida, autoriza, confirma e registra. Prompt orienta; código garante. Trave por camadas — entrada, ferramenta, saída, operação — e calibre pelo risco de cada ação.

Quem pula isso entrega uma demo que encanta e um agente que, no primeiro usuário esperto ou na primeira alucinação cara, vira notícia ruim. Guardrail não é o que trava o produto — é o que deixa ele ir pra produção com segurança.


Construo agentes de IA que agem em produção com as travas que o mundo real exige — validação, confirmação, observabilidade. Se você vai colocar um agente pra executar de verdade, vamos conversar.

Perguntas frequentes

O que são guardrails em um agente de IA?

São as travas e validações que limitam o que o agente pode dizer e fazer — checagem da entrada, restrição da saída, validação de cada chamada de ferramenta, confirmação em ações irreversíveis e limites de escopo. O objetivo é garantir que, mesmo quando o modelo erra ou é manipulado, ele não cause dano.

Por que um LLM precisa de guardrails?

Porque um LLM alucina (inventa dados com confiança), pode ser manipulado por prompt injection e não tem noção nativa de consequência. Sem travas, um agente que executa ações no mundo real (pagar, cancelar, apagar) pode agir sobre uma alucinação. Os guardrails ficam na sua camada de código, não no modelo.

Guardrails ficam no prompt ou no código?

Nos dois, mas a trava que importa é no código. Instruções no prompt ajudam o modelo a se comportar, mas podem ser contornadas por manipulação. A validação determinística — no seu código, antes de executar qualquer ação — é a que não pode ser 'convencida' a ceder. Prompt orienta; código garante.

LS
Escrito por Lucas Silva
Construo produtos de IA em produção — do diagnóstico ao deploy.
GuardrailsSegurançaAgentes de IALLMProduçãoPrompt Injection

Tem um problema de negócio pra resolver com IA?

Me conta o problema que eu te devolvo um produto rodando de verdade.

Falar comigo

Continue lendo

Guia

MCP (Model Context Protocol): o que é e por que importa pra agentes de IA

O guia direto pra entender o Model Context Protocol: o que resolve, quando usar, e por que ele virou o 'USB-C' que conecta agentes de IA às ferramentas do seu negócio.

Case

Nove fundadores, três dias, nove projetos no ar

Fui mentor na imersão Founders AI do Paris Group, em Chapecó. Acompanhei nove empresários do gargalo real ao produto funcionando — e apresentei o ConectaAI com uma ligação atendida ao vivo por IA. O que faz uma imersão entregar em três dias.