Softonic relatou esta semana que OpenAI e Anthropic divulgaram conjuntamente um lote de vulnerabilidades de agentes de IA, e a questão de responsabilidade que se segue é a verdadeira história. Se um agente de codificação deleta um diretório porque uma página web mandou ele fazer, alguém tem que responder por isso. A resposta certa de um usuário de desktop não é parar de rodar agentes. É rodá-los atrás de guardrails. Testamos 7 aplicativos que filtram entradas e saídas de agentes, isolam sua execução e registram o que eles fazem, para que quando algo der errado possamos apontar para o prompt exato que causou.
O que procurar em um aplicativo de segurança de agentes de IA
A segurança do agente se divide em três problemas: o que o agente lê, o que o agente faz e o que o agente deixa para trás. Qualquer configuração real deve cobrir os três.
- Filtragem de entrada de prompt para injeção de prompt e PII
- Validação de saída contra regras estruturais
- Uma sandbox para execução de shell, para que o agente não possa tocar no arquivo errado
- Registros de auditoria de cada prompt, chamada de ferramenta e resposta
- Integração com os agentes de codificação que já usamos (Claude Code, Cursor, Cline)
- Executar localmente onde possível, sem nenhum serviço de terceiros vendo cada prompt
Comparação rápida
| App | Best for | Platforms | Free | Cost | Rating |
|---|---|---|---|---|---|
| Guardrails AI | Guardrails estruturais e de conteúdo | Windows, macOS, Linux, Python | Yes | Free tier + paid Hub | 4.7 (GitHub) |
| NeMo Guardrails | Segurança conversacional baseada em regras | Windows, macOS, Linux | Yes | Free | 4.6 |
| Rebuff | Detecção de injeção de prompt | Windows, macOS, Linux, cloud | Yes | Free tier | 4.5 |
| Docker Desktop | Sandbox de contêiner para agentes | Windows, macOS, Linux | Yes | 9/user/mo Pro | 4.5 |
| gVisor | Sandbox a nível de kernel para contêineres | Linux, macOS Docker | Yes | Free | 4.4 |
| Firecracker | Micro-VMs para isolamento leve | Linux | Yes | Free | 4.6 |
| LangKit | Métricas de tempo de execução para prompts LLM | Windows, macOS, Linux | Yes | Free | 4.5 |
1. Guardrails AI, melhor para guardrails estruturais e de conteúdo
Guardrails AI é uma biblioteca Python e Hub que envolve chamadas de modelo em regras declarativas. Diga “a saída deve ser JSON válido com esses campos”, “a saída não deve conter PII”, “a saída não deve incluir um comando shell”, e a biblioteca reescreve, tenta novamente ou rejeita a chamada. O Hub adiciona um marketplace de validadores pré-construídos.
Onde fica aquém: centrado em Python, então se encaixa melhor em frameworks de agentes do que em casos “eu só quero que Cursor se comporte”.
Preços:
- Free: core library, Apache 2.0
- Paid: Hub Pro tier para validadores compartilhados e aplicação hospedada
Plataformas: Windows, macOS, Linux, Python
Download: Guardrails AI | GitHub
Bottom line: a ferramenta para escolher quando estamos escrevendo nosso próprio agente e queremos que ele falhe barulhentamente em saída incorreta.
2. NeMo Guardrails, melhor para segurança conversacional baseada em regras
NeMo Guardrails da NVIDIA nos permite descrever políticas em uma pequena linguagem específica do domínio, Colang, depois envolve qualquer chamada LLM. Uma política poderia dizer “se o usuário perguntar sobre um prompt de sistema, recuse”, ou “sempre chame a ferramenta de recuperação antes de responder perguntas de domínio”. Colang executa antes, durante e depois da chamada do modelo.
Onde fica aquém: Colang é uma linguagem para aprender, e o runtime adiciona latência.
Preços:
- Free: open source, Apache 2.0
- Paid: nenhum, embora serviços NeMo Enterprise existam para a pilha de treinamento
Plataformas: Windows, macOS, Linux
Download: NeMo Guardrails
Bottom line: vale a pena a curva de aprendizado se o agente for voltado para o usuário e as regras de política devem ficar fora do prompt.
3. Rebuff, melhor para detecção de injeção de prompt
Rebuff é uma pequena biblioteca dedicada a um problema: capturar injeção de prompt antes que chegue ao modelo. Usa heurística, um banco de dados vetorial de strings de ataque conhecidas e uma abordagem de canary token. Qualquer coisa que pareça uma injeção é sinalizada, e o código chamador decide o que fazer.
Onde fica aquém: heurística tem falsos positivos, e a abordagem vetorial requer um banco de dados vetorial em execução.
Preços:
- Free: open source, MIT
- Paid: cloud tier com banco de dados vetorial hospedado e corpus de ataque compartilhado
Plataformas: Python, JavaScript, cloud
Download: Rebuff
Bottom line: a ferramenta especializada. Conecte-a antes da biblioteca guardrail de uso geral.
4. Docker Desktop, melhor para sandbox de contêiner familiar
Docker Desktop é a entrada menos glamourosa da lista e provavelmente a mais útil. Execute coding agents dentro de um contêiner com o repo montado read-write e tudo o mais read-only, e nem mesmo um prompt hostil pode deletar a máquina. Volumes tornam os handoffs ao host explícitos.
Onde fica aquém: o aplicativo desktop é pesado em RAM, e o licenciamento mudou duas vezes em três anos.
Preços:
- Free: Personal e pequenas equipes (menos de 250 funcionários)
- Paid: 9/user/mo Pro, mais para Team
Plataformas: Windows, macOS, Linux
Download: Docker Desktop
Bottom line: a resposta prática para “como deixo Claude executar npm install sem dar acesso ao meu sistema de arquivos”.
5. gVisor, melhor para sandbox a nível de kernel
gVisor é um kernel em espaço de usuário escrito pelo Google. Contêineres executados sob gVisor só podem fazer um subconjunto de syscalls, então nem mesmo uma fuga de contêiner pode alcançar o kernel do host. É mais pesado que um contêiner normal mas muito mais leve que uma VM completa.
Onde fica aquém: overhead de desempenho é real, e nem toda carga de trabalho funciona sob ele sem ajustes.
Preços:
- Free: open source, Apache 2.0
- Paid: nenhum
Plataformas: Linux, e Linux-inside-Docker no macOS
Bottom line: a camada de isolamento mais profunda, para agentes que tocam código de estranhos.
6. Firecracker, melhor para micro-VMs
Firecracker é um hipervisor baseado em KVM para micro-VMs. Tempos de boot estão abaixo de um segundo, a pegada de memória é medida em megabytes, e isolamento é mais próximo a uma VM completa do que a um contêiner. AWS Lambda roda nele. Localmente, uma Firecracker VM por execução de agente mantém o raio de explosão de cada trabalho contido.
Onde fica aquém: apenas Linux, e a configuração não é um exercício de cinco minutos.
Preços:
- Free: open source, Apache 2.0
- Paid: nenhum
Plataformas: Linux
Download: Firecracker | GitHub
Bottom line: a opção de isolamento local mais forte aquém de uma VM completa.
7. LangKit, melhor para métricas de tempo de execução e observabilidade
LangKit da WhyLabs mede cada prompt e resposta para text quality, toxicidade, sentimento, similaridade com injeções conhecidas e PII. Fica na frente de qualquer chamada LLM, e dashboards mostram anomalias ao longo do tempo. O ponto não é bloquear, é notar.
Onde fica aquém: observabilidade sozinha não para um ataque, explica o que aconteceu depois do fato.
Preços:
- Free: open source, Apache 2.0
- Paid: plataforma WhyLabs para dashboards hospedados, a partir de cerca de 200/mo
Plataformas: Windows, macOS, Linux
Download: LangKit
Bottom line: a camada “o que acabou de acontecer”. Combine com qualquer um dos aplicadores acima.
Como escolher o certo
- Para reescrever ou recusar saída ruim do modelo: Guardrails AI.
- Para regras de política fora do prompt: NeMo Guardrails.
- Para detecção de injeção de prompt especificamente: Rebuff.
- Para sandbox de execução de shell de forma pragmática: Docker Desktop.
- Para isolamento mais profundo no Linux: gVisor.
- Para isolamento de micro-VM: Firecracker.
- Para medir o que os agentes fazem: LangKit.
- Para auditoria a nível de prompt: PromptLayer vale a pena uma olhada, captura cada request e response com metadados.
Uma configuração defensável de desktop geralmente empilha três destes: uma sandbox (Docker Desktop), uma camada guardrail (Guardrails AI ou NeMo), e observabilidade (LangKit ou PromptLayer).
FAQ
Eu realmente preciso fazer sandbox de coding agents?
Se o agente executa comandos shell ou escreve arquivos, sim. Se só faz chat, não. A linha é se injeção de prompt pode virar uma ação.
Qual é o primeiro passo mais fácil?
Docker Desktop com um contêiner bloqueado para o coding agent. Adicione Guardrails AI à chamada do modelo. Isso já bloqueia a maioria dos danos acidentais.
Essas ferramentas podem proteger o modelo contra ataques de estilo Astra?
Contra ataques diretos ao modelo, não. Nada nesta lista muda os pesos do modelo. Contra injeção de prompt, vazamento de PII e chamadas de ferramenta inseguras, sim.
Os free tiers são suficientes?
Para um único desenvolvedor, sim. Guardrails AI, NeMo Guardrails, Rebuff, gVisor, Firecracker, LangKit e PromptLayer todos têm free tiers reais. Apenas Docker Desktop começa a cobrar além de equipes muito pequenas.
Isso deixa o agente mais lento?
Guardrails adicionam latência, às vezes centenas de milissegundos. Sandboxes adicionam latência negligenciável para contêineres e um pouco mais para micro-VMs. Negocie a latência pela segurança, sempre.