Firewall de scraper de IA auto-hospedado Anubis

Os bots web do Meta geraram nove bilhões de requisições em um único trimestre este ano, e o tráfego de saída quase nunca retornou aos sites que os crawlers raspadaram. O Cloudflare agora bloqueia por padrão bots de treinamento e agentes em qualquer página que mostre anúncios. A linha entre “visita de busca” e “corpus de treinamento” se moveu, e se você gerencia um site, provavelmente quer estar no lado “bloqueador” disso.

As melhores aplicações para bloquear web scrapers de IA em desktop em 2026 se dividem em três categorias: serviços edge que bloqueiam no borde da rede antes que as requisições cheguem ao seu origin, firewalls proof-of-work auto-hospedados que rodam ao lado da sua aplicação, e regras do lado origin que filtram requisições após chegarem. Escolhemos sete que funcionam juntas, desde um simples toggle do Cloudflare até Anubis (já implantado pelo código fonte do kernel Linux, Codeberg e FFmpeg).

O que procurar em uma ferramenta de bloqueio de scrapers de IA

Comparação rápida

Ferramenta Melhor para Plano gratuito Pago Implantação
Cloudflare AI Crawl Control Qualquer site atrás do Cloudflare Incluído em todos os níveis Incluído com Cloudflare Pro/Biz Toggle de um clique
Dark Visitors (Known Agents) Visibilidade sobre quais bots de IA visitam você Nível gratuito Planos de equipe a partir de uma taxa mensal modesta robots.txt + rastreador de agentes
Anubis Muro proof-of-work auto-hospedado Open source, gratuito Apenas gratuito Proxy reverso (binário Go)
Nepenthes Desperdiçar tempo de scrapers ativamente Open source, gratuito Apenas gratuito Contêiner tarpit
Fail2Ban Ferramenta de bloqueio por log do lado origin Open source, gratuito Apenas gratuito Daemon de servidor
ModSecurity + OWASP CRS WAF baseado em regras do lado origin Open source, gratuito Gratuito com conjuntos de regras comerciais Módulo nginx/Apache
DataDome Gerenciamento de bots de nível empresarial Apenas avaliação Contratos empresariais Integração Edge / API

As ferramentas

1. Cloudflare AI Crawl Control – Melhor bloqueador de um clique para qualquer site

Cloudflare AI Crawl Control é a forma mais rápida de parar bots de treinamento de IA. Qualquer cliente em qualquer nível (incluindo gratuito) pode ir para Security → Bots no painel e ativar o toggle “AI Crawls and Scrapers”. Ele usa o banco de dados de impressões digitais de bots do Cloudflare mais sinais comportamentais para identificar GPTBot, ClaudeBot, Applebot Extended, PerplexityBot e centenas de outros. A partir de 15 de setembro de 2026, novos domínios bloqueiam por padrão bots de treinamento e agentes em páginas que exibem anúncios.

Como funciona no borde da rede, requisições bloqueadas nunca tocam seu origin. Isso economiza largura de banda e CPU do origin, e não importa qual stack seu site usa. Você também pode permitir bots específicos (Googlebot permanece verde por padrão), cobrar acesso através do programa de pagamento por crawl do Cloudflare, ou escrever regras personalizadas para controle mais fino.

Onde é insuficiente: Útil apenas se seu site está atrás do Cloudflare. O classificador do Cloudflare às vezes rotula incorretamente crawlers de pesquisa ou arquivo legítimos, então verifique a analítica antes de deixá-lo no piloto automático para algo importante.

Preços:

Plataformas: Qualquer site em frente ao Cloudflare (origins Windows, macOS, Linux funcionam)

Conclusão: Se você está no Cloudflare, ative isto antes de ler o resto da lista.

2. Dark Visitors (Known Agents) – Melhor para saber quais bots realmente visitam você

Dark Visitors (renomeado Known Agents em 2026) é a camada de visibilidade que falta na maioria dos sites. Mantém um banco de dados curado de agentes de IA (bots de treinamento, scrapers RAG, agentes de navegação, copilots LLM) e fornece um arquivo robots.txt atualizado em tempo real e um painel de análise mostrando quais estão realmente batendo. Adicione um snippet e obtenha números reais sobre GPTBot, ClaudeBot, PerplexityBot e dezenas de agentes mais novos que você provavelmente não ouviu falar.

O nível gratuito cobre o essencial: lista de agentes, arquivo robots.txt, rastreamento básico de visitas. Os níveis pagos desbloqueiam análise completa, múltiplos sites e acesso a API. Funciona bem com Cloudflare: Cloudflare diz o que foi bloqueado no edge, Known Agents diz o que tentou (e para tudo que Cloudflare ainda não reconhece) o que ainda passou.

Onde é insuficiente: robots.txt é uma solicitação, não uma regra. Crawlers bem comportados a respeitam; maus atores a ignoram. Esta ferramenta diz a verdade sobre quem está ignorando as regras, mas não força conformidade por conta própria.

Preços:

Plataformas: Qualquer site (baseado em snippet)

Conclusão: Instale isto mesmo se já tiver Cloudflare, porque mostra quais bots se tornando um problema crescente.

3. Anubis – Melhor muro auto-hospedado contra scrapers de IA

Anubis é um Web AI Firewall auto-hospedado escrito em Go pela TecharoHQ. Fica como um proxy reverso em frente à sua aplicação e emite um desafio de proof-of-work JavaScript antes de servir uma requisição. Navegadores reais resolvem o desafio invisível em uma fração de segundo; scrapers ingênuos travam porque não executam JS ou não querem queimar ciclos de CPU em sua escala.

A adoção conta a história: Codeberg, FFmpeg, código fonte do kernel Linux e a maioria dos projetos FOSS non-Cloudflare o executam. Configuração é um único arquivo YAML; você aponta Anubis para seu upstream, define dificuldade de desafio por rota e adiciona listas de permissão para bots bons (Googlebot, IA_Archiver, etc.).

Onde é insuficiente: Scrapers executando JS (Chromium headless, Playwright) também podem resolver o PoW; apenas pagam um custo de CPU modesto. Anubis é um forte dissuasivo, não um muro impenetrável. Também adiciona um pequeno atraso de hop para cada requisição.

Preços:

Plataformas: Linux (Docker, systemd), Windows, macOS (via binário Go)

Conclusão: A escolha certa quando você gerencia sua própria infraestrutura e não quer rotear através do Cloudflare.

4. Nepenthes – Melhor para desperdiçar tempo de scrapers

Nepenthes toma a abordagem oposta: em vez de bloquear scrapers, arrasta-os para um labirinto infinito de páginas geradas proceduralmente e plausíveis que nunca terminam. O resultado é um tarpit que custa ao scraper CPU e largura de banda enquanto não retorna dados de treinamento úteis. Feito especificamente como resposta a crawlers de IA ignorando robots.txt, foi adotado por administradores que querem aumentar ativamente o custo do scraping em vez de recusá-lo passivamente.

Implante como um contêiner Docker em um subdomínio ou caminho, adicione uma diretiva robots.txt apontando bots ruins para ele, e observe o crawler desperdiçar seus recursos. Também envenena ligeiramente os dados de treinamento: qualquer scraper que ingira a saída do Nepenthes traz texto barulhento mas plausível mas falso de volta para qualquer pipeline que alimente.

Onde é insuficiente: Eticamente questionável para alguns operadores; você está servindo dados enganosos intencionalmente. Afeta apenas bots que não respeitam robots.txt em primeiro lugar, que é o ponto mas também vale considerar.

Preços:

Plataformas: Linux (Docker) principalmente; macOS e Windows via Docker

Conclusão: Adicione isto uma vez que já tenha bloqueio em vigor e queira tornar scraping ativamente custoso.

5. Fail2Ban – Melhor ferramenta de bloqueio por log do lado origin

Fail2Ban é a ferramenta clássica para ler logs de servidor, detectar padrões e enviar bloqueios de nível IP para o firewall. Todo administrador Linux conhece. Para scraping de IA especificamente, um filtro Fail2Ban pode monitorar logs nginx ou Apache para regex de User-Agent (GPTBot, ClaudeBot, Bytespider, etc.), ou para assinaturas comportamentais (surtos de requisições por segundo de um IP único), e colocar o infrator em iptables.

Como o bloqueio ocorre no firewall do kernel, o origin não gasta ciclos servindo o scraper em absoluto. Combine com setup do Cloudflare no edge e Anubis no meio, e você tem defesa em profundidade.

Onde é insuficiente: Bloqueios baseados em IP são frágeis contra proxies residenciais rotativos, que scrapers sérios usam. E filtros devem ser escritos e ajustados; não é instalação de um clique.

Preços:

Plataformas: Linux (nativo); suporte de Windows e macOS é limitado

Conclusão: Escolha certa para sysadmins que já escrevem filtros regex e querem bloqueio no nível de pacote.

6. ModSecurity + OWASP CRS – Melhor WAF baseado em regras do lado origin

ModSecurity com OWASP Core Rule Set é o WAF open source que administradores nginx e Apache implantam no origin quando não podem ou não querem um serviço edge. O CRS vem com regras para ataques comuns (SQLi, XSS, RCE), e conjuntos de regras de bots de IA mantidos pela comunidade adicionam filtros User-Agent, limites comportamentais e feeds IP conhecidos ruins especificamente para scrapers de IA.

Porque é baseado em regras, você mantém controle total. Você pode colocar em lista branca uma ferramenta de análise interna, bloquear um user-agent específico globalmente, ou escrever regras por caminho. Também funciona bem com Fail2Ban: ModSecurity marca uma requisição como anômala, Fail2Ban lê a marcação e bloqueia a fonte.

Onde é insuficiente: Regras requerem manutenção. Falsos positivos ocorrem em aplicações personalizadas. E é um módulo nativo para nginx ou Apache, então implementações containerizadas precisam de imagens Docker com ele integrado.

Preços:

Plataformas: Linux (nginx/Apache nativo), Windows (via IIS com limitações)

Conclusão: WAF padrão do lado origin quando você não está atrás do Cloudflare e quer transparência total.

7. DataDome – Melhor gerenciamento de bots de nível empresarial

DataDome é aonde você chega quando um blog pessoal escala para um negócio real. Aproximadamente 1.200 empresas na América e Europa executam seu WAF, e opera mais de 85.000 modelos de aprendizado de máquina específicos do cliente, significando que cada site protegido se torna seu próprio desafio de detecção para um scraper. Se integra no edge (via CDN ou DNS), e sua detecção vai além de bots de treinamento de IA para preenchimento de credenciais, fraude de anúncios e fazendas de scraping-as-a-service.

O painel é o mais forte nesta categoria, dando classificação por requisição, desagregação geográfica e estimativas de impacto em receita. O tempo de resposta na detecção é medido em milissegundos. Suporte de nível empresarial está incluído.

Onde é insuficiente: Preço não é para indivíduos; você solicita uma cotação. Configuração requer cooperação com seu DNS, CDN e origin, então é um projeto não um toggle.

Preços:

Plataformas: Qualquer origin (Windows, macOS, Linux); implantado no edge

Conclusão: A escolha certa quando o custo de conteúdo raspado ou fraude é maior que a conta anual de gerenciamento de bots.

Como escolher o certo

FAQ

Qual é o melhor bloqueador de scrapers de IA gratuito?

Cloudflare AI Crawl Control se seu site está atrás do Cloudflare (o nível gratuito o inclui). Se você auto-hospeda, Anubis é a opção open source gratuita mais forte. Ambos abordam o mesmo problema de diferentes lados do stack.

Bots de IA podem contornar o Cloudflare?

Sim, alguns podem. O classificador do Cloudflare é muito bom em bloqueio baseado em assinatura mas scrapers sofisticados usam rotação de proxies residenciais e navegadores headless para parecer humanos. É por isso que defesa em camadas (edge + origin + visibilidade) funciona melhor que qualquer ferramenta única.

Preciso bloquear bots de IA em um blog pessoal?

Isso é sua decisão. Se você quer que seu conteúdo seja usado para treinar LLMs comerciais, não faça nada. Se prefere que não, ative o toggle do Cloudflare ou adicione Anubis. O ponto de equilíbrio mais comum é robots.txt do Known Agents mais bloqueio do Cloudflare para os maiores crawlers de treinamento.

Bloquear bots de IA vai prejudicar meu ranking de busca?

Não se você configurar o bloqueador corretamente. Todas as ferramentas nesta lista podem permitir Googlebot, Bingbot e outros crawlers de busca tradicionais enquanto bloqueiam bots que apenas treinam como GPTBot, ClaudeBot e PerplexityBot. Verifique a lista de permissão antes da implantação.

Qual é a diferença entre Anubis e Cloudflare?

Cloudflare bloqueia no borde da rede antes que as requisições cheguem ao seu servidor. Anubis roda no seu servidor como um proxy reverso e emite um desafio proof-of-work. Cloudflare é mais simples e cobre mais terreno; Anubis é auto-hospedado, transparente e não requer terceiros.