ai
Crawlers de IA bloqueados na edge
O MetricSpot pede a tua página inicial como GPTBot e ClaudeBot. Um 403 da Cloudflare, de uma firewall ou de um plugin de segurança deixa os motores de resposta com IA de fora, diga o que disser o robots.txt.
O que esta verificação faz
Pede a tua página inicial duas vezes, identificando-se com as strings de user agent exatas que a OpenAI e a Anthropic publicam para o GPTBot e o ClaudeBot. A verificação falha quando qualquer um dos pedidos recebe HTTP 401, 403 ou 429, ou uma página de desafio 503 da Cloudflare.
Se a resposta traz cabeçalhos da Cloudflare, o resultado nomeia a Cloudflare; caso contrário diz “WAF/CDN” para saberes que deves olhar para a firewall ou para o plugin de segurança.
É um resultado grave: sobrepõe-se a tudo o resto no módulo de legibilidade IA. Um Allow: / no robots.txt não vale nada se o crawler é rejeitado antes de conseguir ler o ficheiro.
Porque é importante
O robots.txt é um pedido. Um 403 é um muro.
Os crawlers de IA bem comportados leem primeiro o robots.txt e respeitam-no. Mas uma regra de firewall que filtra pelo user agent responde antes de o robots.txt ser servido, por isso o crawler nunca vê as tuas permissões. Do lado dele, o site está simplesmente inacessível.
A causa mais comum em 2026 é o Cloudflare AI Crawl Control (antes “Bots”). Desde meados de 2025 a Cloudflare bloqueia por defeito os crawlers de IA conhecidos nas zonas novas, e muitos proprietários ativaram-no sem perceber que isso também os tira das citações do ChatGPT, do Claude e do Perplexity. Outras causas:
- Bot Fight Mode / Super Bot Fight Mode da Cloudflare
- Regras WAF personalizadas que apanham
GPTBot,ClaudeBotou a palavrabot - Plugins de segurança do WordPress (Wordfence, Shield Security, All In One WP Security) com opções de “bloquear bots de IA”
- Regras de user agent no nginx / Apache copiadas de um snippet de “bloquear scrapers de IA”
Se bloquear os crawlers de IA é uma decisão deliberada, este resultado confirma que funciona. Se queres ser citado pelos motores de resposta, é a primeira coisa a corrigir.
Como corrigir
Cloudflare
- Abre o teu domínio no painel da Cloudflare e vai a AI Crawl Control (contas antigas: Security → Bots).
- Desativa Block AI bots, ou deixa-o ligado e coloca o GPTBot e o ClaudeBot em Allow na lista de crawlers.
- Se também usas o Bot Fight Mode, confirma que não lhes lança desafios. O Super Bot Fight Mode permite deixar passar os “verified bots”; ambos os crawlers estão na lista verificada da Cloudflare.
Plugins de segurança do WordPress
Procura uma opção do tipo “Block AI bots”, “Block AI scrapers” ou “Bad bots” e retira o GPTBot e o ClaudeBot da lista.
nginx / Apache
Remove ou restringe regras como esta:
if ($http_user_agent ~* (GPTBot|ClaudeBot)) {
return 403;
}
Verificar
curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" https://yourdomain.com/ | head -1
curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)" https://yourdomain.com/ | head -1
Ambos devem devolver HTTP/2 200. Depois volta a correr a auditoria.
Perguntas frequentes
O meu robots.txt permite o GPTBot. Porque é que a auditoria continua a falhar?
Porque o bloqueio acontece uma camada antes. O crawler pede uma página, a firewall responde 403 e o robots.txt nunca chega a ser lido. Corrige primeiro a firewall; a regra do robots.txt é verificada à parte em Permitir crawlers de IA.
Isto também afeta o Googlebot?
Não. A Cloudflare e a maioria dos plugins tratam o Googlebot e o Bingbot como crawlers de pesquisa verificados e deixam-nos em paz. Esta verificação só sonda os dois principais crawlers de IA.
Posso permitir citações do ChatGPT mas bloquear o treino?
Em parte. A OpenAI usa o GPTBot para treino e o OAI-SearchBot / ChatGPT-User para pesquisa e navegação. Permite estes dois na edge e mantém o GPTBot bloqueado no robots.txt se for essa a tua intenção. A Anthropic usa o ClaudeBot para ambos os fins.
Fontes
Última atualização 2026-09-04