ai

Crawler AI bloccati all'edge

MetricSpot richiede la tua home page come GPTBot e ClaudeBot. Un 403 da Cloudflare, da un WAF o da un plugin di sicurezza tiene fuori i motori di risposta AI qualunque cosa dica robots.txt.

Cosa controlla questo check

Richiede la tua home page due volte, identificandosi con le stringhe user agent esatte pubblicate da OpenAI e Anthropic per GPTBot e ClaudeBot. Il check fallisce quando una delle due richieste riceve HTTP 401, 403 o 429, oppure una pagina di challenge 503 di Cloudflare.

Se la risposta porta header Cloudflare, il rilievo nomina Cloudflare; altrimenti indica “WAF/CDN” così sai che devi guardare il firewall o il plugin di sicurezza.

È un rilievo maggiore: prevale su tutto il resto del modulo leggibilità AI. Un Allow: / in robots.txt non serve a nulla se il crawler viene respinto prima di poter leggere il file.

Perché è importante

robots.txt è una richiesta. Un 403 è un muro.

I crawler AI ben educati leggono prima robots.txt e lo rispettano. Ma una regola firewall che filtra sullo user agent risponde prima che robots.txt venga servito, quindi il crawler non vede mai i tuoi permessi. Dal suo punto di vista il sito è semplicemente irraggiungibile.

La causa più comune nel 2026 è Cloudflare AI Crawl Control (in precedenza “Bots”). Da metà 2025 Cloudflare blocca di default i crawler AI noti sulle nuove zone, e molti proprietari l’hanno attivato senza accorgersi che li toglie anche dalle citazioni di ChatGPT, Claude e Perplexity. Altre cause:

  • Bot Fight Mode / Super Bot Fight Mode di Cloudflare
  • Regole WAF personalizzate che intercettano GPTBot, ClaudeBot o la parola bot
  • Plugin di sicurezza WordPress (Wordfence, Shield Security, All In One WP Security) con l’opzione “blocca i bot AI”
  • Regole user agent nginx / Apache copiate da uno snippet “blocca gli scraper AI”

Se bloccare i crawler AI è una scelta deliberata, questo rilievo conferma che funziona. Se vuoi essere citato dai motori di risposta, è la prima cosa da sistemare.

Come risolvere

Cloudflare

  1. Apri il tuo dominio nella dashboard Cloudflare e vai su AI Crawl Control (account meno recenti: Security → Bots).
  2. Disattiva Block AI bots, oppure lascialo attivo e imposta GPTBot e ClaudeBot su Allow nell’elenco dei crawler.
  3. Se usi anche Bot Fight Mode, verifica che non li sottoponga a challenge. Super Bot Fight Mode permette di far passare i “verified bots”; entrambi i crawler sono nella lista verificata di Cloudflare.

Plugin di sicurezza WordPress

Cerca un’impostazione tipo “Block AI bots”, “Block AI scrapers” o “Bad bots” e togli GPTBot e ClaudeBot dall’elenco.

nginx / Apache

Rimuovi o restringi regole come questa:

if ($http_user_agent ~* (GPTBot|ClaudeBot)) {
  return 403;
}

Verifica

curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" https://yourdomain.com/ | head -1
curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)" https://yourdomain.com/ | head -1

Entrambe dovrebbero stampare HTTP/2 200. Poi rilancia l’audit.

Domande frequenti

Il mio robots.txt consente GPTBot. Perché l’audit fallisce ancora?

Perché il blocco avviene un livello prima. Il crawler chiede una pagina, il firewall risponde 403 e robots.txt non viene mai letto. Sistema prima il firewall; la regola robots.txt viene controllata a parte in Permettere i crawler AI.

Riguarda anche Googlebot?

No. Cloudflare e la maggior parte dei plugin trattano Googlebot e Bingbot come crawler di ricerca verificati e li lasciano in pace. Questo check sonda solo i due principali crawler AI.

Posso consentire le citazioni di ChatGPT ma bloccare l’addestramento?

In parte. OpenAI usa GPTBot per l’addestramento e OAI-SearchBot / ChatGPT-User per ricerca e navigazione. Consenti questi due all’edge e tieni GPTBot bloccato in robots.txt se è questa la tua intenzione. Anthropic usa ClaudeBot per entrambi gli scopi.

Fonti

Ultimo aggiornamento 2026-09-04