ai
Crawler AI bloccati all'edge
MetricSpot richiede la tua home page come GPTBot e ClaudeBot. Un 403 da Cloudflare, da un WAF o da un plugin di sicurezza tiene fuori i motori di risposta AI qualunque cosa dica robots.txt.
Cosa controlla questo check
Richiede la tua home page due volte, identificandosi con le stringhe user agent esatte pubblicate da OpenAI e Anthropic per GPTBot e ClaudeBot. Il check fallisce quando una delle due richieste riceve HTTP 401, 403 o 429, oppure una pagina di challenge 503 di Cloudflare.
Se la risposta porta header Cloudflare, il rilievo nomina Cloudflare; altrimenti indica “WAF/CDN” così sai che devi guardare il firewall o il plugin di sicurezza.
È un rilievo maggiore: prevale su tutto il resto del modulo leggibilità AI. Un Allow: / in robots.txt non serve a nulla se il crawler viene respinto prima di poter leggere il file.
Perché è importante
robots.txt è una richiesta. Un 403 è un muro.
I crawler AI ben educati leggono prima robots.txt e lo rispettano. Ma una regola firewall che filtra sullo user agent risponde prima che robots.txt venga servito, quindi il crawler non vede mai i tuoi permessi. Dal suo punto di vista il sito è semplicemente irraggiungibile.
La causa più comune nel 2026 è Cloudflare AI Crawl Control (in precedenza “Bots”). Da metà 2025 Cloudflare blocca di default i crawler AI noti sulle nuove zone, e molti proprietari l’hanno attivato senza accorgersi che li toglie anche dalle citazioni di ChatGPT, Claude e Perplexity. Altre cause:
- Bot Fight Mode / Super Bot Fight Mode di Cloudflare
- Regole WAF personalizzate che intercettano
GPTBot,ClaudeBoto la parolabot - Plugin di sicurezza WordPress (Wordfence, Shield Security, All In One WP Security) con l’opzione “blocca i bot AI”
- Regole user agent nginx / Apache copiate da uno snippet “blocca gli scraper AI”
Se bloccare i crawler AI è una scelta deliberata, questo rilievo conferma che funziona. Se vuoi essere citato dai motori di risposta, è la prima cosa da sistemare.
Come risolvere
Cloudflare
- Apri il tuo dominio nella dashboard Cloudflare e vai su AI Crawl Control (account meno recenti: Security → Bots).
- Disattiva Block AI bots, oppure lascialo attivo e imposta GPTBot e ClaudeBot su Allow nell’elenco dei crawler.
- Se usi anche Bot Fight Mode, verifica che non li sottoponga a challenge. Super Bot Fight Mode permette di far passare i “verified bots”; entrambi i crawler sono nella lista verificata di Cloudflare.
Plugin di sicurezza WordPress
Cerca un’impostazione tipo “Block AI bots”, “Block AI scrapers” o “Bad bots” e togli GPTBot e ClaudeBot dall’elenco.
nginx / Apache
Rimuovi o restringi regole come questa:
if ($http_user_agent ~* (GPTBot|ClaudeBot)) {
return 403;
}
Verifica
curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" https://yourdomain.com/ | head -1
curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)" https://yourdomain.com/ | head -1
Entrambe dovrebbero stampare HTTP/2 200. Poi rilancia l’audit.
Domande frequenti
Il mio robots.txt consente GPTBot. Perché l’audit fallisce ancora?
Perché il blocco avviene un livello prima. Il crawler chiede una pagina, il firewall risponde 403 e robots.txt non viene mai letto. Sistema prima il firewall; la regola robots.txt viene controllata a parte in Permettere i crawler AI.
Riguarda anche Googlebot?
No. Cloudflare e la maggior parte dei plugin trattano Googlebot e Bingbot come crawler di ricerca verificati e li lasciano in pace. Questo check sonda solo i due principali crawler AI.
Posso consentire le citazioni di ChatGPT ma bloccare l’addestramento?
In parte. OpenAI usa GPTBot per l’addestramento e OAI-SearchBot / ChatGPT-User per ricerca e navigazione. Consenti questi due all’edge e tieni GPTBot bloccato in robots.txt se è questa la tua intenzione. Anthropic usa ClaudeBot per entrambi gli scopi.
Fonti
Ultimo aggiornamento 2026-09-04