ai
KI-Crawler am Edge gesperrt
MetricSpot ruft deine Startseite als GPTBot und ClaudeBot ab. Ein 403 von Cloudflare, einer WAF oder einem Security-Plugin hält KI-Antwortmaschinen fern, egal was die robots.txt sagt.
Was diese Prüfung macht
Ruft deine Startseite zweimal ab und identifiziert sich dabei mit den exakten User-Agent-Strings, die OpenAI und Anthropic für GPTBot und ClaudeBot veröffentlichen. Die Prüfung schlägt fehl, wenn eine der beiden Anfragen HTTP 401, 403 oder 429 erhält, oder eine 503-Challenge-Seite von Cloudflare.
Trägt die Antwort Cloudflare-Header, nennt der Befund Cloudflare; sonst steht dort “WAF/CDN”, damit du weißt, dass Firewall oder Security-Plugin zu prüfen sind.
Das ist ein schwerwiegender Befund: Er überlagert alles andere im Modul KI-Lesbarkeit. Ein Allow: / in der robots.txt ist bedeutungslos, wenn der Crawler abgewiesen wird, bevor er die Datei lesen kann.
Warum es wichtig ist
robots.txt ist eine Bitte. Ein 403 ist eine Mauer.
Gut erzogene KI-Crawler lesen zuerst die robots.txt und halten sich daran. Eine Firewall-Regel, die auf den User-Agent matcht, antwortet aber bevor die robots.txt ausgeliefert wird, der Crawler sieht deine Freigaben also nie. Aus seiner Sicht ist die Website schlicht nicht erreichbar.
Die häufigste Ursache 2026 ist Cloudflare AI Crawl Control (früher “Bots”). Seit Mitte 2025 sperrt Cloudflare bekannte KI-Crawler bei neuen Zonen standardmäßig, und viele Betreiber haben es aktiviert, ohne zu merken, dass sie damit auch aus den Zitaten von ChatGPT, Claude und Perplexity verschwinden. Weitere Ursachen:
- Cloudflare Bot Fight Mode / Super Bot Fight Mode
- Eigene WAF-Regeln, die auf
GPTBot,ClaudeBotoder das Wortbotmatchen - WordPress-Security-Plugins (Wordfence, Shield Security, All In One WP Security) mit einem Schalter “KI-Bots blockieren”
- nginx- / Apache-User-Agent-Regeln aus einem “KI-Scraper blockieren”-Snippet
Ist das Sperren von KI-Crawlern eine bewusste Entscheidung, bestätigt dieser Befund nur, dass sie wirkt. Willst du von Antwortmaschinen zitiert werden, ist es das Erste, was du beheben solltest.
Wie du es behebst
Cloudflare
- Öffne deine Domain im Cloudflare-Dashboard und gehe zu AI Crawl Control (ältere Konten: Security → Bots).
- Schalte Block AI bots aus, oder lass es an und setze GPTBot und ClaudeBot in der Crawler-Liste auf Allow.
- Nutzt du zusätzlich Bot Fight Mode, prüfe, dass er sie nicht mit Challenges belegt. Super Bot Fight Mode kann “verified bots” durchlassen; beide Crawler stehen auf Cloudflares Verified-Liste.
WordPress-Security-Plugins
Suche nach einer Einstellung wie “Block AI bots”, “Block AI scrapers” oder “Bad bots” und entferne GPTBot und ClaudeBot aus der Liste.
nginx / Apache
Regeln wie diese entfernen oder eingrenzen:
if ($http_user_agent ~* (GPTBot|ClaudeBot)) {
return 403;
}
Prüfen
curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" https://yourdomain.com/ | head -1
curl -sI -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)" https://yourdomain.com/ | head -1
Beide sollten HTTP/2 200 ausgeben. Danach das Audit erneut starten.
Häufig gestellte Fragen
Meine robots.txt erlaubt GPTBot. Warum schlägt das Audit trotzdem fehl?
Weil die Sperre eine Ebene früher greift. Der Crawler fragt eine Seite an, die Firewall antwortet 403, und die robots.txt wird nie gelesen. Behebe zuerst die Firewall; die robots.txt-Regel wird separat in KI-Crawler erlauben geprüft.
Betrifft das auch den Googlebot?
Nein. Cloudflare und die meisten Plugins behandeln Googlebot und Bingbot als verifizierte Such-Crawler und lassen sie in Ruhe. Diese Prüfung testet nur die beiden wichtigsten KI-Crawler.
Kann ich ChatGPT-Zitate erlauben, aber Training blockieren?
Teilweise. OpenAI nutzt GPTBot fürs Training und OAI-SearchBot / ChatGPT-User für Suche und Browsing. Erlaube die beiden letzteren am Edge und lass GPTBot in der robots.txt gesperrt, wenn das deine Absicht ist. Anthropic nutzt ClaudeBot für beides.
Quellen
Zuletzt aktualisiert 2026-09-04