ai

Die von Cloudflare verwaltete robots.txt sperrt KI-Crawler

Cloudflare kann oberhalb deiner Regeln einen eigenen robots.txt-Block einfügen. MetricSpot prüft, ob dieser verwaltete Block GPTBot oder ClaudeBot sperrt, selbst wenn deine eigene Datei sie erlaubt.

Was diese Prüfung macht

Sucht nach den Markern, mit denen Cloudflare die in /robots.txt eingefügten Direktiven umschließt:

# BEGIN Cloudflare Managed content
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /

User-agent: ClaudeBot
Disallow: /

User-agent: GPTBot
Disallow: /
# END Cloudflare Managed Content

User-agent: GPTBot
Allow: /

Der verwaltete Abschnitt wird für sich beurteilt. Die Prüfung schlägt fehl, wenn er Disallow: / für GPTBot oder ClaudeBot enthält. Deine eigenen Regeln unterhalb des Markers bewertet KI-Crawler erlauben separat, die beiden Befunde sagen dir also genau, welche Ebene sperrt.

Die Prüfung erscheint nur, wenn die Marker vorhanden sind. Websites ohne Cloudflares verwaltete robots.txt sehen sie nie.

Warum es wichtig ist

Cloudflares Option “Manage AI bots’ robots.txt” (unter AI Crawl Control) schreibt die Datei um, die dein Origin ausliefert. Sie stellt einen Block voran, der:

  • Content-Signal: ai-train=no für alle Crawler erklärt, ein Opt-out nach der EU-Urheberrechtsrichtlinie
  • Disallow: / für GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider, Amazonbot und weitere hinzufügt

Viele Betreiber schalten es wegen des Content Signal ein und übersehen die Disallow-Zeilen. Dann fügen sie weiter unten Allow: / hinzu und nehmen an, das gewinne. Tut es nicht zuverlässig: robots.txt-Parser führen Gruppen unterschiedlich zusammen, mehrere Crawler nehmen die erste passende Gruppe, und Cloudflare sperrt dieselben Bots meist zusätzlich am Edge (siehe KI-Crawler am Edge gesperrt).

Das Ergebnis ist eine robots.txt, die oben das eine und unten das Gegenteil sagt. Diese Prüfung macht die obere Hälfte sichtbar.

Wie du es behebst

  1. Öffne deine Domain im Cloudflare-Dashboard und gehe zu AI Crawl Control (ältere Konten: Security → Bots).
  2. Schalte Manage AI bots’ robots.txt aus. Der eingefügte Block verschwindet innerhalb weniger Minuten und deine Datei wird unverändert ausgeliefert.
  3. Willst du die Zeile Content-Signal behalten, lass die Option an und setze GPTBot und ClaudeBot in der Crawler-Liste auf Allow. Cloudflare entfernt dann deren Disallow-Zeilen aus dem verwalteten Block.
  4. Prüfe auch den Edge: Dieselbe Seite steuert, ob diese Crawler einen 403 bekommen, bevor sie die robots.txt überhaupt lesen.

Prüfen

curl -s https://yourdomain.com/robots.txt | sed -n '/BEGIN Cloudflare/,/END Cloudflare/p'

Ist der Block weg oder listet GPTBot und ClaudeBot nicht mehr unter Disallow: /, starte das Audit erneut.

Häufig gestellte Fragen

Ich habe die robots.txt nie bearbeitet. Woher kommt dieser Block?

Von Cloudflare, nicht von deinem CMS. Alles zwischen # BEGIN Cloudflare Managed content und # END Cloudflare Managed Content wird am Edge erzeugt und berührt die Datei auf deinem Server nie.

Überschreibt ein Allow: / weiter unten den Block?

Nicht verlässlich. RFC 9309 sagt, dass ein gleichwertiges Allow und Disallow beim Zusammenführen von Gruppen zu Allow aufgelöst werden sollte, aber nicht jeder Crawler führt Gruppen zusammen, und der Cloudflare-Block steht zuerst. Beseitige den Konflikt, statt dich auf Parser-Verhalten zu verlassen.

Ist die Content-Signal-Zeile schädlich?

Nein. ai-train=no ist ein Rechtevorbehalt, keine Sperre. Du kannst sie behalten und GPTBot und ClaudeBot trotzdem für Suche und Zitate crawlen lassen.

Quellen

Zuletzt aktualisiert 2026-09-04