Bot-Management steckt meist nicht in der Website selbst, sondern in Diensten, die ihr vorgeschaltet sind: in einem Content-Delivery-Network (CDN), also einem Netz von Servern, das Seiten schneller ausliefert, in einer Firewall, die Anfragen prüft, bevor sie den Server erreichen, oder in den Sicherheitsfunktionen des Hosting-Anbieters. Diese Dienste sehen jede Anfrage, auch die von Bots: Programmen, die Webseiten automatisch abrufen, darunter KI-Crawler. Bot-Management kann aktiv sein, ohne dass jemand es für die eigene Website bewusst eingerichtet hat, weil es zu einem solchen Dienst gehört und mit dessen Voreinstellungen arbeitet.

So arbeitet Bot-Management

Zuerst geht es darum zu erkennen, wer anfragt. Bots, die sich ausweisen, nennen bei jeder Anfrage einen Namen, etwa GPTBot. Weil sich dieser Name fälschen lässt, kann Bot-Management zusätzlich prüfen, ob eine Anfrage wirklich von dem genannten Bot stammt. Der CDN-Anbieter Cloudflare etwa führt eine Liste verifizierter Bots und prüft ihre Echtheit auf einem von drei Wegen: über veröffentlichte Listen von IP-Adressen, also den Netzwerkadressen, von denen ein Bot abruft, über den Rechnernamen, zu dem eine IP-Adresse gehört (Reverse DNS), oder über digitale Signaturen, mit denen ein Bot nachweist, wer er ist (Verfahren Web Bot Auth).

Danach entscheidet der Dienst, wie er reagiert. Ob ein Bot die Seite erhalten hat, zeigt meist der Statuscode, die dreistellige Zahl, mit der ein Server jede Anfrage beantwortet:

  • Erlauben: Die Anfrage geht durch, und der Bot erhält die Seite.
  • Sperren: Der Bot erhält statt der Seite eine Ablehnung, etwa mit dem Statuscode 403 („Zugriff verweigert“).
  • Drosseln: Stellt ein Bot in kurzer Zeit zu viele Anfragen, beantwortet der Dienst weitere mit dem Statuscode 429 („zu viele Anfragen“). Diese Begrenzung heißt Rate Limiting.
  • Prüfen: Der Dienst schaltet eine Prüfseite vor, die feststellen soll, ob ein echter Browser anfragt. Ein Crawler, der diese Prüfung nicht besteht, erhält nur die Prüfseite, nicht den Inhalt.
  • Bezahlen lassen: Seit Juli 2025 erprobt Cloudflare in einer geschlossenen Testphase ein Modell, bei dem KI-Crawler pro Abruf bezahlen. Wer ohne Zahlungsbereitschaft anfragt, erhält den Statuscode 402 („Zahlung erforderlich“).

Unabhängig von der robots.txt

Die robots.txt ist eine Bitte an Crawler: Ein Crawler liest sie selbst und hält sich an ihre Regeln, wenn sein Betreiber das vorsieht. Bot-Management dagegen entscheidet, bevor eine Seite ausgeliefert wird, und muss sich nicht nach der robots.txt richten. Beide Ebenen arbeiten unabhängig voneinander:

  • Eine Website kann einen KI-Crawler in der robots.txt ausdrücklich zulassen und ihn trotzdem im CDN oder in der Firewall abweisen. In der robots.txt ist davon nichts zu sehen.
  • Umgekehrt kann Bot-Management durchsetzen, was die robots.txt nur erbittet. Cloudflare etwa zeigt an, welche KI-Crawler gegen die robots.txt einer Website verstoßen, und kann ihre Regeln auf Wunsch erzwingen. Bots, die sich nicht mit eigenem Namen ausweisen, kann eine Regel in der robots.txt ohnehin nicht gezielt ansprechen.

Die robots.txt muss außerdem selbst für Crawler erreichbar bleiben. Laut Anthropic garantiert eine Sperre der IP-Adressen, von denen seine Bots wie ClaudeBot abrufen, nicht zuverlässig und dauerhaft, dass eine Website von ihnen ausgenommen bleibt, weil das Anthropic erschwert, die robots.txt zu lesen. Zudem kann ein Dienst die robots.txt verändern, die Crawler erhalten: Cloudflare kann eigene Zeilen an den Anfang der Datei einer Website setzen, etwa die Präferenz, Inhalte nicht für KI-Training zu verwenden. Crawler lesen dann eine andere robots.txt als die Datei im Code der Website.

Was Bot-Management für KI-Antworten bedeutet

Für die Sichtbarkeit in KI-Antworten zählen vor allem zwei Arten von Bots, und eine Sperre wirkt bei ihnen unterschiedlich. KI-Index-Crawler erfassen Seiten für den Index eines KI-Anbieters. Weist Bot-Management sie ab, kann der Anbieter den Inhalt nicht in seinen Index aufnehmen, und in seinen KI-Antworten erscheint die Seite dann in der Regel nicht als KI-Zitat. User-triggered Fetcher rufen eine Seite ab, wenn eine Person in einem KI-System danach fragt oder einen Link teilt. Weist Bot-Management sie ab, kann das KI-System die Seite in diesem Moment nicht lesen.

Die Anbieter weisen selbst darauf hin. OpenAI empfiehlt, OAI-SearchBot in der robots.txt zuzulassen und Anfragen aus den IP-Adressbereichen zu erlauben, die OpenAI für diesen Crawler veröffentlicht. Google rät für die Übersicht mit KI und den KI-Modus, darauf zu achten, dass das Crawling in der robots.txt und von allen CDNs oder Hosting-Infrastrukturen zugelassen wird. Perplexity beschreibt Regeln, mit denen sich PerplexityBot und der Abrufdienst Perplexity-User in den Firewalls von Cloudflare und Amazon Web Services freigeben lassen.

Welche Bots ein Dienst durchlässt, hängt stark von seinen Voreinstellungen ab, und diese ändern sich. Cloudflare etwa sperrte ab dem 1. Juli 2025 für neu hinzugefügte Domains als Voreinstellung KI-Crawler, die ohne Erlaubnis Inhalte abrufen. Seit dem 15. September 2026 bietet Cloudflare neuen Domains stattdessen zwei Voreinstellungen an, je nachdem, ob sich eine Website über Werbung finanziert. Ohne Werbung sind Crawler für einen Webindex, Crawler für das Training und Abrufe im Auftrag von Personen erlaubt. Mit Werbung bleiben Crawler für einen Webindex erlaubt. Für das Training setzt Cloudflare dann in der robots.txt die Präferenz, Inhalte nicht dafür zu nutzen, und sperrt reine Trainings-Crawler, etwa die von OpenAI und Anthropic, für die gesamte Domain; Abrufe im Auftrag von Personen sind auf Seiten mit Anzeigen gesperrt. Bestehende Einstellungen überträgt Cloudflare nach eigener Aussage in fast allen Fällen automatisch in die neuen Kategorien.

Bot-Management ist damit ein leicht übersehener Teil der Crawlbarkeit: Es steht nicht im Code der Website, sondern in den Einstellungen der vorgeschalteten Dienste. Nutzt du ein CDN, eine Firewall oder die Schutzfunktionen deines Hosting-Anbieters, lohnt sich ein Blick darauf, welche Einstellungen dort für KI-Bots gelten. Damit eine Website KI-Systemen ein einheitliches Signal gibt, sollten robots.txt und Bot-Management dieselbe Entscheidung darüber abbilden, welche Bots Inhalte für KI-Antworten abrufen dürfen. Ob Trainings-Crawler eine Website nutzen dürfen, ist eine eigene Entscheidung.