KI-Crawler, auch KI-Bots genannt, entscheiden mit darüber, ob die Inhalte einer Website ein KI-System überhaupt erreichen. Die Crawler großer KI-Anbieter weisen sich bei ihren Anfragen mit einem eigenen Namen aus, etwa GPTBot von OpenAI oder ClaudeBot von Anthropic. Über diesen Namen, das sogenannte Token, kann eine Website einen Crawler in ihrer robots.txt gezielt ansprechen.
Drei Zwecke, drei Arten von Crawlern
KI-Anbieter rufen Webseiten aus unterschiedlichen Gründen ab und setzen dafür meist getrennte Crawler ein:
- Training: Trainings-Crawler wie GPTBot von OpenAI und ClaudeBot von Anthropic sammeln Inhalte, die in die Trainingsdaten künftiger KI-Modelle einfließen können.
- Index für Antworten: KI-Index-Crawler wie OAI-SearchBot, Claude-SearchBot und PerplexityBot erfassen Seiten vorab für einen Webindex, aus dem ein KI-System bei einer Frage passende Quellen heraussucht. Das „Search“ in manchen Namen verweist auf die Funktionen, mit denen KI-Systeme Inhalte aus dem Web abrufen.
- Abruf für eine Nutzerfrage: User-triggered Fetcher wie ChatGPT-User, Claude-User und Perplexity-User rufen eine einzelne Seite in dem Moment ab, in dem jemand einem KI-System eine Frage stellt. Sie crawlen nicht automatisch, und ob sie die robots.txt beachten, regelt jeder Anbieter anders.
Daneben gibt es Tokens, hinter denen kein eigener Crawler steht, etwa Google-Extended und Applebot-Extended. Google und Apple crawlen mit ihren üblichen Crawlern; über diese Tokens legt eine Website nur fest, wofür die gecrawlten Inhalte genutzt werden dürfen.
Die KI-Crawler von ChatGPT, Gemini, Claude und Perplexity
Welche Crawler zu welchem KI-System gehören, dokumentieren die Anbieter selbst (Stand: Oktober 2026):
- ChatGPT: OpenAI betreibt GPTBot für das Training, OAI-SearchBot für die Quellen in ChatGPT search und ChatGPT-User für Abrufe bei Nutzerfragen. Hinzu kommt OAI-AdsBot, der die Sicherheit von Webseiten prüft, die als Anzeigen in ChatGPT eingereicht werden.
- Gemini: Für Gemini nennt Google keinen eigenen Trainings- oder Index-Crawler. Beim Grounding, also wenn Gemini Antworten auf aktuelle Webinhalte stützt, greift es auf Googles Webindex zurück, den Google mit seinem allgemeinen Crawler Googlebot aufbaut. Über das Token Google-Extended legt eine Website fest, ob von Google gecrawlte Inhalte für dieses Grounding in den Gemini-Apps und für das Training künftiger Gemini-Modelle genutzt werden dürfen. Für Abrufe auf Nutzerwunsch führt Google eigene Fetcher auf, etwa für Gemini Notebook.
- Claude: Anthropic betreibt ClaudeBot für das Training, Claude-SearchBot, um die Websuche von Claude zu verbessern, und Claude-User für Abrufe bei Nutzerfragen.
- Perplexity: Perplexity betreibt PerplexityBot, der Websites erfasst, damit Perplexity sie in Antworten anzeigen und verlinken kann, und Perplexity-User für Abrufe bei Nutzerfragen. Beide nutzt Perplexity laut eigener Aussage nicht, um Inhalte für das Training von KI-Basismodellen zu sammeln, also von großen KI-Modellen, auf denen viele KI-Anwendungen aufbauen.
Andere Anbieter folgen ähnlichen Mustern; Mistral AI etwa betreibt getrennte Crawler für das Training, für seinen Index und für Nutzerabrufe. Namen, Versionsnummern und Zwecke können sich ändern, maßgeblich ist deshalb jeweils die Crawler-Dokumentation des Anbieters.
Woran sich KI-Crawler erkennen lassen
In der Regel enthält jede Anfrage an einen Server eine Selbstauskunft des abrufenden Programms, den sogenannten User-Agent. Bei KI-Crawlern steht darin ihr Token, meist mit Versionsnummer; der User-Agent von PerplexityBot enthält etwa „PerplexityBot/1.0“. Anhand dieses Tokens findet ein Crawler die Gruppe in der robots.txt, die für ihn gilt, und am selben Namen lassen sich seine Besuche in den Server-Logs erkennen, den Protokollen, die ein Webserver über alle Abrufe führt.
Der User-Agent ist allerdings nur eine Angabe des Absenders; jedes Programm kann sich als GPTBot oder ClaudeBot ausgeben. Deshalb veröffentlichen OpenAI, Anthropic und Perplexity Listen der IP-Adressen ihrer Crawler, also der Netzwerkadressen, von denen ihre Anfragen kommen. Google ermöglicht die Prüfung seiner Crawler über die IP-Adresse und den zugehörigen Hostnamen, also den Rechnernamen hinter dieser Adresse. Manche automatisierten Zugriffe geben sich gar nicht als Crawler zu erkennen, etwa wenn sie sich als gewöhnlicher Browser tarnen. Regeln in der robots.txt erreichen solche Zugriffe nicht zuverlässig. Hier setzt das Bot-Management an: Schutzfunktionen eines Content-Delivery-Networks (CDN), also eines Netzes von Servern, das Seiten schneller ausliefert, oder einer Firewall, die Anfragen prüft, bevor sie den Server erreichen. Diese Funktionen können umgekehrt auch erwünschte KI-Crawler abweisen, unabhängig davon, was die robots.txt erlaubt.
Was KI-Crawler für die Sichtbarkeit in KI-Antworten bedeuten
Für aktuelle KI-Antworten zählen vor allem KI-Index-Crawler und User-triggered Fetcher: Kann keiner von ihnen eine Seite abrufen, kann ein KI-System sie in der Regel nicht als Quelle nutzen und nicht als KI-Zitat anzeigen. Der Zugang ist dabei eine Voraussetzung, keine Garantie; welche Seiten ein System für eine Antwort auswählt, entscheidet jeder Anbieter selbst.
Trainings-Crawler wirken anders: Sie bestimmen mit, was künftige Modelle über ein Angebot wissen, nicht aber, welche Seiten ein KI-System heute als Quelle abruft. Bei OpenAI und Anthropic hat das Training ein eigenes Token. Eine Sperre von GPTBot oder ClaudeBot signalisiert laut den Anbietern, dass künftig abgerufene Inhalte nicht in das Training einfließen sollen; als Quelle für ihre KI-Antworten fällt eine Website dadurch nicht weg. Laut OpenAI wirken die Regeln für GPTBot und OAI-SearchBot unabhängig voneinander: Eine Website kann den einen sperren und den anderen zulassen. Bei Google hängen Training und Grounding in den Gemini-Apps dagegen am selben Token. Eine eigene Regel je Token macht solche Entscheidungen in der robots.txt eindeutig.
Welche Wege es gibt, Inhalte aus dem Training herauszuhalten, und was dabei abzuwägen ist, beschreibt der Begriff KI-Trainings-Opt-out. Rechtlich können sich Rechteinhaber in Deutschland und der EU die Nutzung ihrer Werke für Text und Data Mining vorbehalten, also für die automatisierte Auswertung digitaler Inhalte; was das voraussetzt, erklärt der Begriff Nutzungsvorbehalt. Wer Inhalte auch aus KI-Antworten heraushält, verzichtet dort auf Sichtbarkeit; darum geht es beim Opt-out aus KI-Antworten.