Trainings-Crawler sind einer der Wege, auf denen Inhalte einer Website in das Training von KI-Modellen gelangen können. Ein Crawler ist ein Programm, das Webseiten automatisch abruft. Was ein Modell aus den so gesammelten Trainingsdaten lernt, wird Teil seines parametrischen Wissens, also dessen, was es ohne Nachschlagen weiß. Trainings-Crawler sind eine von drei Arten von KI-Crawlern: Daneben erfassen KI-Index-Crawler Seiten als Quellen für KI-Antworten, und User-triggered Fetcher rufen eine Seite ab, weil jemand einem KI-System gerade eine Frage stellt.
Welche Crawler für das Training sammeln
Die Crawler großer KI-Anbieter weisen sich bei ihren Anfragen mit einem Namen aus, dem sogenannten User-Agent-Token. In ihren Dokumentationen geben die Anbieter an, welchem Zweck ein Token dient. Bei den Anbietern von ChatGPT, Gemini, Claude und Perplexity sieht das so aus (Stand: Oktober 2026):
- OpenAI: GPTBot sammelt Inhalte, die für das Training der generativen KI-Basismodelle von OpenAI verwendet werden können, auf denen auch ChatGPT beruht.
- Google: Für das Training von Gemini setzt Google keinen Crawler mit eigenem Namen ein. Laut Google crawlt das Unternehmen mit seinen bestehenden Crawlern, und das Token Google-Extended regelt, ob diese Inhalte für das Training künftiger Gemini-Modelle genutzt werden dürfen. Dasselbe Token regelt auch das Grounding in den Gemini-Apps und in Googles Cloud-Angebot Vertex AI, also die Nutzung aktueller Inhalte für Antworten.
- Anthropic: ClaudeBot sammelt Webinhalte, die zum Training von Anthropics Modellen beitragen können, also der Modelle hinter Claude.
- Perplexity: Laut Perplexity sammelt sein Crawler PerplexityBot keine Inhalte für das Training von KI-Basismodellen; er erfasst Websites, damit Perplexity sie in Antworten anzeigen und verlinken kann.
Auch andere Unternehmen betreiben Trainings-Crawler. MistralAI-Training sammelt laut Mistral AI Inhalte für Datensätze, mit denen das Unternehmen seine generativen KI-Modelle trainiert, und wird weder für die Indexierung noch für Antworten auf aktuelle Nutzerfragen eingesetzt. Eine Sonderrolle hat CCBot. Er gehört zu Common Crawl, einer gemeinnützigen Stiftung, die ein frei zugängliches Archiv von Webseiten veröffentlicht; mit Daten aus diesem Archiv wurden viele Sprachmodelle trainiert. Laut Common Crawl lässt sich CCBot über die robots.txt sperren; eine solche Regel hält eine Website aus künftigen Sammlungen des Archivs heraus. Bei Apple läuft die Steuerung wie bei Google über ein Token ohne eigenen Crawler: Applebot-Extended legt fest, ob Inhalte, die Apples Crawler Applebot erfasst, für das Training von Apples Basismodellen genutzt werden dürfen, etwa der Modelle hinter Apple Intelligence.
Nicht jeder Crawler hat nur einen Zweck. Meta-ExternalAgent crawlt laut Meta für Zwecke wie das Training von KI-Basismodellen oder die Verbesserung von Produkten durch die direkte Indexierung von Inhalten. Amazonbot dient laut Amazon dazu, die Produkte und Dienste des Unternehmens zu verbessern, und was er erfasst, kann auch für das Training von Amazons KI-Modellen genutzt werden. Eine robots.txt-Regel für einen solchen Crawler gilt für alle seine Zwecke zugleich. Auch getrennte Namen bedeuten nicht immer getrennte Abrufe: Erlaubt eine Website sowohl GPTBot als auch OAI-SearchBot, den Crawler, der Seiten für ChatGPT search erfasst, kann OpenAI laut eigener Aussage die Ergebnisse eines einzigen Abrufs für beide Zwecke nutzen. Die Regeln wirken trotzdem je Token.
Was eine Regel für Trainings-Crawler bewirkt
Trainings-Crawler werden wie andere Crawler über die robots.txt einer Website gesteuert. Mehrere von ihnen lassen sich dort in einem gemeinsamen Abschnitt zusammenfassen, einer sogenannten Gruppe: Die Zeilen „User-agent: GPTBot“ und „User-agent: ClaudeBot“, gefolgt von „Disallow: /“, bitten beide Crawler, keine Seite der Website abzurufen.
Eine solche Regel betrifft nur das Training, sie gilt nur für künftige Abrufe, und ihre Wirkung zeigt sich erst in künftigen Modellversionen. Weil OpenAI, Anthropic und Mistral AI für Quellen in KI-Antworten und für Nutzerabrufe eigene Crawler einsetzen, kann eine Website bei ihnen den Trainings-Crawler sperren und trotzdem KI-Zitate erhalten; bei Google-Extended und bei Crawlern mit mehreren Zwecken trifft eine Sperre dagegen auch andere Zwecke.
Wo die Grenzen einer Sperre liegen, etwa bei bereits gesammelten Inhalten oder bei dem, was andere über ein Unternehmen schreiben, und welche weiteren Wege es gibt, Inhalte aus dem Training herauszuhalten, beschreibt der Begriff KI-Trainings-Opt-out.
Die Entscheidung über Trainings-Crawler
Ob du Trainings-Crawler zulässt, ist eine Abwägung, die du am besten je Anbieter triffst. Für das Zulassen spricht, dass künftige Modelle dein Angebot dann auch aus deinen eigenen Seiten kennenlernen können; das zählt für Antworten, für die ein KI-System nichts aus dem Web abruft. Für eine Sperre kann sprechen, dass die Texte oder das Fachwissen darin selbst das Produkt sind. Eine ausdrückliche Regel je Trainings-Crawler hält die Entscheidung fest und macht sie im Team nachvollziehbar.
Für die KI-Sichtbarkeit kommt es darauf an, über das Training getrennt von den übrigen KI-Crawlern zu entscheiden: Eine pauschale Sperre aller Crawler schließt auch die aus, die Seiten für KI-Antworten erfassen. Auch Schutzfunktionen von Hosting-Anbietern oder Firewalls, die den Datenverkehr zu einer Website filtern, können KI-Crawler unabhängig von der robots.txt aufhalten; darum geht es beim Bot-Management.
Neben der technischen gibt es eine rechtliche Seite: Für Text und Data Mining, also die automatisierte Analyse digitaler Werke, sehen das deutsche und das europäische Urheberrecht eine allgemeine gesetzliche Erlaubnis vor, von der Rechteinhaber ihre Werke durch einen Vorbehalt ausnehmen können. Was ein solcher Nutzungsvorbehalt voraussetzt und wie er mit Regeln für Trainings-Crawler zusammenhängt, ist eine eigene rechtliche Frage.