Ein KI-Trainings-Opt-out betrifft eine von zwei Arten, auf die KI-Systeme die Inhalte einer Website nutzen können. Die erste ist das Training: Aus Trainingsdaten lernen Sprachmodelle, was sie später ohne Nachschlagen wiedergeben können, also ihr parametrisches Wissen. Die zweite ist der Abruf für Antworten: Viele KI-Systeme lesen im Moment einer Frage aktuelle Webseiten und nennen sie als Quelle. Ein Trainings-Opt-out zielt nur auf das Training. Ein Verfahren, das für alle KI-Anbieter gleichermaßen gilt, gibt es dafür nicht; welche Signale ein Anbieter beachtet, beschreibt er in seiner Dokumentation.
Regeln in der robots.txt
Der wichtigste Weg führt über die robots.txt, die Textdatei, mit der eine Website Crawlern mitteilt, welche Seiten sie abrufen dürfen. Crawler sind Programme, die Webseiten automatisch abrufen. In der Regel weist sich ein Crawler mit einem Namen aus, dem Token, und eine Regel in der robots.txt spricht ihn über dieses Token an. Für das Training gibt es drei Fälle:
- Eigene Trainings-Crawler: OpenAI und Anthropic sammeln Inhalte für das Training mit eigenen Trainings-Crawlern, GPTBot und ClaudeBot. Dazu zählt auch CCBot, der Crawler des offenen Webarchivs Common Crawl, mit dessen Daten viele Sprachmodelle trainiert wurden. Eine Sperre in der robots.txt bittet einen solchen Crawler, die Website nicht mehr abzurufen.
- Tokens ohne eigenen Crawler: Google und Apple crawlen mit ihren üblichen Crawlern und bieten ein eigenes Token an, über das eine Website festlegt, wofür die erfassten Inhalte genutzt werden dürfen. Die Zeilen „User-agent: Applebot-Extended“ und „Disallow: /“, eine Regel für alle Seiten der Website, halten Apples Crawler Applebot also nicht von der Website fern; sie bitten Apple, die erfassten Inhalte nicht für das Training seiner Basismodelle zu verwenden, der grundlegenden KI-Modelle hinter Funktionen wie Apple Intelligence. Bei Google übernimmt Google-Extended diese Rolle, allerdings nicht nur für das Training: Das Token regelt zugleich, ob die Gemini-Apps die Inhalte für das Grounding nutzen dürfen, also um Antworten auf aktuelle Webinhalte zu stützen.
- Crawler mit mehreren Zwecken: Meta-ExternalAgent crawlt laut Meta für Zwecke wie das Training von KI-Basismodellen oder die Indexierung von Inhalten, also deren Erfassen und geordnetes Speichern. Meta nennt kein Token, das nur das Training betrifft; eine Regel für diesen Crawler gilt für alle seine Zwecke.
Ein Trainings-Opt-out für mehrere Anbieter besteht also aus Regeln für jedes Token, das ein Anbieter für das Training nennt. Für Perplexity gibt es kein solches Token: Laut Perplexity sammeln seine Crawler PerplexityBot und Perplexity-User keine Inhalte für das Training von KI-Basismodellen. Eine pauschale Sperre für alle Crawler, eingeleitet mit „User-agent: *“, ist kein Ersatz für einzelne Regeln, denn sie gilt für jeden Crawler, den die robots.txt nicht eigens nennt, auch für die, mit denen KI-Systeme Quellen für ihre Antworten abrufen.
Weitere Signale und Wege
Neben Regeln für einzelne Tokens gibt es Ansätze, die gewünschte Nutzung für alle Crawler auf einmal zu erklären. Cloudflare hat im September 2025 die Content Signals vorgestellt: eine Zeile in der robots.txt, in der etwa „ai-train=no“ ausdrückt, dass Inhalte nicht für das Training oder Fine-Tuning von KI-Modellen genutzt werden sollen, also auch nicht für das Nachtrainieren eines bestehenden Modells. Auch die Arbeitsgruppe AIPREF der IETF, die Internetstandards entwickelt, hat den Entwurf eines gemeinsamen Vokabulars für solche Präferenzen veröffentlicht, mit einer Kategorie für das KI-Training (Stand: September 2026). Cloudflare selbst beschreibt Content Signals als Präferenzen, nicht als technischen Schutz. In ihren Crawler-Dokumentationen erwähnen OpenAI, Google, Anthropic und Perplexity diese Signale nicht (Stand: Oktober 2026).
Trainings-Crawler mit eigenem Namen lassen sich auch außerhalb der robots.txt abweisen: Firewalls, Hosting-Anbieter und Content-Delivery-Networks, also Netze von Servern, die Webseiten ausliefern, können sie aufhalten, bevor sie eine Seite erhalten; darum geht es beim Bot-Management. Bei Tokens ohne eigenen Crawler wie Google-Extended ist das nicht möglich, ohne den eigentlichen Crawler und damit auch alle seine übrigen Zwecke auszusperren. Daneben gibt es eine rechtliche Ebene: Nach dem EU-Urheberrecht, in Deutschland nach § 44b des Urheberrechtsgesetzes (UrhG), können sich Rechteinhaber die Nutzung ihrer Werke für Text und Data Mining, also die automatisierte Auswertung digitaler Werke, vorbehalten, außer für die wissenschaftliche Forschung. Was ein solcher Nutzungsvorbehalt voraussetzt, ist eine eigene, rechtliche Frage.
Grenzen eines Trainings-Opt-outs
Ein Trainings-Opt-out reicht nur so weit wie seine Signale:
- Nur Crawler, die sich daran halten: Die robots.txt ist eine Bitte, kein Schloss. Crawler, die ihre Regeln nicht befolgen, hält sie nicht auf, und Crawler, die sich nicht mit eigenem Token ausweisen, kann sie nicht gezielt ansprechen.
- Nur künftige Abrufe: Laut Anthropic signalisiert eine Sperre von ClaudeBot, dass künftige Inhalte einer Website nicht in Trainingsdatensätze aufgenommen werden sollen. Was ein Crawler bereits gesammelt hat, kann in Trainingsdatensätzen bleiben, und bereits trainierte Modelle behalten, was sie gelernt haben.
- Nur die eigene Website: Was andere über ein Unternehmen schreiben, Kopien seiner Texte auf fremden Seiten und Datensätze, die Anbieter kaufen oder lizenzieren, erfasst die Regel nicht. Auch ältere Sammlungen offener Archive wie Common Crawl bleiben von ihr unberührt.
Was ein Trainings-Opt-out für die KI-Sichtbarkeit bedeutet
Für die KI-Sichtbarkeit kommt es darauf an, ob ein Trainings-Opt-out auch den Abruf für Antworten ausschließt. Bei OpenAI und Anthropic tut es das nicht, denn dort ist beides getrennt: Sperrt eine Website GPTBot und ClaudeBot, dürfen die Crawler, die Quellen für Antworten erfassen, ihre Seiten weiter abrufen, bei OpenAI OAI-SearchBot und bei Anthropic Claude-SearchBot. Auch ein User-triggered Fetcher wie ChatGPT-User oder Claude-User, der eine Seite abruft, weil jemand im Chat eine Frage stellt, ist von dieser Sperre nicht betroffen. ChatGPT und Claude können die Seiten dann weiterhin als Quelle nutzen und als KI-Zitate anzeigen. Anders bei Google-Extended: Eine Sperre schließt neben dem Training auch das Grounding in den Gemini-Apps aus. Bei Crawlern mit mehreren Zwecken wie Meta-ExternalAgent entfällt mit dem Training auch die Indexierung durch diesen Crawler.
Was ein Opt-out kostet, ist schwerer zu fassen. Künftige Modelle der betreffenden Anbieter sollen ein Angebot dann vor allem aus anderen Quellen kennenlernen, etwa aus dem, was andere darüber schreiben, statt über deren Crawler aus seiner eigenen Website. Wie sich das langfristig darauf auswirkt, was Modelle über ein Unternehmen wissen und wie oft sie es nennen, beschreiben OpenAI, Google und Anthropic in ihren Crawler-Dokumentationen nicht. Ein Trainings-Opt-out ist deshalb eine geschäftliche Abwägung, die sich für jeden Anbieter einzeln treffen lässt. Wer Inhalte bewusst auch aus KI-Antworten heraushalten möchte, braucht andere Signale; ein Opt-out aus KI-Antworten kostet Sichtbarkeit in den Antworten, für die es gilt.