Die robots.txt richtet sich an Crawler: Programme, die Webseiten automatisch abrufen, darunter die Crawler von KI-Anbietern. Für GEO ist sie die zentrale Stelle, um KI-Crawlern gezielt Zugang zu geben, denn große KI-Anbieter dokumentieren, wie ihre Crawler mit der robots.txt umgehen. Der Aufwand dafür ist gering.

So ist eine robots.txt aufgebaut

Die Datei besteht aus Gruppen. Jede beginnt mit einer Zeile „User-agent“, die einen Crawler über sein Token anspricht, also über den Namen, mit dem er sich ausweist. Darunter folgen Regeln mit „Allow“ (erlaubt) und „Disallow“ (nicht erlaubt) für bestimmte Pfade. Die Gruppe „User-agent: *“ gilt für alle Crawler ohne eigene Gruppe.

Die Zeilen „User-agent: ClaudeBot“ und „Disallow: /“ etwa sperren ClaudeBot, den Crawler von Anthropic für Trainingsdaten, für die gesamte Website. Andere Crawler betrifft das nicht.

Unabhängig von den Gruppen kann die Datei eine Zeile „Sitemap:“ mit der vollständigen Adresse einer XML-Sitemap enthalten. Sie gehört nicht zu den Zugriffsregeln, sondern zeigt Crawlern, wo sie eine Liste der Seiten einer Website finden.

Warum die robots.txt für GEO zählt

KI-Anbieter setzen für verschiedene Zwecke eigene KI-Crawler mit jeweils eigenem Token ein: Crawler wie GPTBot von OpenAI sammeln Inhalte für das Training von KI-Modellen, andere erfassen Seiten, die ChatGPT, Claude und Perplexity in Antworten als Quelle nutzen können, und wieder andere rufen eine Seite ab, nach der jemand gerade fragt. Bei OpenAI und Anthropic lässt sich so über das Training gesondert entscheiden, während die Seiten als Quelle für KI-Antworten erreichbar bleiben und dort als KI-Zitate erscheinen können.

Für Gemini regelt das Token Google-Extended, hinter dem kein eigener Crawler steht, beides zugleich: ob Google gecrawlte Inhalte für das Training künftiger Gemini-Modelle und für Antworten in den Gemini-Apps nutzen darf.

Eine pauschale Regel wie „Disallow: /“ für alle Crawler kann KI-Crawler ungewollt mit aussperren. Die Datei selbst muss ebenfalls erreichbar sein: Liefert ihr Abruf einen Serverfehler, müssen Crawler nach RFC 9309 davon ausgehen, dass alles gesperrt ist.

Der EU-Verhaltenskodex für KI-Modelle mit allgemeinem Verwendungszweck stützt sich ebenfalls auf die robots.txt: KI-Anbieter, die ihn unterzeichnen, verpflichten sich, für das Sammeln von Trainingsdaten Crawler einzusetzen, welche die robots.txt nach RFC 9309 befolgen.

Was die robots.txt nicht regelt

Die robots.txt ist kein Schloss: Ein Crawler, der ihre Regeln nicht befolgt, kann öffentlich erreichbare Seiten trotzdem abrufen. Abrufe, die eine Person im Chat auslöst, behandeln die Anbieter zudem unterschiedlich: Manche User-triggered Fetcher beachten die robots.txt laut ihren Anbietern nicht in jedem Fall. Ob eine Firewall einen Crawler abweist, den die robots.txt erlaubt, ist eine Frage des Bot-Managements, nicht der Datei selbst. Außerdem bezieht sich die Sperre eines Trainings-Crawlers auf künftige Abrufe, nicht auf Inhalte, die bereits für das Training gesammelt wurden.

Welche Inhalte einer Website am wichtigsten sind, zeigt die robots.txt nicht. Dafür ist eine llms.txt-Datei gedacht: ein vorgeschlagenes Format für eine kuratierte Übersicht, das die robots.txt ergänzt.