User-triggered Fetcher kommen ins Spiel, wenn ein KI-System während eines Gesprächs eine bestimmte Webseite öffnet. Ein Beispiel: Jemand fügt in ChatGPT den Link zu deiner Preisseite ein und fragt, ob dein Angebot für ein Team mit 20 Personen passt. Um zu antworten, kann ChatGPT die Seite mit seinem Fetcher ChatGPT-User abrufen und ihren Inhalt auswerten. Ein Fetcher geht dabei nicht automatisch von Link zu Link, sondern holt nur die Seiten, die er für die aktuelle Frage oder Aufgabe braucht.
Die Fetcher der großen KI-Anbieter weisen sich bei ihren Anfragen mit einem eigenen Namen aus, dem sogenannten Token. Unter diesem Namen taucht ein Fetcher in den Server-Logs auf, also den Protokollen, die ein Server über jede Anfrage führt, und über ihn lässt er sich in der robots.txt einer Website ansprechen.
Neben den Fetchern setzen KI-Anbieter zwei weitere Arten von KI-Crawlern ein: Trainings-Crawler sammeln Inhalte für das Training von Sprachmodellen, und KI-Index-Crawler erfassen Seiten vorab für den Index, aus dem KI-Systeme Quellen für ihre Antworten auswählen. Ob ein Fetcher eine Seite abrufen darf, entscheidet nicht darüber, ob sie in diesem Index steht, sondern darüber, ob ein KI-System sie lesen kann, wenn jemand konkret nach ihr fragt. OpenAI schreibt, dass ChatGPT-User nicht genutzt wird, um zu bestimmen, ob Inhalte in ChatGPT search erscheinen können.
Wie die Anbieter mit der robots.txt umgehen
Ob die Regeln einer robots.txt auch für Fetcher gelten, beantworten die Anbieter unterschiedlich. Ihre Dokumentation sagt dazu Folgendes (Stand: Oktober 2026):
- ChatGPT-User (OpenAI): ruft Seiten ab, wenn jemand ChatGPT eine Frage stellt. Weil eine Person diese Aktionen auslöst, gelten die Regeln der robots.txt laut OpenAI möglicherweise nicht.
- Google: Google führt eine eigene Liste vom Nutzer ausgelöster Fetcher, die auch Fetcher ohne KI-Bezug enthält, etwa Google Site Verifier, mit dem Nutzer nachweisen, dass eine Website ihnen gehört. Für KI-Funktionen nennt sie unter anderem den Fetcher von Gemini Notebook (früher NotebookLM), der Webadressen abruft, die Nutzer dort als Quellen angeben. Weil eine Person den Abruf angefordert hat, ignorieren diese Fetcher die robots.txt laut Google meist. Einen eigenen Fetcher für die Gemini-App nennt die Liste nicht; vollständig ist sie laut Google allerdings nicht.
- Claude-User (Anthropic): ruft Websites ab, wenn jemand Claude eine Frage stellt. Anthropic gibt an, dass seine Bots die robots.txt befolgen, und beschreibt Claude-User als Möglichkeit für Website-Betreiber, festzulegen, welche Websites solche Abrufe erreichen dürfen.
- Perplexity-User (Perplexity): ruft eine Seite ab, wenn jemand Perplexity eine Frage stellt. Perplexity führt ihn unter den Tokens, mit denen Website-Betreiber den Zugriff steuern können, schreibt aber zugleich, dass er die robots.txt in der Regel ignoriert, weil eine Person den Abruf angefordert hat.
Auch bei anderen Anbietern gibt es solche Fetcher. Amzn-User, den Amazon etwa bei Fragen an Alexa einsetzt, die aktuelle Informationen brauchen, befolgt laut Amazon möglicherweise nicht alle Anweisungen der robots.txt, und Meta-ExternalFetcher kann sie laut Meta umgehen. Mistral führt MistralAI-User dagegen als robots.txt-Token, über das sich festlegen lässt, welche Websites solche Abrufe erreichen dürfen.
Zum Hintergrund: Der Standard für die robots.txt, RFC 9309, beschreibt Regeln, um deren Einhaltung Crawler gebeten werden, und versteht unter Crawlern automatisierte Programme. Mehrere Anbieter begründen ihre Ausnahme damit, dass eine Person den Abruf auslöst und kein Programm selbstständig das Web durchläuft. Wo ein Anbieter die robots.txt anwendet, funktioniert sie wie bei jedem anderen Crawler: Die Zeilen „User-agent: Claude-User“ und „Disallow: /“ untersagen Claude-User den Abruf aller Seiten. Eine pauschale Sperre für alle Crawler („User-agent: *“ mit „Disallow: /“) trifft Fetcher, die die robots.txt beachten, ebenfalls.
Was Fetcher für die Sichtbarkeit in KI-Antworten bedeuten
Über Fetcher liest ein KI-System eine bestimmte Seite im Moment einer Frage, etwa wenn jemand nach deinen Preisen, Öffnungszeiten oder Produktdetails fragt oder einen Link teilt. Kann ein Fetcher eine Seite nicht abrufen, fehlt dem System ihr Inhalt für diese Antwort, sofern es ihn nicht schon aus einer anderen Quelle kennt, etwa aus seinem Index. Anthropic schreibt, dass eine Sperre von Claude-User verhindert, dass Claude die Inhalte einer Website für eine Nutzerfrage abruft, und so ihre Sichtbarkeit in der Websuche von Claude verringern kann.
Unabhängig von der robots.txt lassen sich Fetcher auch in einer Firewall sperren, die eingehende Anfragen prüft und unerwünschte abweist, oder in einem Content-Delivery-Network (CDN), also einem Netz von Servern, das Seiten schneller ausliefert. Solche Schutzfunktionen, zusammengefasst als Bot-Management, wirken damit auch bei Fetchern, die die robots.txt ignorieren. Cloudflare etwa führt Abrufe, die Chat-Assistenten und Browser-Agenten im Auftrag einer Person machen, als eigene Kategorie „Agent“, die sich getrennt sperren lässt. Weil sich der Name in einer Anfrage fälschen lässt, veröffentlichen OpenAI, Google, Anthropic und Perplexity die IP-Adressen ihrer Bots, also die Netzwerkadressen, von denen ihre Anfragen kommen. Sollen KI-Systeme deine Seiten auf Nachfrage lesen können, dürfen weder die robots.txt noch das Bot-Management die Fetcher sperren.
Auch die Auslieferung zählt: Ob ChatGPT-User, Claude-User und Perplexity-User JavaScript ausführen, mit dem viele Websites ihre Inhalte erst im Browser aufbauen, sagen OpenAI, Anthropic und Perplexity in ihrer Dokumentation nicht; was daraus folgt, beschreibt der Begriff JavaScript-Rendering. Sicher erreicht ein Fetcher nur Inhalte, die schon im HTML stehen, das der Server ausliefert, etwa durch serverseitiges Rendering.
Für die Entscheidung über das KI-Training sind Fetcher nicht der richtige Hebel: Sie lässt sich über eigene Tokens wie GPTBot oder ClaudeBot treffen (KI-Trainings-Opt-out), während die Fetcher zugelassen bleiben und KI-Systeme deine Seiten weiterhin lesen können, wenn jemand nach ihnen fragt. Laut Perplexity sammelt Perplexity-User zudem keine Inhalte für das Training von KI-Basismodellen, also den großen Modellen, auf denen KI-Systeme aufbauen; Amzn-User und MistralAI-User sammeln laut Amazon und Mistral keine Inhalte für das Training generativer KI-Modelle.