Von KI-Index-Crawlern hängt maßgeblich ab, ob die Seiten einer Website in KI-Antworten als Quelle erscheinen können. Crawler sind Programme, die Webseiten automatisch abrufen. Die Seiten, die ein Index-Crawler erfasst, fließen in einen Webindex; aus ihm zieht das KI-System passende Inhalte heran, wenn jemand eine Frage stellt.

KI-Index-Crawler sind eine von drei Arten von KI-Crawlern. Daneben setzen KI-Anbieter Trainings-Crawler ein, die Inhalte für das Training von KI-Modellen sammeln, und User-triggered Fetcher, die eine einzelne Seite abrufen, weil eine Person ein KI-System gerade danach fragt. Bei den meisten Anbietern hat jede Art einen eigenen Crawler mit eigenem Namen, dem sogenannten Token, über den die robots.txt einer Website ihn gezielt ansprechen kann.

Welche Crawler dazugehören

Für die KI-Systeme ChatGPT, Gemini, Claude und Perplexity sieht das so aus:

  • ChatGPT: OAI-SearchBot erfasst Websites laut OpenAI, damit ChatGPT sie in den Antworten von ChatGPT search anzeigen und verlinken kann.
  • Gemini: Google nennt keinen eigenen Index-Crawler. Die Gemini-App und die KI-Funktionen der Google Suche stützen sich auf Googles Webindex, den Google mit seinem allgemeinen Crawler Googlebot aufbaut. Ob Google die Inhalte einer Website für das Training künftiger Gemini-Modelle und für das Grounding in der Gemini-App nutzen darf, also dafür, Antworten auf aktuelle Webinhalte zu stützen, regelt zusätzlich das Token Google-Extended, hinter dem kein eigener Crawler steht.
  • Claude: Claude-SearchBot ruft laut Anthropic Webseiten ab, um die Websuche von Claude zu verbessern.
  • Perplexity: PerplexityBot erfasst Websites laut Perplexity, damit Perplexity sie in seinen Antworten anzeigen und verlinken kann.

Laut Microsoft stützt sich Microsoft Copilot auf dasselbe Crawling und dieselbe Indexierung wie Bing, also auf Bingbot, den Crawler von Bing. Einen eigenen Index-Crawler für Copilot nennt Microsoft nicht.

Die Namen OAI-SearchBot und Claude-SearchBot verweisen auf ChatGPT search und die Websuche von Claude, also auf die Funktionen, mit denen diese KI-Systeme aktuelle Inhalte aus dem Web in ihre Antworten einbeziehen. „KI-Index-Crawler“ ist dagegen kein Begriff der Anbieter, sondern eine Einordnung nach dem Zweck.

Index-Crawler und Training

Über die Nutzung der Inhalte für das Training entscheidet bei den meisten Anbietern ein anderes Token, bei OpenAI etwa GPTBot. Laut OpenAI sind die Regeln für GPTBot und OAI-SearchBot unabhängig voneinander. Eine Website kann deshalb in ChatGPT search als Quelle infrage kommen und zugleich mit einem KI-Trainings-Opt-out signalisieren, dass ihre Inhalte nicht in das Training von OpenAIs Modellen einfließen sollen.

Ob die Inhalte, die ein Index-Crawler erfasst, ihrerseits in das Training einfließen können, dazu äußern sich die Anbieter unterschiedlich. Sind OAI-SearchBot und GPTBot beide zugelassen, kann OpenAI laut eigener Aussage die Ergebnisse eines einzigen Abrufs für beide Zwecke nutzen; Anthropic macht dazu für Claude-SearchBot keine Angabe. Perplexity erklärt dagegen ausdrücklich, dass PerplexityBot keine Inhalte für das Training von KI-Basismodellen sammelt, also von den großen Sprachmodellen, auf denen KI-Systeme aufbauen. Ähnlich äußern sich Mistral AI zu seinem Index-Crawler MistralAI-Index und Amazon zu Amzn-SearchBot.

Was der Zugang für KI-Zitate bedeutet

Damit eine Seite aus dem Index eines KI-Systems in einer Antwort als KI-Zitat erscheinen kann, muss der Index-Crawler des Anbieters sie in der Regel vorher abrufen dürfen und können; einzelne Seiten kann ein KI-System außerdem über einen User-triggered Fetcher abrufen, wenn eine Person gerade danach fragt. Zunächst muss die robots.txt den Index-Crawler für die passenden Pfade zulassen, also für die Bereiche der Website, die er erfassen soll. Mehrere Index-Crawler lassen sich dabei in einer Gruppe zusammenfassen, also einem Block von Zeilen in der robots.txt: Eine Gruppe aus den Zeilen „User-agent: OAI-SearchBot“, „User-agent: Claude-SearchBot“ und „User-agent: PerplexityBot“, gefolgt von der Regel „Allow: /“, erlaubt allen drei Crawlern ausdrücklich, die gesamte Website abzurufen.

Außerdem dürfen die Firewall, der Hosting-Anbieter oder ein Content-Delivery-Network (CDN), also ein Netz von Servern, das Seiten schneller ausliefert, den Crawler nicht abweisen. Solche Einstellungen gehören zum Bot-Management und wirken unabhängig von der robots.txt. Google empfiehlt für seine KI-Funktionen ausdrücklich, das Crawlen sowohl in der robots.txt als auch im CDN und beim Hosting zuzulassen.

Der Zugang ist eine Voraussetzung, keine Garantie: Welche erfassten Seiten ein KI-System für eine Antwort auswählt und als Quelle angibt, entscheidet jeder Anbieter selbst. Für GEO gehört der Zugang für Index-Crawler trotzdem zu den grundlegenden Maßnahmen, denn er erfordert wenig Aufwand, und ohne ihn kann ein KI-System die Seiten einer Website in der Regel nicht aus seinem Index als Quelle heranziehen.