Mit einem Webindex kann ein KI-System eine Frage schnell mit Inhalten aus dem Web beantworten: Es liest dafür nicht das ganze Web neu, sondern schlägt in einem Bestand nach, den Crawler vorab angelegt haben. Crawler sind Programme, die Webseiten automatisch abrufen. Das Prinzip kennst du vom Stichwortverzeichnis eines Buchs: Es zeigt, auf welchen Seiten ein Begriff vorkommt, ohne dass jemand das ganze Buch durchblättern muss. Fragt jemand ein KI-System nach einer Steuerkanzlei in Köln, die Start-ups berät, findet das System über seinen Index in Sekundenbruchteilen Seiten, die zu dieser Frage passen.

Wie eine Seite in einen Webindex kommt

Bevor der Inhalt einer Seite im Index steht, durchläuft sie mehrere Schritte. Google beschreibt sie für seinen eigenen Index, Microsoft und Perplexity schildern eine ähnliche Abfolge:

  • Entdecken: Ein Crawler erfährt von der Adresse einer Seite, etwa über Links auf anderen Seiten oder über eine XML-Sitemap, also eine Datei, die die Adressen einer Website auflistet.
  • Abrufen: Der Crawler lädt die Seite herunter. Ob das gelingt, hängt unter anderem von den Regeln der robots.txt und von den Antworten des Servers ab; zusammen beschreibt das die Crawlbarkeit einer Website.
  • Aufbereiten: Das System wertet die Seite aus und hält fest, worum es darin geht und in welcher Sprache sie geschrieben ist. Google fasst dabei Seiten mit sehr ähnlichem Inhalt zu Gruppen zusammen und wählt je Gruppe eine Seite aus, die sie vertritt. Perplexity beschreibt, dass es den aussagekräftigen Inhalt einer Seite herausfiltert und in kleinere, in sich verständliche Abschnitte zerlegt, die sich später einzeln abrufen lassen.
  • Speichern: Die aufbereiteten Informationen landen im Index, laut Google einer großen Datenbank.

Nicht jede abgerufene Seite kommt in den Index: Laut Google ist die Aufnahme nicht garantiert. Zudem ist das Web laut Perplexity viel zu groß, um jede Adresse regelmäßig neu zu erfassen. Perplexity lässt deshalb Modelle des maschinellen Lernens vorhersagen, ob und wann sich das für eine Adresse lohnt, je nachdem, wie wichtig sie ist und wie oft sie sich voraussichtlich ändert. Für erfasste Seiten enthält ein Index also den Stand ihrer letzten Erfassung. Ändert sich eine Seite, kann ein KI-System die neue Fassung aus seinem Index erst nutzen, wenn sie erneut erfasst wurde; wie lange das dauert, hängt vom Anbieter und von der Seite ab.

Welche Indexe KI-Systeme nutzen

Einen gemeinsamen Webindex aller KI-Systeme gibt es nicht. Woher ein System seine Webinhalte bezieht, legen die Anbieter nur teilweise offen:

  • ChatGPT: Für ChatGPT search erfasst OpenAI Seiten mit dem Crawler OAI-SearchBot. Websites, die ihn aussperren, erscheinen laut OpenAI nicht als Quelle in den Antworten von ChatGPT search. Zusätzlich arbeitet ChatGPT search laut OpenAI teilweise mit anderen Anbietern zusammen, darunter Microsoft.
  • Gemini: Die Gemini-App kann Antworten auf Inhalte aus Googles Webindex stützen, und auch die Übersicht mit KI und der KI-Modus, zwei KI-Funktionen der Google Suche, greifen auf diesen Index zurück. Um dort als Link zu erscheinen, muss eine Seite laut Google im Index stehen und mit einem Textauszug angezeigt werden dürfen.
  • Claude: Anthropic erfasst Inhalte mit dem Crawler Claude-SearchBot. Sperrt eine Website ihn aus, kann Anthropics System ihre Inhalte laut Anthropic nicht in seinen Index aufnehmen, was ihre Sichtbarkeit in der Websuche von Claude verringern kann.
  • Perplexity: Perplexity betreibt einen eigenen Index, den es fortlaufend aktualisiert. Neben dem eigenen Crawler PerplexityBot tragen laut Perplexity auch Crawler von Partnerfirmen dazu bei.

Microsoft Copilot bezieht Webinhalte über Bing; laut Microsoft beruhen Bing und Copilot auf demselben Index. Eine Seite kann im Index des einen Systems stehen und im Index eines anderen fehlen, etwa weil die robots.txt nur einen der Crawler zulässt oder ein Crawler die Seite noch nicht erfasst hat. Daneben rufen manche KI-Systeme einzelne Seiten auch direkt ab, ohne Umweg über ihren Index, zum Beispiel wenn jemand die Adresse einer Seite im Chat angibt.

Warum der Webindex für GEO zählt

Braucht ein KI-System für eine Antwort Inhalte aus dem Web, ruft es passende Seiten und Abschnitte aus seinem Index ab und lässt das Sprachmodell die Antwort darauf aufbauen; dieses Verfahren heißt Retrieval-Augmented Generation (RAG). Das Verankern einer Antwort in solchen Quellen nennt man Grounding. Für deine Website heißt das: Fehlt eine Seite im Index eines Systems, kann das System sie weder finden noch als KI-Zitat angeben, es sei denn, es ruft sie im Einzelfall direkt ab. Umgekehrt ist ein Platz im Index keine Garantie: Welche Seiten ein System für eine Antwort auswählt, entscheidet jeder Anbieter selbst.

Ob eine Seite in den Index gelangt, hängt neben der Crawlbarkeit auch von Anweisungen auf der Seite selbst ab. Die Anweisung noindex, die im HTML-Code einer Seite oder in der Antwort des Servers stehen kann, hält eine Seite laut Google und Microsoft aus ihren Indexen heraus und damit auch aus KI-Funktionen wie der Übersicht mit KI und Copilot. Steht sie versehentlich auf einer Leistungs- oder Produktseite, kann diese Seite dort nicht mehr als Quelle dienen.

Ein Webindex ist außerdem nicht dasselbe wie die Trainingsdaten eines Sprachmodells. Aus Trainingsdaten lernt ein Modell, bevor es veröffentlicht wird; was es dabei als parametrisches Wissen speichert, ändert sich erst, wenn der Anbieter das Modell weiter trainiert oder eine neue Modellversion veröffentlicht. Ein Index wird dagegen laufend aktualisiert und im Moment der Frage genutzt. OpenAI und Anthropic setzen für beides auch getrennte Crawler ein: Trainings-Crawler wie GPTBot für das Training und KI-Index-Crawler für die Antworten ihrer KI-Systeme.