Crawlbarkeit ist die erste technische Voraussetzung dafür, dass KI-Systeme die Inhalte einer Website nutzen können. Crawler sind Programme, die Webseiten automatisch abrufen. KI-Anbieter betreiben eigene KI-Crawler, etwa um Seiten als mögliche Quellen für Antworten zu erfassen oder um eine Seite abzurufen, nach der jemand gerade fragt.

Wovon Crawlbarkeit abhängt

Damit ein Crawler den Inhalt einer Seite erhält, müssen vier Bedingungen erfüllt sein:

  • Gefunden: Crawler entdecken Seiten über Links und über XML-Sitemaps, also Dateien, die die Adressen einer Website auflisten. Eine Seite, auf die kein Link führt, bleibt leicht unentdeckt.
  • Erlaubt: Die robots.txt legt fest, welche Crawler welche Pfade abrufen dürfen. Weil KI-Anbieter für verschiedene Zwecke eigene Crawler mit eigenem Namen einsetzen, gilt eine Regel nur für die Crawler, die sie anspricht.
  • Ausgeliefert: Der Server muss die Seite tatsächlich liefern. Antwortet er mit „Zugriff verweigert“ (Statuscode 403), „zu viele Anfragen“ (429) oder einem Serverfehler (Statuscodes ab 500), erhält der Crawler keinen Inhalt. Auch Inhalte, die erst nach einer Anmeldung sichtbar sind, bekommt ein Crawler ohne Zugangsdaten nicht zu sehen.
  • Ohne JavaScript verfügbar: Der Hauptinhalt steht schon im HTML, das der Server ausliefert, etwa durch serverseitiges Rendering. Baut eine Seite ihren Text erst im Browser mit JavaScript auf, erhalten Crawler, die kein JavaScript ausführen, kaum mehr als ein leeres Gerüst; welche Crawler das betrifft und wie sich eine Seite darauf prüfen lässt, beschreibt der Begriff JavaScript-Rendering.

Microsoft nennt in den Webmaster-Richtlinien von Bing, die auch für Copilot gelten, XML-Sitemaps und interne Links als Wege, über die Seiten gefunden werden. Google empfiehlt für seine KI-Funktionen wie die Übersicht mit KI und den KI-Modus ebenfalls, Inhalte über interne Links leicht auffindbar zu machen.

Schutzfunktionen gegen Bots

Viele Websites laufen hinter einer Firewall oder einem Content-Delivery-Network (CDN), also einem Netz von Servern, das Seiten schneller ausliefert. Deren Schutzfunktionen gegen Bots wirken unabhängig von der robots.txt und können KI-Crawler abweisen, obwohl die robots.txt sie erlaubt; wie das funktioniert und welche Voreinstellungen solche Dienste mitbringen, beschreibt der Begriff Bot-Management.

Warum Crawlbarkeit für GEO zählt

KI-Systeme, die Inhalte aus dem Web in ihre Antworten einbeziehen, greifen auf Seiten zurück, die ihre eigenen Crawler oder die von Partnern zuvor für einen Webindex erfasst haben, oder rufen eine Seite im Moment der Frage ab. In beiden Fällen muss eine Seite in der Regel für einen Crawler erreichbar sein, um in eine Antwort einzufließen und dort als KI-Zitat zu erscheinen. Weil jeder Anbieter eigene Crawler mit eigenen Fähigkeiten einsetzt und Firewalls sie unterschiedlich behandeln können, ist eine Seite unter Umständen für ein KI-System erreichbar und für ein anderes nicht. Ob Trainings-Crawler wie GPTBot eine Website abrufen dürfen, ist dagegen eine eigene Entscheidung, die sich bei OpenAI und Anthropic getrennt vom Zugang für KI-Antworten treffen lässt.

Crawlbarkeit klärt nur, ob ein Crawler eine Seite und ihren Inhalt erhält. Ob Software diesen Inhalt anschließend zuverlässig versteht, beschreibt die Maschinenlesbarkeit. Beides gehört zur Onpage-GEO, also zur Arbeit an der eigenen Website für die Sichtbarkeit in KI-Antworten. Crawlbarkeit ist dabei die Grundlage, auf der alle anderen Maßnahmen aufbauen.