GPTBot ist der Name, unter dem sich ein Webcrawler von OpenAI beim Abruf von Webseiten ausweist. OpenAI hat ihn im August 2023 dokumentiert. Der Crawler dient dem Training: Was er sammelt, kann in die Trainingsdaten der Modelle einfließen, die unter anderem hinter ChatGPT stehen. Jede seiner Anfragen enthält diesen Namen, das sogenannte Token, zusammen mit einer Versionsnummer, die sich ändern kann.
Ein Crawler für das Training
OpenAI trennt seine Crawler nach Zweck, jeder mit eigenem Token:
- GPTBot: sammelt als Trainings-Crawler Inhalte, die in das Training künftiger Modelle einfließen können.
- OAI-SearchBot: erfasst Websites, damit ChatGPT sie in den Antworten von ChatGPT search anzeigen und verlinken kann.
- ChatGPT-User: kann als User-triggered Fetcher eine Webseite aufrufen, wenn eine Person ChatGPT eine Frage stellt; er crawlt nicht automatisch und entscheidet laut OpenAI nicht darüber, ob Inhalte in ChatGPT search erscheinen.
Die robots.txt-Regeln für GPTBot und OAI-SearchBot sind laut OpenAI unabhängig voneinander: Eine Website kann OAI-SearchBot erlauben und GPTBot sperren. Sind beide erlaubt, kann OpenAI einen einzigen Abruf für beide Zwecke nutzen.
GPTBot in der robots.txt
Gesteuert wird GPTBot über eine eigene Gruppe in der robots.txt einer Website: Die Zeilen „User-agent: GPTBot“ und „Disallow: /“ untersagen ihm den Abruf der gesamten Website.
Ob du GPTBot erlaubst, ist eine Entscheidung darüber, ob deine Inhalte in das Training künftiger OpenAI-Modelle einfließen dürfen. Eine allgemein richtige Antwort gibt es nicht: Manche Unternehmen möchten, dass künftige Modelle ihre Inhalte kennen, andere schließen das aus. Eine ausdrückliche Regel macht die Entscheidung klar und nachvollziehbar. Wie sich Inhalte auch bei anderen KI-Anbietern aus dem Training heraushalten lassen und wo die Grenzen liegen, beschreibt der Begriff KI-Trainings-Opt-out.
Was GPTBot für die Sichtbarkeit in ChatGPT bedeutet
ChatGPT hat zwei Wege zu einer Antwort: das Wissen seiner Sprachmodelle und, bei Bedarf, aktuelle Inhalte aus dem Web. Die Regel für GPTBot betrifft nur den ersten Weg, und das erst mit künftigen Modellversionen. Damit eine Website in den Antworten von ChatGPT search als Quelle erscheinen, also KI-Zitate erhalten kann, muss dagegen OAI-SearchBot sie abrufen dürfen, auch wenn dieser Zugang ein KI-Zitat nicht garantiert. Eine Sperre von GPTBot entfernt eine Website deshalb nicht aus diesen Antworten.
OpenAI dokumentiert nicht, ob eine Sperre von GPTBot langfristig beeinflusst, was künftige Sprachmodelle über ein Angebot wissen und wie oft sie es nennen, also einen Teil seiner KI-Sichtbarkeit.