OAI-SearchBot ist der Name, unter dem sich ein Crawler von OpenAI ausweist. Crawler sind Programme, die Webseiten automatisch abrufen; OAI-SearchBot nennt seinen Namen, das sogenannte Token, bei jeder Anfrage. OAI-SearchBot erfasst Websites für ChatGPT search, die Funktion, mit der ChatGPT aktuelle Inhalte aus dem Web in seine Antworten einbezieht und die Quellen verlinkt. OpenAI führte den Crawler im Juli 2024 zusammen mit SearchGPT ein, dem Prototyp, aus dem ChatGPT search hervorging.
Wofür OpenAI OAI-SearchBot einsetzt
Seiten, die OAI-SearchBot erfasst hat, kann ChatGPT als Quelle für eine Antwort heranziehen und als KI-Zitat angeben. Damit gehört OAI-SearchBot zu den KI-Index-Crawlern: Crawlern, die Seiten als mögliche Quellen für KI-Antworten erfassen.
Daneben setzt OpenAI weitere Crawler mit eigenen Tokens ein. GPTBot sammelt Inhalte, die für das Training von OpenAIs KI-Modellen verwendet werden können; die robots.txt-Regeln für GPTBot und OAI-SearchBot sind laut OpenAI unabhängig voneinander. ChatGPT-User ist ein User-triggered Fetcher: Er ruft Seiten bei bestimmten Aktionen von Nutzerinnen und Nutzern in ChatGPT auf, etwa wenn jemand eine Frage stellt, und crawlt laut OpenAI nicht automatisch.
Voraussetzungen für ChatGPT search
OpenAI nennt zwei Voraussetzungen dafür, dass eine Website in ChatGPT search aufgenommen werden kann:
- Freigabe in der robots.txt: Die robots.txt der Website darf OAI-SearchBot nicht aussperren. Die Zeilen „User-agent: OAI-SearchBot“ und „Allow: /“ erlauben ihm ausdrücklich, die gesamte Website abzurufen. Laut OpenAI kann es etwa 24 Stunden dauern, bis seine Systeme eine Änderung an der robots.txt berücksichtigen.
- Freigabe bei Hosting und CDN: Der Hosting-Anbieter und, falls vorhanden, ein vorgeschaltetes Content-Delivery-Network (CDN), also ein Netz von Servern, das Seiten schneller ausliefert, müssen Anfragen von den IP-Adressen zulassen, die OpenAI für OAI-SearchBot veröffentlicht. IP-Adressen sind die Netzadressen, von denen aus der Crawler zugreift.
Die zweite Voraussetzung liegt außerhalb der robots.txt: Firewalls und Schutzfunktionen gegen Bots wirken unabhängig von ihr und können OAI-SearchBot abweisen, obwohl die robots.txt ihn erlaubt. Solche Einstellungen fasst der Begriff Bot-Management zusammen.
OAI-SearchBot in den Server-Logs
Anfragen von OAI-SearchBot lassen sich in den Server-Logs einer Website finden, also den Protokollen, die ein Webserver über alle Abrufe führt. Sie enthalten im User-Agent, der Selbstauskunft eines Programms beim Abruf, den Namen OAI-SearchBot mit einer Versionsnummer, etwa OAI-SearchBot/1.4. Ruft OAI-SearchBot die robots.txt ab, kann OpenAI zusätzlich den Vermerk „robots.txt“ anfügen, damit sich diese Abrufe von anderen unterscheiden lassen. Weil jedes Programm den Namen OAI-SearchBot angeben kann, lässt sich die Herkunft solcher Anfragen mit den IP-Adressen abgleichen, die OpenAI veröffentlicht.
Was eine Sperre von OAI-SearchBot bewirkt
Websites, die OAI-SearchBot ausschließen, zeigt ChatGPT laut OpenAI nicht in den Antworten von ChatGPT search; sie können dort aber weiterhin als einfacher Link erscheinen (OpenAI spricht von „navigational links“). Umgekehrt garantiert der Zugang keinen Platz als Quelle: Welche Seiten ChatGPT für eine Antwort auswählt, hängt laut OpenAI von mehreren Faktoren ab, die das Unternehmen nicht im Einzelnen nennt. Der Zugang ist aber die Voraussetzung dafür, dass ChatGPT search die Inhalte einer Website in Antworten nutzen und als Quelle verlinken kann.
Ob du OAI-SearchBot zulässt, ist damit eine Entscheidung darüber, ob deine Website in ChatGPT search als Quelle erscheinen kann, nicht über das Training von OpenAIs Modellen. OpenAI selbst empfiehlt, OAI-SearchBot sowohl in der robots.txt als auch bei Hosting und CDN zuzulassen. Möchtest du Inhalte dagegen bewusst aus KI-Antworten heraushalten, findest du die Möglichkeiten der verschiedenen Anbieter unter Opt-out aus KI-Antworten.