Claude-SearchBot ist der Name, unter dem sich ein Crawler von Anthropic beim Abruf von Webseiten ausweist. Crawler sind Programme, die Webseiten automatisch abrufen. Claude-SearchBot arbeitet für die Websuche von Claude: die Funktion, mit der Claude Fragen mit aktuellen Inhalten aus dem Web beantwortet und die genutzten Seiten als Quellen angibt. Wie OAI-SearchBot von OpenAI und PerplexityBot von Perplexity gehört Claude-SearchBot zu den KI-Index-Crawlern: Er erfasst Seiten vorab, damit ein KI-System sie später für Antworten heranziehen kann.
Drei Bots mit getrennten Aufgaben
Anthropic setzt drei Bots ein, jeder mit eigenem Namen, dem sogenannten Token, und eigenem Zweck. Claude-SearchBot erfasst Seiten, damit Anthropics System sie für die Websuche in seinen Index aufnehmen kann, einen Webindex: einen Datenbestand, in dem erfasste Webseiten so aufbereitet gespeichert sind, dass sich passende Inhalte schnell finden lassen.
Webinhalte, die zum Training von Anthropics KI-Modellen beitragen können, sammelt ein anderer Bot: ClaudeBot. Laut Anthropic signalisiert eine Sperre von ClaudeBot, dass künftige Inhalte der Website aus den Trainingsdatensätzen ausgeschlossen werden sollen; eine Regel für ClaudeBot lässt Claude-SearchBot unberührt und umgekehrt. Claude-User kann Websites aufrufen, wenn jemand Claude eine Frage stellt; er gehört zu den User-triggered Fetchern, die eine Seite nur auf Anfrage einer Person abrufen, etwa bei einer Frage oder einem geteilten Link. Laut Anthropic befolgen alle drei Bots die Regeln der robots.txt, und Website-Betreiber können jeden einzeln zulassen oder einschränken.
Claude-SearchBot in der robots.txt
Gezielt steuern lässt sich Claude-SearchBot über eine eigene Gruppe in der robots.txt: einen Block von Zeilen, der mit „User-agent: Claude-SearchBot“ beginnt. Folgt darauf „Disallow: /“, darf er keine Seite der Website abrufen; mit einem Pfad wie „Disallow: /kundenportal/“ bleibt nur dieser Bereich für ihn gesperrt. Anthropics Dokumentation zeigt die Sperre der ganzen Website („Disallow: /“) am Beispiel von ClaudeBot. Steht in der Datei keine eigene Gruppe für Claude-SearchBot, gelten für ihn die Regeln unter „User-agent: *“, die alle Crawler ohne eigene Gruppe ansprechen; ein „Disallow: /“ in dieser Gruppe sperrt dann auch Claude-SearchBot.
Was eine Sperre von Claude-SearchBot für die Sichtbarkeit in Claude bedeutet
Sperrt eine Website Claude-SearchBot, verhindert das laut Anthropic, dass sein System ihre Inhalte für die Websuche in seinen Index aufnimmt. Nach Anthropics Angaben kann das die Sichtbarkeit und Genauigkeit verringern, mit der die Website in Claudes Websuche erscheint. Betroffen sind die Antworten, in denen Claude Quellen angibt: Antworten mit Websuche enthalten laut Anthropic immer Quellenangaben, also KI-Zitate. Umgekehrt garantiert ein erlaubter Zugriff kein KI-Zitat, denn wie Claude die Quellen für eine Antwort auswählt, legt Anthropic nicht offen.
Ganz aus Claude verschwindet eine Website durch eine solche Sperre nicht zwingend. Claude-User kann eine Seite weiterhin abrufen, wenn jemand Claude eine Frage stellt, solange die robots.txt nicht auch ihn sperrt. Laut Anthropic stützt sich Claudes Websuche außerdem auf Partner, die Webseiten mit eigenen Bots indexieren. Für sie nennt Anthropic einen eigenen Weg: Die Anweisung noindex im HTML-Code einer Seite weist die Partner an, die Seite nicht zu indexieren und damit auch nicht an Claude zu liefern. Und was Claudes Sprachmodelle im Training gelernt haben, kann als parametrisches Wissen in Antworten einfließen.
Inhalte bewusst aus KI-Antworten herauszuhalten, nennt man Opt-out aus KI-Antworten. Für Unternehmen, die in Claudes Antworten als Quelle vorkommen möchten, liegt es dagegen nahe, Claude-SearchBot zuzulassen.
Firewall und Bot-Schutz
Ob Claude-SearchBot eine Website erreicht, hängt nicht nur von der robots.txt ab. Auch Firewall, Hosting oder ein Content-Delivery-Network (CDN), also ein Dienst, der Websites über viele Server ausliefert, können automatisierte Abrufe abweisen; solche Einstellungen fasst der Begriff Bot-Management zusammen. Laut Anthropic respektieren seine Bots technische Schutzmaßnahmen und versuchen etwa nicht, CAPTCHAs zu umgehen, also Aufgaben, die Menschen von Programmen unterscheiden sollen. Ein CAPTCHA hält Claude-SearchBot deshalb auch dann fern, wenn die robots.txt ihn zulässt.