ClaudeBot ist der Name, mit dem sich ein Webcrawler von Anthropic ausweist, also ein Programm, das Webseiten automatisch abruft. Was ClaudeBot sammelt, kann in die Trainingsdaten künftiger Modelle von Anthropic einfließen, etwa der Sprachmodelle hinter Claude. Mit einer Regel für ClaudeBot signalisiert eine Website Anthropic, ob ihre Inhalte für das Training erfasst werden dürfen.

Einer von drei Bots bei Anthropic

Anthropic setzt drei Bots ein und trennt sie nach Zweck, damit Website-Betreiber über jeden Zweck einzeln entscheiden können. Jeder hat ein eigenes Token, also den Namen, über den die robots.txt ihn anspricht:

  • ClaudeBot sammelt Inhalte, die zum Training von Anthropics KI-Modellen beitragen können, und ist damit ein Trainings-Crawler.
  • Claude-SearchBot analysiert Webinhalte, um die Antworten von Claudes Websuche relevanter und genauer zu machen.
  • Claude-User kann Websites aufrufen, wenn jemand Claude eine Frage stellt, und ist damit ein User-triggered Fetcher.

Eine Gruppe in der robots.txt, also ein Block von Zeilen, der mit „User-agent: ClaudeBot“ beginnt, gilt nach dem Standard nur für ClaudeBot, nicht für Claude-SearchBot oder Claude-User.

ClaudeBot in der robots.txt

Anthropic beschreibt die Sperre so: Die Zeilen „User-agent: ClaudeBot“ und „Disallow: /“ in der robots.txt im Hauptverzeichnis untersagen ClaudeBot den Abruf der gesamten Website; für jede Subdomain, die ausgeschlossen werden soll, ist die Regel gesondert nötig. Eine solche Sperre signalisiert laut Anthropic, dass künftige Inhalte der Website aus Anthropics Trainingsdatensätzen ausgeschlossen werden sollen.

Ob ClaudeBot zugelassen bleibt, entscheidet jedes Unternehmen selbst: Manche möchten, dass künftige Claude-Modelle ihr Angebot auch aus der eigenen Website kennen, andere wollen ihre Texte nicht für das Training bereitstellen. Steht in der Datei keine Gruppe für ClaudeBot, gelten für ihn nach dem Standard der robots.txt die Regeln der Gruppe „User-agent: *“; das Sternchen spricht alle Crawler an, die keine eigene Gruppe haben. Eine eigene Gruppe für ClaudeBot macht die Entscheidung ausdrücklich.

Auch außerhalb der robots.txt kann ClaudeBot ausgesperrt sein, etwa durch Einstellungen von Firewall oder Hosting, die automatisierte Zugriffe abweisen. Solche Einstellungen gehören zum Bot-Management und können alle drei Bots von Anthropic zugleich treffen.

Crawl-delay: Abrufe bremsen statt sperren

Anthropic unterstützt außerdem das Feld Crawl-delay, mit dem eine Website die Crawling-Aktivität begrenzen kann. Anthropics Beispiel richtet sich an ClaudeBot und besteht aus den Zeilen „User-agent: ClaudeBot“ und „Crawl-delay: 1“. Das Feld ist nicht Teil von RFC 9309, dem Standard der robots.txt, und nicht jeder Crawler beachtet es: Google etwa unterstützt es laut eigener Dokumentation nicht. Anthropic schreibt, es respektiere Crawl-delay „wo angemessen“, und erklärt nicht, wie es den Zahlenwert genau auslegt.

Crawl-delay passt, wenn ClaudeBot einen Server spürbar belastet, die Inhalte aber für das Training verfügbar bleiben sollen. Das Feld sperrt nichts und schließt keine Inhalte vom Training aus. Eine eigene Gruppe für ClaudeBot ersetzt für ihn allerdings die Gruppe „User-agent: *“, auch wenn sie nur Crawl-delay enthält: Disallow-Regeln, die weiterhin auch für ClaudeBot gelten sollen, gehören deshalb zusätzlich in diese Gruppe.

Was eine Sperre von ClaudeBot für die Sichtbarkeit in Claude bedeutet

Claude hat zwei Wege zu einer Antwort: das Wissen, das seine Sprachmodelle im Training erworben haben, ihr parametrisches Wissen, und bei Bedarf aktuelle Inhalte aus dem Web. Nach Anthropics Beschreibung betrifft eine Regel für ClaudeBot nur den ersten Weg: Eine Sperre signalisiert, dass künftige Inhalte der Website nicht ins Training sollen, und kann sich damit erst bei künftigen Modellen auswirken. Die Websuche betreffen laut Anthropic die beiden anderen Bots: Sperrt eine Website Claude-SearchBot oder Claude-User, kann das ihre Sichtbarkeit dort verringern. Bleiben die beiden zugelassen, können sie die Inhalte einer Website, die ClaudeBot sperrt, weiter für Claudes Antworten abrufen.

Wie sich ein solcher Ausschluss langfristig darauf auswirkt, was künftige Claude-Modelle ohne Websuche über ein Angebot wissen, dokumentiert Anthropic nicht. Als Trainingsquelle nennt Anthropic außerdem Datensätze von Dritten; ob die Sperre auch für Inhalte der Website gilt, die in solchen Datensätzen enthalten sind, sagt Anthropic nicht. Eine Regel für ClaudeBot gilt zudem nur für Anthropic; ein KI-Trainings-Opt-out für mehrere KI-Anbieter braucht Regeln für die Tokens, die jeder Anbieter für das Training nennt.