PerplexityBot ist der Name, unter dem sich der Crawler von Perplexity beim Abruf von Webseiten ausweist. Crawler sind Programme, die Webseiten automatisch abrufen; die von KI-Anbietern wie Perplexity nennt man KI-Crawler. Weist sich ein Crawler aus, nennt er bei jeder Anfrage seinen Namen, und über diesen Namen, das sogenannte Token, spricht die robots.txt ihn gezielt an. Von PerplexityBots Zugang zu deiner Website hängt mit ab, ob Perplexity deine Seiten in seinen Antworten als Quelle anzeigen und verlinken kann.
Wofür Perplexity PerplexityBot einsetzt
Perplexity zieht für seine Antworten standardmäßig aktuelle Inhalte aus dem Web heran, vor allem aus einem eigenen Webindex. PerplexityBot nimmt Seiten in diesen Index auf und gehört damit zu den KI-Index-Crawlern: Crawlern, die Seiten als mögliche Quellen für KI-Antworten erfassen. Gibt Perplexity eine erfasste Seite in einer Antwort als nummerierte Quelle an, ist das ein KI-Zitat.
Für das Training von KI-Basismodellen, also den großen Sprachmodellen, auf denen KI-Systeme aufbauen, wird PerplexityBot laut Perplexity nicht eingesetzt. Perplexity begründet das damit, dass es keine eigenen Basismodelle entwickle. Einen eigenen Trainings-Crawler, wie ihn OpenAI mit GPTBot und Anthropic mit ClaudeBot betreiben, führt Perplexity in seiner Crawler-Dokumentation nicht auf.
Neben PerplexityBot betreibt Perplexity den Abrufdienst Perplexity-User. Er kann eine Seite aufrufen, wenn jemand Perplexity eine Frage stellt, und ist damit ein User-triggered Fetcher mit eigenem Token. Laut Perplexity wirkt jede robots.txt-Einstellung für seine Bots unabhängig von den anderen; wie Perplexity-User selbst mit der robots.txt umgeht, beschreibt Perplexity allerdings nicht einheitlich.
PerplexityBot zulassen: robots.txt und Firewall
Perplexity empfiehlt, PerplexityBot in der robots.txt zuzulassen, damit eine Website in Perplexity erscheinen kann. Die Zeilen „User-agent: PerplexityBot“ und „Allow: /“ erlauben ihm ausdrücklich, die gesamte Website abzurufen. Folgt auf „User-agent: PerplexityBot“ dagegen „Disallow: /“, ist er für alle Seiten gesperrt. Laut Perplexity kann es bis zu 24 Stunden dauern, bis seine Systeme eine Änderung berücksichtigen.
Damit PerplexityBot eine Website tatsächlich abrufen kann, genügt die robots.txt allein nicht immer. Perplexity rät außerdem, Anfragen von den IP-Adressen zuzulassen, die es für PerplexityBot veröffentlicht, also von den Netzadressen, über die der Crawler zugreift. Firewalls, also Schutzsysteme gegen unerwünschte Zugriffe, und Content-Delivery-Networks (CDN), also Netze von Servern, die Seiten schneller ausliefern, können Schutzfunktionen gegen Bots enthalten, zusammengefasst als Bot-Management. Diese wirken unabhängig von der robots.txt und können PerplexityBot abweisen, obwohl die robots.txt ihn erlaubt. Für die Firewalls von Cloudflare und Amazon Web Services beschreibt Perplexity Freigaberegeln, die den Namen PerplexityBot mit der Liste dieser IP-Adressen verbinden. Weil jedes Programm diesen Namen angeben kann, prüfen solche Regeln zusätzlich die IP-Adresse.
In den Server-Logs, also den Protokollen, die ein Webserver über alle Abrufe führt, zeigen sich Anfragen, die im User-Agent, der Selbstauskunft eines Programms beim Abruf, „PerplexityBot/1.0“ angeben. Ob eine solche Anfrage tatsächlich von Perplexity stammt, zeigt erst der Abgleich mit den veröffentlichten IP-Adressen.
Was eine Sperre von PerplexityBot bewirkt
Ob du PerplexityBot zulässt, ist eine Entscheidung über deine Sichtbarkeit in Perplexity. Nach Perplexitys Angaben ist eine Sperre kein Hebel für die Frage, ob deine Inhalte in das Training von KI-Basismodellen einfließen; dafür gibt es das KI-Trainings-Opt-out über die Crawler und Tokens, die andere Anbieter für das Training dokumentieren. Eine Sperre verringert aber die Chance, dass Perplexity deine Seiten als Quelle heranzieht und verlinkt. Umgekehrt garantiert der Zugang keinen Platz als Quelle: Welche Seiten in eine Antwort einfließen, entscheidet Perplexity selbst.
Erwähnen kann Perplexity ein Unternehmen auch dann, wenn dessen Website PerplexityBot sperrt, etwa auf Grundlage anderer Websites, die über das Unternehmen berichten; als Quelle können dann diese Websites erscheinen. Wer Inhalte bewusst aus KI-Antworten heraushalten möchte, findet die Möglichkeiten der verschiedenen Anbieter unter Opt-out aus KI-Antworten.
Laut Perplexity befolgt PerplexityBot die Regeln der robots.txt. Im August 2025 warf der Infrastrukturanbieter Cloudflare Perplexity vor, Sperren von Websites mit Crawlern zu umgehen, die sich nicht als Perplexity zu erkennen gäben; Perplexity wies den Vorwurf zurück.