Google-Extended ist ein Name, den eine Website in ihrer robots.txt ansprechen kann, um über die Nutzung ihrer Inhalte für Training und Grounding bei Gemini zu entscheiden. Google führte ihn im September 2023 ein, damals für den KI-Assistenten Bard, der seit Februar 2024 Gemini heißt, und für die generativen KI-Programmierschnittstellen (APIs) seiner Cloud-Plattform Vertex AI. Zwei Punkte werden leicht missverstanden: Google-Extended sieht aus wie der Name eines Crawlers, also eines Programms, das Webseiten automatisch abruft, ist aber keiner. Und die Regel entscheidet nicht darüber, ob eine Website in den KI-Funktionen der Google Suche erscheint.
Ein Token ohne eigenen Crawler
In der robots.txt sprechen Regeln Crawler über ihr Token an, also über den Namen, mit dem sie sich ausweisen. Google-Extended ist ein solches Token, laut Google steht aber kein eigener Crawler dahinter: Google crawlt mit seinen bestehenden Crawlern und nutzt das Token nur zur Steuerung. Eine Regel für Google-Extended entscheidet deshalb nicht darüber, ob Google eine Seite abruft, sondern darüber, wofür Google die abgerufenen Inhalte verwenden darf.
Die Regel steht in einer eigenen Gruppe der robots.txt. Die Zeilen „User-agent: Google-Extended“ und „Disallow: /“ schließen die Inhalte der gesamten Website von den Verwendungen aus, die Google-Extended regelt. Wie bei anderen Gruppen lassen sich auch nur einzelne Verzeichnisse sperren, etwa ein Archiv.
Was Google-Extended steuert
Laut Google regelt das Token zwei Verwendungen:
- Training: ob Inhalte für das Training künftiger Generationen von Gemini-Modellen genutzt werden dürfen, also in deren Trainingsdaten einfließen. Google nennt die Modelle hinter den Gemini-Apps und hinter der Vertex AI API für Gemini.
- Grounding: ob Gemini die Inhalte für das Grounding nutzen darf. Google versteht darunter, dass ein Modell im Moment der Frage Inhalte aus Googles Webindex erhält, damit die Antwort sachlich genauer und relevanter wird. Das gilt für das Grounding in den Gemini-Apps und für das Werkzeug Grounding with Google Search auf der Gemini Enterprise Agent Platform, Googles Cloud-Plattform für Unternehmen, die im April 2026 aus Vertex AI hervorgegangen ist.
Was Google-Extended nicht steuert
Laut Google beeinflusst Google-Extended nicht, ob eine Website in der Google Suche vorkommt. Das gilt auch für die Übersicht mit KI und den KI-Modus, die zur Google Suche gehören: Ob Inhalte dort erscheinen dürfen, lässt sich über den Zugang für Googles Crawler Googlebot steuern, über Anweisungen im Code einer Seite wie nosnippet und über die Einstellung „Generative KI in der Google Suche“ in der Google Search Console, Googles Werkzeug für Website-Betreiber. Um das Training der Modelle hinter diesen Funktionen zu begrenzen, verweist Google dagegen auf Google-Extended.
Die Regel bezieht sich außerdem auf das Training künftiger Gemini-Generationen; ein Verfahren, Inhalte aus bereits trainierten Modellen zu entfernen, beschreibt Google in seiner Dokumentation zu Google-Extended nicht. Und sie betrifft Inhalte, die Google crawlt. Für Abrufe, die eine Person selbst auslöst, etwa wenn sie in Gemini Notebook eine Webadresse als Quelle angibt, setzt Google eigene User-triggered Fetcher ein; diese ignorieren laut Google im Allgemeinen die Regeln der robots.txt. Ob Google-Extended für Inhalte aus solchen Abrufen gilt, sagt Google nicht.
Training und Grounding hängen zusammen
Für ein KI-Trainings-Opt-out bei Google ist Google-Extended der Weg, den Google dokumentiert. Bei OpenAI und Anthropic lassen sich das Training und die Nutzung als Quelle für Antworten über getrennte Tokens steuern, bei OpenAI etwa mit GPTBot für das Training. Bei Gemini hängt beides an derselben Regel. Wer Google-Extended sperrt, um Inhalte aus dem Training herauszuhalten, trifft damit zugleich eine zweite Entscheidung: Laut Google dürfen die Gemini-Apps die Seiten der Website dann auch nicht für das Grounding ihrer Antworten nutzen.
Für Gemini bleibt deshalb eine einzige Abwägung. Manche Unternehmen möchten, dass die Gemini-Apps ihre aktuellen Seiten für das Grounding nutzen können, und lassen Google-Extended zu; damit erlauben sie auch das Training künftiger Gemini-Modelle mit ihren Inhalten. Andere schließen das Training bewusst aus und verzichten dafür auf das Grounding. Ob eine Regel für Google-Extended zugleich als Nutzungsvorbehalt im rechtlichen Sinn gilt, ist eine eigene Frage des Urheberrechts.