Der Nutzungsvorbehalt ist ein Instrument des Urheberrechts, das für jede Website eine Rolle spielt, deren Inhalte KI-Anbieter sammeln können. Das Gesetz erlaubt grundsätzlich, rechtmäßig zugängliche Werke wie frei abrufbare Texte und Bilder für Text und Data Mining (TDM) zu vervielfältigen, also um aus ihnen automatisiert Informationen etwa über Muster, Trends und Zusammenhänge zu gewinnen. Laut der KI-Verordnung der EU können solche Verfahren beim Training großer KI-Modelle in großem Umfang zum Einsatz kommen. Ein Nutzungsvorbehalt ist die rechtliche Seite der Entscheidung, Inhalte aus den Trainingsdaten künftiger KI-Modelle herauszuhalten; welche praktischen Wege es dafür gibt, beschreibt der Begriff KI-Trainings-Opt-out.

Was das Gesetz regelt

Grundlage ist die EU-Richtlinie über das Urheberrecht im digitalen Binnenmarkt (DSM-Richtlinie) vom April 2019. Ihr Artikel 4 erlaubt TDM an rechtmäßig zugänglichen Werken nur, solange die Rechteinhaber diese Nutzung nicht ausdrücklich und in angemessener Weise vorbehalten haben, bei online veröffentlichten Inhalten etwa mit maschinenlesbaren Mitteln. Die Erwägungsgründe der Richtlinie, also die Begründungen, die ihren Artikeln vorangestellt sind, ergänzen: Bei online veröffentlichten Inhalten sollen nur maschinenlesbare Mittel als angemessen gelten, und andere Nutzungen als TDM soll ein solcher Vorbehalt nicht berühren. Deutschland hat die Regel in § 44b des Urheberrechtsgesetzes (UrhG) umgesetzt: Ein Nutzungsvorbehalt bei online zugänglichen Werken ist danach nur wirksam, wenn er in maschinenlesbarer Form erfolgt.

Die KI-Verordnung der EU knüpft daran an. Anbieter von KI-Modellen mit allgemeinem Verwendungszweck, zu denen typischerweise große Sprachmodelle zählen, müssen eine Strategie haben, mit der sie solche Vorbehalte ermitteln und einhalten, auch mithilfe modernster Technologien. Haben Rechteinhaber ihre Werke ausdrücklich und in angemessener Weise vorbehalten, brauchen die Anbieter laut den Erwägungsgründen der Verordnung deren Erlaubnis, um TDM daran durchzuführen.

Ob die Erlaubnis für TDM das Training großer Sprachmodelle überhaupt erfasst, soll der Gerichtshof der EU klären: Ein ungarisches Gericht hat ihm 2025 in einem Streit zwischen einem Presseverlag und Google unter anderem diese Frage vorgelegt (Rechtssache C-250/25). Ein Urteil lag bis Anfang Oktober 2026 nicht vor.

Was als maschinenlesbar gilt

Was Maschinenlesbarkeit bei einem Nutzungsvorbehalt konkret verlangt, legt das Gesetz nicht fest. Die Erwägungsgründe der DSM-Richtlinie nennen als Beispiele Metadaten sowie die Geschäftsbedingungen einer Website oder eines Dienstes.

Wie das auszulegen ist, ist umstritten. Das zeigt der Streit eines Fotografen mit dem Verein LAION, der für einen Datensatz, mit dem sich KI-Modelle trainieren lassen, unter anderem ein Foto des Fotografen von der Website einer Bildagentur heruntergeladen hatte. Die Agentur hatte den Abruf durch Bots und andere automatisierte Programme nur in natürlicher Sprache untersagt, in ihren Nutzungsbedingungen und im Quellcode ihrer Website. Das Landgericht Hamburg äußerte im September 2024 die Ansicht, ein solcher Vorbehalt könne genügen, weil KI-Anwendungen natürliche Sprache verstehen können; sein Urteil stützte es aber auf eine andere Vorschrift. Das Oberlandesgericht Hamburg kam im Dezember 2025 dagegen zu dem Ergebnis, der Fotograf habe nicht dargelegt, dass der Vorbehalt zum maßgeblichen Zeitpunkt der Nutzung im Jahr 2021 maschinenlesbar war. Der Bundesgerichtshof verhandelte den Fall im September 2026 (Aktenzeichen I ZR 281/25), deutete laut Berichten über die Verhandlung an, dass er Auslegungsfragen dem Gerichtshof der EU vorlegen könnte, und hat seine Entscheidung für den 17. Dezember 2026 angekündigt.

Ein Hinweis im Impressum oder in den Nutzungsbedingungen macht einen Vorbehalt für Menschen nachvollziehbar. Ob ein solcher Text allein als maschinenlesbarer Vorbehalt genügt, hatten bis Anfang Oktober 2026 weder der Bundesgerichtshof noch der Gerichtshof der EU entschieden.

Vorbehalte in der robots.txt

Ein Format nennt der EU-Verhaltenskodex für KI-Modelle mit allgemeinem Verwendungszweck ausdrücklich: die robots.txt. In diesem freiwilligen Kodex, der im Juli 2025 veröffentlicht wurde, verpflichten sich die Unterzeichner, für TDM und das Training ihrer Modelle Crawler einzusetzen, welche die robots.txt nach dem Standard RFC 9309 lesen und befolgen. Crawler sind Programme, die Webseiten automatisch abrufen. Zu den Unterzeichnern zählen OpenAI, Google und Anthropic. Die Zeilen „User-agent: GPTBot“ und „Disallow: /“ etwa untersagen dem Trainings-Crawler von OpenAI, GPTBot, den Abruf der gesamten Website. Unterzeichner, die zugleich eine Online-Suchmaschine im Sinne des EU-Gesetzes über digitale Dienste (Digital Services Act) betreiben, ermuntert der Kodex außerdem, darauf zu achten, dass Websites, die einen Vorbehalt erklären, dadurch nicht unmittelbar schlechter im Index des Anbieters erfasst werden.

Eine Regel in der robots.txt richtet sich entweder an ein Token, also an den Namen, den ein Anbieter für einen Crawler oder für einen bestimmten Nutzungszweck festlegt, oder mit „User-agent: *“ an alle Crawler, für die keine eigenen Regeln in der Datei stehen. Gezielt erreicht sie einen Zweck wie das KI-Training deshalb nur über die Tokens, die ein Anbieter für diesen Zweck nennt: Wer Inhalte vom KI-Training ausnehmen möchte, spricht die Trainings-Crawler der einzelnen Anbieter an und die Tokens, die sie eigens für das Training dokumentieren.

Daneben gibt es Formate, die eigens für Vorbehalte gedacht sind. TDMRep etwa ist ein Protokoll, das eine offene Arbeitsgruppe beim Web-Gremium W3C erstmals 2022 veröffentlicht hat (aktuelle Fassung: Mai 2024) und das kein offizieller W3C-Standard ist; es erklärt den Vorbehalt unter anderem in einer eigenen Datei auf dem Server, in der Antwort des Servers oder im HTML-Code einer Seite. Der Netzwerkdienstleister Cloudflare erklärt Einschränkungen, die Websites mit seinen Content Signals angeben, einer Zusatzzeile in der robots.txt, ausdrücklich zu Vorbehalten nach Artikel 4 der DSM-Richtlinie; ob KI-Anbieter diese Angaben beachten, geht aus den Crawler-Dokumentationen von OpenAI, Google, Anthropic und Perplexity nicht hervor (Stand: Oktober 2026). Solche weiteren Protokolle zu beachten, sieht der Kodex vor, wenn Normungsorganisationen sie angenommen haben oder wenn sie dem Stand der Technik entsprechen, unter Rechteinhabern weit verbreitet und auf EU-Ebene allgemein vereinbart sind.

Nutzungsvorbehalt und KI-Antworten

Ein Nutzungsvorbehalt betrifft TDM. Ob eine Website als Quelle in KI-Antworten erscheinen kann, hängt vor allem davon ab, welche Crawler ihre robots.txt zulässt. OpenAI, Anthropic und Perplexity erfassen Quellen für Antworten mit eigenen KI-Index-Crawlern wie OAI-SearchBot, für die eigene Regeln gelten; laut Perplexity sammeln seine Crawler keine Inhalte für das Training von KI-Basismodellen. Bei OpenAI und Anthropic lassen sich Training und Antworten deshalb getrennt regeln: Eine Sperre der Trainings-Crawler schließt die KI-Index-Crawler nicht mit aus. Anders bei Google: Das Token Google-Extended regelt zugleich das Training künftiger Gemini-Modelle und das Grounding in den Gemini-Apps, also die Nutzung von Inhalten als Grundlage für Antworten.

Sperrt eine Website auch die Crawler, die Quellen für Antworten erfassen, verzichtet sie weitgehend darauf, dass die betreffenden KI-Systeme ihre Seiten als Quelle für Antworten nutzen und als KI-Zitate anzeigen. Das ist ein Opt-out aus KI-Antworten: Diese Entscheidung geht über einen Nutzungsvorbehalt hinaus und kostet Sichtbarkeit in den Antworten, für die sie gilt. Vollständig erfasst die robots.txt solche Abrufe allerdings nicht: Für einen User-triggered Fetcher, der Seiten abruft, weil eine Person im Chat danach fragt, gilt sie nicht bei jedem Anbieter.

Diese Seite erklärt die Rechtslage allgemein und ersetzt keine Rechtsberatung.