Retrieval-Augmented Generation (RAG) folgt einem einfachen Prinzip: erst nachschlagen, dann schreiben. Ohne RAG beantwortet ein großes Sprachmodell eine Frage allein aus dem Gedächtnis, also aus dem parametrischen Wissen, das es im Training gespeichert hat. Mit RAG bekommt es zur Frage passende Texte vorgelegt und stützt seine Antwort darauf. KI-Systeme wie ChatGPT, Gemini, Claude und Perplexity nutzen dieses Prinzip, wenn sie für eine Antwort Inhalte aus dem Web abrufen. Für Unternehmen ist RAG damit der Weg, auf dem aktuelle Inhalte ihrer Website in KI-Antworten gelangen und dort als Quelle erscheinen können.

So entsteht eine Antwort mit RAG

Der Name beschreibt die drei Schritte des Verfahrens. Ein Beispiel: Jemand fragt ein KI-System, welche Hotels in einer bestimmten Stadt Tagungsräume für 80 Personen anbieten.

  1. Retrieval (Abruf): Das System sucht in einer Sammlung von Dokumenten nach Textstellen, die zur Frage passen. Bei KI-Assistenten ist das meist ein Webindex: ein Bestand von Webseiten, die Crawler vorab erfasst haben. Crawler sind Programme, die Webseiten automatisch abrufen. Oft leitet das System aus der Frage mehrere Teilanfragen ab, etwa zu Tagungshotels, Raumgrößen und Lage; dieses Vorgehen heißt Query Fan-out.
  2. Augmentation (Ergänzung): Die gefundenen Textstellen werden zusammen mit der ursprünglichen Frage an das Sprachmodell übergeben. Sie ergänzen den Prompt, also die Eingabe, auf die das Modell antwortet.
  3. Generation (Erzeugung): Das Sprachmodell schreibt die Antwort auf Grundlage der Frage und der übergebenen Textstellen, im Beispiel also aus den Seiten von Hotels und Tagungsportalen. Viele KI-Systeme verweisen dabei auf die genutzten Seiten. Solche Quellenangaben heißen KI-Zitate.

Den Namen prägte eine Forschungsarbeit aus dem Jahr 2020, entstanden bei Facebook AI Research, am University College London und an der New York University und vorgestellt auf der Fachkonferenz NeurIPS. Ihr System durchsuchte rund 21 Millionen kurze Textabschnitte aus der Wikipedia. Die Forschenden begründeten den Ansatz mit Schwächen von Sprachmodellen, die ihr Wissen nur in sich selbst speichern: Sie können es nicht einfach erweitern oder korrigieren, es ist schwer nachzuvollziehen, worauf eine Antwort beruht, und sie erfinden mitunter Fakten. Abgerufene Texte sind dagegen für Menschen lesbar und lassen sich austauschen. In einem Versuch ließen die Forschenden ihr System einmal mit einer Wikipedia-Fassung von Dezember 2016 und einmal mit einer von Dezember 2018 arbeiten. Fragen wie „Wer ist der Präsident von Peru?“ beantwortete es meist nach dem Stand der gerade eingesetzten Fassung, ohne neu trainiert zu werden.

Was RAG für die Sichtbarkeit deiner Website bedeutet

Weil RAG Inhalte im Moment der Frage heranzieht, können aktuelle Angaben einer Website in Antworten einfließen, sobald der Index die aktuelle Fassung der Seite erfasst hat. Was ein Modell ohne Abruf weiß, reicht dagegen nur bis zu seinem Knowledge Cutoff. Um über RAG in einer Antwort vorzukommen, muss eine Seite allerdings mehrere Stufen passieren. Die folgende Einteilung ist eine Vereinfachung, denn jedes System arbeitet im Detail anders:

  • Erfasst sein: In der Regel muss ein Crawler die Seite schon vor der Frage abgerufen haben, und sie muss im Index des jeweiligen Systems liegen. Ob Crawler eine Seite abrufen dürfen und können, beschreibt die Crawlbarkeit.
  • Gefunden werden: Beim Abruf muss die Seite oder ein Abschnitt daraus zu einer der Anfragen passen, die das System aus der Frage ableitet.
  • Ausgewählt werden: Viele RAG-Systeme bewerten die gefundenen Textstellen in einem zweiten Schritt genauer (Reranking) und geben nur die passendsten an das Sprachmodell weiter.
  • Genutzt werden: Im letzten Schritt entscheidet sich, welche Inhalte in die Antwort einfließen und welche Seiten als Quelle erscheinen. Abschnitte, die für sich allein verständlich sind, lassen sich dabei leichter übernehmen; diese Eigenschaft heißt Zitierfähigkeit.

Jede Stufe wirkt wie ein Filter: Was nicht erfasst ist, kann nicht gefunden werden, und eine Textstelle, die nicht ausgewählt wird, erreicht das Sprachmodell nicht. Wie viel von den frühen Stufen abhängt, untersuchte eine auf der Fachkonferenz KDD 2026 vorgestellte Studie in einer Testumgebung, die Abruf, Auswahl und Antwort nachbildet. Texte, die nur im Fließtext mit Methoden aus der GEO-Forschung umformuliert worden waren, gewannen beim Schreiben der Antwort kaum an Sichtbarkeit und fielen schon beim Abruf und bei der Auswahl häufiger heraus. Bezogen die Überarbeitungen auch den Seitentitel, die kurze Beschreibung im Code der Seite, die Überschriften und strukturierte Daten ein, schnitten sie besser ab, vor allem beim Abruf. Die Testumgebung wertet diese Angaben allerdings eigens aus und bildet nicht die Systeme einzelner Anbieter nach. Sie zeigt aber, dass sich die Wirkung einer Änderung erst über alle Stufen hinweg beurteilen lässt.

RAG und Grounding

Eng verwandt mit RAG ist der Begriff Grounding. Google setzt beide in seinem Leitfaden zu den KI-Funktionen der Google Suche gleich: RAG sei eine Technik, auch „Fundierung“ genannt, die Qualität, Genauigkeit und Aktualität von KI-Antworten verbessert, indem sie passende, aktuelle Webseiten aus Googles Index abruft. Wo zwischen beiden unterschieden wird, bezeichnet RAG das Verfahren, also erst abrufen, dann schreiben, und Grounding das Ziel: eine Antwort, deren Aussagen sich auf bestimmte Quellen zurückführen lassen.

Grenzen von RAG

RAG kann nur mit dem arbeiten, was der Abruf liefert. Anthropic, der Anbieter von Claude, weist darauf hin, dass die Wirkung von RAG von der Qualität und Relevanz der zugrunde liegenden Sammlung und der abgerufenen Inhalte abhängt. Der Abruf kann eine passende Seite übersehen oder eine Textstelle liefern, die die Frage nur teilweise beantwortet. Zudem kann eine Textstelle, die aus ihrer Seite herausgelöst wird, ihren Zusammenhang verlieren, etwa wenn sie das Unternehmen, um das es geht, nicht selbst nennt. Auch eine Antwort, die auf abgerufenen Inhalten beruht, ist deshalb nicht automatisch fehlerfrei und kann sogar Halluzinationen enthalten.

Außerdem kommt RAG nicht bei jeder Antwort zum Einsatz. Ob ein KI-System für eine Frage überhaupt Inhalte abruft, hängt vom System, seinen Einstellungen und der Frage ab; antwortet es allein aus seinem parametrischen Wissen, spielt RAG für diese Antwort keine Rolle. Wie die Anbieter Inhalte auswählen, gewichten und zusammenführen, dokumentieren sie nur in Grundzügen.