Retrieval Augmented Generation
Was ist Retrieval Augmented Generation (RAG)?
Retrieval Augmented Generation (RAG) ist eine KI-Architektur, die ein großes Sprachmodell mit einem vorgeschalteten Abruf-Schritt kombiniert. Vor der Antwortgenerierung werden relevante Informationen aus einer externen Wissensquelle abgerufen und dem Modell als Kontext mitgegeben. Dadurch reduziert RAG Halluzinationen und liefert aktuelle, belegbare Antworten. RAG ist die Grundlage vieler KI-Suchsysteme wie Perplexity und der Google AI Overviews.

Ein reines Sprachmodell antwortet nur aus dem, was es beim Training gelernt hat. Sein Wissen ist damit auf einen Stichtag eingefroren und lässt sich nicht überprüfen. RAG durchbricht diese Grenze: Das Modell greift zur Laufzeit auf eine aktuelle Wissensbasis zu – etwa eine Dokumentensammlung, eine Datenbank oder das offene Web – und stützt seine Antwort auf diese Fundstellen. Das Ergebnis ist eine Antwort mit Quellenbezug statt aus dem Gedächtnis.
Kurzprofil des Begriffs
| Merkmal | Angabe |
|---|---|
| Begriff | Retrieval Augmented Generation (RAG) |
| Kategorie | KI-Architektur / Verfahren des maschinellen Lernens |
| Deutsche Entsprechung | abrufgestützte Generierung |
| Aussprache | „ri-tríh-wl og-méntid dschene-réischn“ |
| Bestandteile | Retrieval (Abruf), Augmentation (Anreicherung), Generation (Erzeugung) |
| Verwandte Begriffe | LLM, Embedding, Vektordatenbank, Grounding, GEO |
| Erstmals beschrieben | 2020 (Forschungsarbeit von Lewis et al., Facebook AI Research) |
Wie funktioniert RAG (Retrieval, Augmentation, Generation)?
RAG läuft in drei aufeinanderfolgenden Schritten ab, die dem Verfahren seinen Namen geben: erst Abruf, dann Anreicherung, zuletzt Erzeugung. Der entscheidende Unterschied zum reinen Sprachmodell steckt in den ersten beiden Schritten, die vor der eigentlichen Textausgabe passieren.
- Retrieval (Abruf): Die Nutzerfrage wird in einen Vektor (ein Embedding) umgewandelt und mit einer Wissensbasis abgeglichen. Eine Vektordatenbank findet die inhaltlich ähnlichsten Textpassagen – nicht über exakte Wortübereinstimmung, sondern über semantische Nähe.
- Augmentation (Anreicherung): Die gefundenen Passagen werden dem ursprünglichen Prompt als Kontext beigelegt. Das Modell bekommt die Frage also nicht mehr allein, sondern zusammen mit den relevanten Belegstellen.
- Generation (Erzeugung): Das Sprachmodell formuliert die Antwort auf Basis dieses angereicherten Prompts. Weil die Fakten mitgeliefert wurden, kann es sie zitieren, statt sie zu erraten.
Der Abruf funktioniert über Entitäten und semantische Ähnlichkeit, nicht über Keywords im klassischen Sinn. Genau deshalb spielt strukturierte, eindeutige Information eine so große Rolle für die Auffindbarkeit im Retrieval-Schritt.
Warum nutzt man RAG gegen Halluzinationen?
RAG löst die zwei größten Schwächen reiner Sprachmodelle: erfundene Fakten und veraltetes Wissen. Ein Sprachmodell erzeugt Text nach statistischer Wahrscheinlichkeit und kann dabei sehr überzeugend klingende, aber falsche Aussagen produzieren – das nennt man Halluzination. Weil RAG die Antwort an konkrete Fundstellen bindet, sinkt dieses Risiko deutlich.
Die wichtigsten Vorteile im Überblick:
- Aktualität: Die Wissensbasis lässt sich jederzeit aktualisieren, ohne das Modell neu zu trainieren. Neue Fakten sind sofort verfügbar.
- Nachvollziehbarkeit: Antworten können auf ihre Quellen verweisen. Genau das machen KI-Suchen sichtbar, wenn sie Fußnoten oder Links anzeigen.
- Fachwissen: Unternehmen binden eigene Dokumente ein – Handbücher, Produktdaten, interne Wikis – ohne diese sensiblen Daten ins Modelltraining zu geben.
- Kosten: Der Abruf ist günstiger als ein erneutes Training bei jeder Wissensänderung.
Dieses Verankern einer Antwort an belegbaren Fakten wird auch als Grounding bezeichnet. RAG ist das gängigste technische Verfahren, um Grounding umzusetzen.
Was bedeutet RAG für SEO und GEO?
Für die Suchmaschinenoptimierung bedeutet RAG einen Perspektivwechsel: Inhalte müssen nicht mehr nur ranken, sondern im Retrieval-Schritt als Beleg abrufbar und zitierfähig sein. Systeme wie AI Overviews, ChatGPT oder Perplexity rufen zur Laufzeit Inhalte ab und bauen daraus ihre Antwort. Wer als Quelle abgerufen und genannt werden will, muss für den Retrieval-Schritt optimieren.
Genau hier setzt Generative Engine Optimization (GEO) an – die Disziplin, Inhalte für die Zitierung in KI-Antworten aufzubereiten. Eng verwandt ist LLMO, die Optimierung der Sichtbarkeit in großen Sprachmodellen. Beide zielen darauf, dass ein RAG-System den eigenen Inhalt findet, versteht und als belegte Aussage übernimmt.
Drei Hebel helfen dabei besonders:
- Klare Definitionen: Kurze, eigenständig zitierfähige Aussagen – genau wie die Definition am Anfang dieses Artikels – lassen sich leicht als Passage abrufen.
- Strukturierte Daten: Schema.org und ein sauberer Knowledge Graph machen Entitäten und Beziehungen maschinenlesbar und erhöhen die Chance, korrekt abgerufen zu werden.
- Thematische Tiefe: Vollständig beantwortete Fragen liefern die Passagen, die ein RAG-System als Kontext bevorzugt.
Diese Verzahnung aus technischer Sauberkeit und zitierfähigem Inhalt ist der Kern moderner SEO-Betreuung, die klassische Rankings und KI-Sichtbarkeit gemeinsam denkt.
RAG vs. reines LLM und Fine-Tuning
RAG, ein reines LLM und Fine-Tuning lösen das Wissensproblem auf unterschiedliche Weise – und schließen sich nicht gegenseitig aus. Ein reines LLM antwortet allein aus dem Trainingswissen. Fine-Tuning trainiert ein Modell mit zusätzlichen Beispielen nach, um Stil oder Fachverhalten zu prägen. RAG dagegen lässt das Modell unangetastet und reicht das Wissen zur Laufzeit an.
| Aspekt | Reines LLM | Fine-Tuning | RAG |
|---|---|---|---|
| Wissensstand | eingefroren | eingefroren (bis zum nächsten Training) | jederzeit aktuell |
| Quellen belegbar | nein | nein | ja |
| Aufwand bei neuem Wissen | Neutraining | erneutes Fine-Tuning | Wissensbasis updaten |
| Stärke | flüssige Sprache | Ton & Verhalten | Fakten & Aktualität |
In der Praxis werden RAG und Fine-Tuning oft kombiniert: Fine-Tuning prägt, wie das Modell antwortet, RAG steuert bei, womit es antwortet. Für aktuelle, überprüfbare Fakten ist RAG der Ansatz der Wahl.
Häufige Fragen zu Retrieval Augmented Generation
Wofür steht die Abkürzung RAG?
RAG steht für Retrieval Augmented Generation, auf Deutsch etwa „abrufgestützte Generierung“. Der Name beschreibt die drei Schritte des Verfahrens: Abruf (Retrieval), Anreicherung (Augmentation) und Erzeugung (Generation).
Braucht RAG eine Vektordatenbank?
In den meisten Fällen ja. Eine Vektordatenbank speichert Inhalte als Embeddings und findet im Retrieval-Schritt die semantisch passenden Passagen. Es gibt auch RAG-Varianten mit klassischer Volltextsuche, doch die semantische Suche über Vektoren ist der Standard.
Verhindert RAG Halluzinationen vollständig?
Nein. RAG senkt das Risiko deutlich, weil die Antwort an abgerufene Fakten gebunden ist. Falsch oder unvollständig abgerufener Kontext kann aber weiterhin zu Fehlern führen. Qualität und Aktualität der Wissensbasis bleiben entscheidend.
Was hat RAG mit SEO zu tun?
KI-Suchsysteme nutzen RAG, um Antworten aus abgerufenen Webinhalten zu bauen. Wer als Quelle zitiert werden möchte, optimiert seine Inhalte so, dass sie im Retrieval-Schritt gefunden und übernommen werden – das ist das Ziel von GEO und LLMO.
