Die meisten Fragen im Arbeitsalltag drehen sich um internes Wissen: Welche Gewährleistung gilt für die Baureihe aus dem Vorjahr, was steht im Rahmenvertrag mit Lieferant Y, wer muss eine Preisausnahme freigeben? Ein Sprachmodell allein kennt diese Antworten nicht, denn Ihre Verträge, Handbücher und Richtlinien waren nie Teil seines Trainings. Retrieval Augmented Generation (RAG) schließt diese Lücke.
Die KI sucht vor jeder Antwort passende Stellen in Ihren Dokumenten und formuliert die Antwort auf dieser Grundlage, mit Angabe der Fundstelle. Dieser Leitfaden erklärt das Verfahren, zeigt den technischen Stand im September 2026, benennt die Grenzen und beschreibt, wie der erste Wissensassistent im Unternehmen entsteht.
Das Wichtigste in Kürze
- Retrieval Augmented Generation heißt: erst suchen, dann antworten. Das Sprachmodell bekommt vor der Antwort passende Textstellen aus Ihren eigenen Quellen. Der Begriff stammt aus einer Arbeit von Patrick Lewis und Kollegen bei Facebook AI Research aus dem Jahr 2020.
- RAG senkt Fehlantworten, es verhindert sie nicht. Eine Untersuchung von Stanford RegLab und HAI (Mai 2024) fand bei RAG-gestützten Rechtsrecherche-Werkzeugen über 17 % beziehungsweise über 34 % fehlerhafte Antworten.
- Der heutige Stand der Technik heißt Hybrid-Suche und Reranking. Anthropic misst für Kontextanreicherung plus Stichwortsuche und Reranking 67 % weniger fehlgeschlagene Abrufe als bei einfacher Vektorsuche (September 2024).
- Kleine Wissensbestände brauchen kein RAG. Unter rund 200.000 Token, also etwa 500 Seiten, passt der gesamte Bestand in das Kontextfenster aktueller Modelle. RAG lohnt sich bei großen und wachsenden Beständen.
- Der Aufwand liegt selten in der Technik. Entscheidend sind Datenpflege, ein sauberes Rechtekonzept und die laufende Messung der Antwortqualität.
Was ist Retrieval Augmented Generation (RAG)?
Retrieval Augmented Generation ist ein Verfahren, bei dem ein Sprachmodell vor der Antwort passende Textstellen aus einer eigenen Wissensquelle abruft (Retrieval) und die Antwort auf diese Stellen stützt (Generation). Beschrieben wurde es 2020 von Patrick Lewis und Kollegen bei Facebook AI Research in der Arbeit Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.
Der Nutzen ergibt sich aus einer einfachen Arbeitsteilung. Das Sprachmodell bringt Sprachverständnis mit und kennt öffentliches Wissen bis zu seinem Trainingsstand; bei aktuellen Modellen liegt dieser Stand im Jahr 2026 (Anthropic nennt für Claude Opus 5 den Mai 2026). Ihr internes Wissen steht dagegen nur in Ihren Systemen. RAG bringt beides in einer Antwort zusammen.
RAG ist kein Training. Beim Feinabstimmen (Fine-Tuning) verändern Sie das Modell selbst, was Aufwand, Daten und Wiederholung bei jeder Änderung bedeutet. Bei RAG bleibt das Modell unverändert, Sie tauschen die Dokumente aus. Genau deshalb lässt sich eine geänderte Richtlinie am selben Tag berücksichtigen.
| Frage aus dem Alltag | Sprachmodell ohne Anbindung | Sprachmodell mit RAG |
|---|---|---|
| Wie lange gilt die Gewährleistung für Produkt X? | Allgemeine Aussage zum Gesetz oder ein Hinweis, dass die Information fehlt. | Antwort aus Ihren Verkaufsbedingungen, mit Dateiname und Fundstelle. |
| Welche Schritte gelten bei einer Reklamation? | Branchenüblicher Ablauf, der zu Ihrem Prozess passen kann oder auch nicht. | Ihr Prozess aus der internen Arbeitsanweisung, in der gültigen Fassung. |
| Was haben wir mit Lieferant Y zur Zahlungsfrist vereinbart? | Keine belastbare Antwort möglich. | Antwort aus dem Rahmenvertrag, sofern der Vertrag im Wissensspeicher liegt. |
Wie funktioniert RAG? Vom Dokument zur belegten Antwort
RAG läuft in zwei Phasen: einmalig die Aufbereitung der Quellen, danach bei jeder Frage der Abruf. Fünf Schritte beschreiben den Weg vom Dokument zur belegten Antwort.
-
1
Quellen aufbereiten
Aus PDF, Office-Dateien, Wiki-Seiten oder Scans wird Text. Gescannte Dokumente brauchen Texterkennung (OCR). Gleichzeitig entstehen Metadaten wie Titel, Bereich, Gültigkeit und Vertraulichkeit, nach denen später gefiltert wird.
-
2
In Abschnitte zerlegen
Lange Dokumente werden in Abschnitte geteilt, die für sich verständlich bleiben. Bewährt hat sich, jedem Abschnitt seinen Kontext mitzugeben: Aus welchem Dokument, aus welchem Kapitel, für welchen Zeitraum stammt er.
-
3
Indexieren
Jeder Abschnitt wird sowohl für die Stichwortsuche als auch als Vektor für die Bedeutungssuche abgelegt. Die Vektorsuche findet sinnverwandte Formulierungen, die Stichwortsuche exakte Artikelnummern, Normen und Eigennamen.
-
4
Abrufen und sortieren
Zu jeder Frage werden Kandidaten aus beiden Indizes geholt, über Metadaten gefiltert und anschließend neu sortiert (Reranking). Erst die besten Treffer gehen weiter an das Modell.
-
5
Antworten mit Beleg
Die Fundstellen kommen zusammen mit der Frage in den Prompt. Eine feste Anweisung legt fest, dass die Antwort nur auf diesen Stellen beruht, die Quelle nennt und bei fehlender Information ausdrücklich sagt, dass sie fehlt.
RAG 2026: Was sich seit den ersten Systemen geändert hat
Aktuelle RAG-Systeme kombinieren Stichwort- und Vektorsuche, geben Abschnitten ihren Kontext mit, sortieren Treffer neu und messen die Qualität laufend. Die frühen Aufbauten von 2023 und 2024 arbeiteten dagegen mit starren Textblöcken, reiner Vektorsuche und einer festen Zahl von Treffern.
Der Unterschied ist messbar, denn die Qualität des Abrufs bestimmt die Qualität der Antwort. Anthropic berichtet für die Kombination aus angereicherten Abschnitten, Stichwortsuche und Reranking 67 % weniger fehlgeschlagene Abrufe gegenüber einfacher Vektorsuche (Stand September 2024).
| Baustein | Frühe Systeme | Stand September 2026 |
|---|---|---|
| Zerlegung | Feste Blockgröße, ohne Rücksicht auf Kapitelgrenzen | Abschnitte entlang der Struktur, jeweils mit Kontext und Metadaten |
| Suche | Nur Vektorähnlichkeit | Hybrid aus Stichwort- und Vektorsuche, dazu Filter nach Bereich und Gültigkeit |
| Auswahl | Feste Zahl von Treffern, unsortiert | Reranking nach Passung, wenige, aber sehr gute Stellen |
| Kontextfenster | Eng, jeder Treffer kostete Platz | Bis zu 1 Million Token bei aktuellen Modellen, kleine Bestände passen komplett hinein |
| Abruf | Eine Suche je Frage | Das Modell sucht mehrfach und über Werkzeuge, bis die Frage beantwortet ist |
| Qualität | Nach Gefühl beurteilt | Feste Testfragen, Kennzahlen für Treffer und Belegtreue |
Der wichtigste Wandel ist der letzte Punkt in der Tabelle. Statt einer einzigen Suche je Frage bekommt das Modell Werkzeuge und ruft sie so oft auf, wie es nötig ist: Wissensspeicher durchsuchen, eine Datenbank abfragen, ein Ticketsystem lesen. Standardisiert wird diese Anbindung über das Model Context Protocol. Wie viel Platz dabei überhaupt zur Verfügung steht, erklärt unser Beitrag zum Kontextfenster.
RAG, langes Kontextfenster oder Feinabstimmung: Was passt wann?
RAG passt zu großen, wachsenden Textbeständen, das lange Kontextfenster zu kleinen und stabilen, die Abfrage über Werkzeuge zu strukturierten Daten und die Feinabstimmung zu Stil und Format. In der Praxis werden die vier Wege kombiniert.
| Ansatz | Sinnvoll bei | Grenzen |
|---|---|---|
| Alles in den Prompt | Kleine, stabile Bestände unter rund 200.000 Token, etwa ein Handbuch oder eine Richtlinie | Kosten und Antwortzeit steigen mit jeder Anfrage; bei vielen Dokumenten nicht praktikabel |
| RAG | Große, wachsende Textbestände: Wiki, Handbücher, Verträge, Servicefälle | Antwort ist nur so gut wie der Abruf; Pflege von Quellen und Rechten nötig |
| Abfrage über Werkzeuge | Strukturierte und tagesaktuelle Daten: Bestände, Preise, Aufträge, Kennzahlen | Setzt saubere Schnittstellen und Rechte voraus; jede Abfrage muss geprüft freigegeben sein |
| Feinabstimmung | Stil, Format und Fachsprache, die sich selten ändern | Ungeeignet für Faktenwissen, das sich ändert; erneuter Aufwand bei jeder Änderung |
Wo liegen die Grenzen von RAG?
RAG senkt die Zahl frei erfundener Antworten deutlich, garantiert aber keine Richtigkeit.
Stanford RegLab und das Stanford Institute for Human-Centered AI haben im Mai 2024 RAG-gestützte juristische Rechercheprodukte geprüft: Zwei Werkzeuge lagen bei über 17 % fehlerhaften Antworten, eines bei über 34 %. Die Autoren halten ausdrücklich fest, dass auch RAG-Systeme nicht frei von Halluzinationen sind.
Die typischen Ursachen sind selten exotisch:
- Veraltete Quellen. Liegen drei Fassungen einer Richtlinie im Speicher, zitiert die KI irgendeine davon.
- Unpassende Treffer. Findet die Suche nichts Passendes, antwortet das Modell trotzdem, wenn es nicht ausdrücklich zum Widerspruch angehalten wird.
- Schlechte Vorlagen. Schlecht gescannte Seiten, Tabellen ohne Struktur und Bilder ohne Beschriftung liefern kaum verwertbaren Text.
- Fragen, die Zählen und Rechnen verlangen. Wie viele Verträge laufen im vierten Quartal aus? Das beantwortet eine Datenbankabfrage zuverlässig, eine Textsuche nicht.
- Berechtigungen. Ein gemeinsamer Wissensspeicher zeigt allen dieselben Inhalte. Was nicht für alle bestimmt ist, gehört in einen eigenen, eng berechtigten Speicher.
Deshalb gehört zu jedem produktiven Wissensassistenten eine Quellenpflicht und eine Regel für kritische Auskünfte. Welche Hebel darüber hinaus wirken, zeigt unser Leitfaden zu KI-Halluzinationen im Unternehmen.
Welche Anwendungsfälle eignen sich für RAG?
Gut geeignet sind Bereiche, in denen viele Menschen dieselben Fragen an dieselben Dokumente stellen und die Antwort belegbar sein muss.
| Einsatzfeld | Typische Frage | Quellen | Worauf es ankommt |
|---|---|---|---|
| Technischer Service | Was bedeutet Fehlercode 214 bei Baureihe Z? | Handbücher, Serviceanweisungen, gelöste Fälle | Gültige Fassung je Baureihe, alte Stände aussortieren |
| Vertrieb und Angebot | Welche Ausführung passt zu dieser Anforderung? | Datenblätter, Katalog, Referenzprojekte | Preise und Verfügbarkeit besser aus dem System abfragen als aus PDF |
| Personal und Onboarding | Wie beantrage ich Bildungsurlaub? | Betriebsvereinbarungen, Handbuch, Formulare | Mitbestimmung klären, personenbezogene Unterlagen außen vor lassen |
| Qualität und Compliance | Welche Prüfschritte verlangt unsere Verfahrensanweisung? | Managementhandbuch, Normen, Auditberichte | Quellenangabe verpflichtend, Freigabe durch die Fachstelle |
| Einkauf und Verträge | Welche Kündigungsfristen haben wir mit diesem Lieferanten vereinbart? | Rahmenverträge, Nachträge, Korrespondenz | Enger Kreis an Berechtigten, Scans mit guter Texterkennung |
Für die unternehmensweite Suche über viele Systeme hinweg gelten dieselben Prinzipien in größerem Maßstab; der Marktüberblick dazu steht in unserem Beitrag zu Enterprise Search mit KI. Wie weit Ihre Daten überhaupt schon tragen, klärt vorab die KI-Datenstrategie. Aus der Praxis: Beim Plotdesk-Kunden Siblik sind heute mehr als 40.000 Artikel und Produkte über die Plattform durchsuchbar.
Wie führen Sie RAG im Unternehmen ein?
Der Weg zum ersten produktiven Wissensassistenten führt über einen klar abgegrenzten Bereich, nicht über das gesamte Unternehmenswissen. Fünf Schritte haben sich bewährt.
Fünf Schritte zum ersten Wissensassistenten
- Bereich und Fragen festlegen. Sammeln Sie 20 bis 30 echte Fragen aus dem Alltag des Fachbereichs. Sie sind zugleich Zielbild und späterer Testsatz.
- Quellen sichten und bereinigen. Welche Dokumente sind gültig, welche sind Dubletten, welche Entwürfe? Aussortieren ist an dieser Stelle wirksamer als jede technische Feineinstellung.
- Rechte klären. Wer darf welchen Wissensspeicher nutzen? Vertrauliche Unterlagen bekommen einen eigenen Speicher mit engem Zugriff, und der Betriebsrat wird früh eingebunden.
- Mit echten Fragen testen. Lassen Sie den Testsatz gegen das System laufen und bewerten Sie jede Antwort: richtig, unvollständig, falsch belegt, erfunden.
- Pilot, Messung, Ausbau. Erst ein Team, dann die Messung über mehrere Wochen, dann der nächste Wissensbereich. Ein erstes Ergebnis im Betrieb ist erfahrungsgemäß nach rund vier Wochen erreichbar.
Wie messen Sie die Qualität eines RAG-Systems?
Gemessen wird an einem festen Satz von Testfragen mit bekannten richtigen Antworten, der bei jeder Änderung erneut läuft. Vier Kennzahlen reichen für den Anfang:
- Trefferquote im Abruf: Wie oft ist die richtige Fundstelle überhaupt unter den gefundenen Stellen?
- Belegtreue: Wie oft steht die Aussage der Antwort tatsächlich in der genannten Quelle?
- Anteil der Nichtantworten: Wie oft sagt das System, dass die Information fehlt, statt zu raten? Dieser Wert soll nicht null sein.
- Nacharbeit: Wie oft muss die Fachabteilung eine Antwort korrigieren, bevor sie verwendet wird?
Wer diese Messung dauerhaft betreiben will, findet die Werkzeuge und Verfahren dazu in unserem Leitfaden zu AI Observability und LLM-Evaluation. Ein Nebeneffekt ist wichtig: Der Testsatz macht sichtbar, ob eine neue Modellversion Ihre Aufgaben besser oder schlechter löst.
Wie Plotdesk RAG umsetzt
Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand. Für RAG heißt das konkret:
- Silos und Files mit OCR. Wissensspeicher nehmen Dokumentsammlungen auf, auch gescannte Unterlagen werden über Texterkennung lesbar. Die KI durchsucht sie und arbeitet mit den gefundenen Fundstellen.
- Anbindung bestehender Quellen. Über den App-Katalog kommen SharePoint, OneDrive, Google Drive oder Confluence dazu; Confluence wird dabei live über die Schnittstelle abgefragt. Strukturierte Daten kommen über den SQL Connector und externe Datenbanken, lokale Systeme wie Fileserver oder ERP über Plotdesk Connect.
- Instructions als Quellenpflicht. Verhaltensregeln je Organisation oder Team legen fest, dass jede Antwort ihre Quelle nennt und fehlende Information benennt, statt sie zu ergänzen.
- Presets für wiederkehrende Fragen. Vorlagen mit Variablen machen aus einer guten Recherchefrage einen Arbeitsschritt, den das ganze Team gleich nutzt.
- Model Garden. Mehr als 100 Modellvarianten aus zehn Provider-Typen stehen zur Wahl und lassen sich je Team steuern. Für den Abruf und für die Antwort können unterschiedliche Modelle sinnvoll sein.
- Governance und Betrieb. SSO, Rollen und mehr als 40 Berechtigungen steuern den Zugriff, Audit-Logs machen die Nutzung nachvollziehbar. Betrieben wird Plotdesk als dedizierte Instanz in der EU oder im eigenen Tenant, mit DSGVO-konformem Auftragsverarbeitungsvertrag.
Der Weg dorthin folgt vier Schritten: KI-Potenzialanalyse, Proof of Value, produktive Lösung, systematischer Ausbau. Welcher Wissensbereich zuerst an der Reihe ist, ergibt sich aus Ihren Prozessen; als Erfahrungsbasis dienen 1.200+ Use Cases in 15 Branchen.
Der Unterschied zwischen einer netten Demo und einem nützlichen Wissensassistenten liegt fast nie im Modell. Er liegt darin, ob die richtigen Dokumente gepflegt sind, die Rechte stimmen und jemand die Antwortqualität misst.
Häufige Fragen zu RAG
Braucht RAG zwingend eine Vektordatenbank?
Ersetzt ein großes Kontextfenster RAG?
Wie viele Dokumente braucht ein sinnvoller Start?
Sieht die KI auch vertrauliche Dokumente?
Wie aktuell sind die Antworten?
Was kostet der Betrieb eines RAG-Systems?
Fazit: RAG macht internes Wissen nutzbar
RAG ist kein Zauberwerk, sondern eine Arbeitsteilung: Das Modell formuliert, Ihre Dokumente liefern den Inhalt, die Quellenangabe macht die Antwort prüfbar. Der Nutzen entsteht dort, wo viele Menschen dieselben Fragen an dieselben Unterlagen stellen und die Suche heute Zeit kostet.
Der Aufwand liegt weniger in der Technik als in Datenpflege, Rechtekonzept und Qualitätskontrolle. Beginnen Sie mit einem abgegrenzten Wissensbereich, messen Sie Antwortqualität und Zeitersparnis, und weiten Sie erst dann aus.