Technologie

Retrieval Augmented Generation (RAG): So nutzt KI Ihr Firmenwissen

Retrieval Augmented Generation lässt die KI erst in Ihren Dokumenten suchen und dann mit Quellenangabe antworten. Der Leitfaden erklärt Aufbau, Stand 2026, Grenzen und Qualitätsmessung und zeigt den Weg zum ersten Wissensassistenten.

Niklas Coors
Niklas Coors Geschäftsführer, Plotdesk
Veröffentlicht
Lesezeit
12 Min.
Retrieval Augmented Generation (RAG): So nutzt KI Ihr Firmenwissen

Die meisten Fragen im Arbeitsalltag drehen sich um internes Wissen: Welche Gewährleistung gilt für die Baureihe aus dem Vorjahr, was steht im Rahmenvertrag mit Lieferant Y, wer muss eine Preisausnahme freigeben? Ein Sprachmodell allein kennt diese Antworten nicht, denn Ihre Verträge, Handbücher und Richtlinien waren nie Teil seines Trainings. Retrieval Augmented Generation (RAG) schließt diese Lücke.

Die KI sucht vor jeder Antwort passende Stellen in Ihren Dokumenten und formuliert die Antwort auf dieser Grundlage, mit Angabe der Fundstelle. Dieser Leitfaden erklärt das Verfahren, zeigt den technischen Stand im September 2026, benennt die Grenzen und beschreibt, wie der erste Wissensassistent im Unternehmen entsteht.

Das Wichtigste in Kürze

  • Retrieval Augmented Generation heißt: erst suchen, dann antworten. Das Sprachmodell bekommt vor der Antwort passende Textstellen aus Ihren eigenen Quellen. Der Begriff stammt aus einer Arbeit von Patrick Lewis und Kollegen bei Facebook AI Research aus dem Jahr 2020.
  • RAG senkt Fehlantworten, es verhindert sie nicht. Eine Untersuchung von Stanford RegLab und HAI (Mai 2024) fand bei RAG-gestützten Rechtsrecherche-Werkzeugen über 17 % beziehungsweise über 34 % fehlerhafte Antworten.
  • Der heutige Stand der Technik heißt Hybrid-Suche und Reranking. Anthropic misst für Kontextanreicherung plus Stichwortsuche und Reranking 67 % weniger fehlgeschlagene Abrufe als bei einfacher Vektorsuche (September 2024).
  • Kleine Wissensbestände brauchen kein RAG. Unter rund 200.000 Token, also etwa 500 Seiten, passt der gesamte Bestand in das Kontextfenster aktueller Modelle. RAG lohnt sich bei großen und wachsenden Beständen.
  • Der Aufwand liegt selten in der Technik. Entscheidend sind Datenpflege, ein sauberes Rechtekonzept und die laufende Messung der Antwortqualität.

Was ist Retrieval Augmented Generation (RAG)?

Retrieval Augmented Generation ist ein Verfahren, bei dem ein Sprachmodell vor der Antwort passende Textstellen aus einer eigenen Wissensquelle abruft (Retrieval) und die Antwort auf diese Stellen stützt (Generation). Beschrieben wurde es 2020 von Patrick Lewis und Kollegen bei Facebook AI Research in der Arbeit Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.

Der Nutzen ergibt sich aus einer einfachen Arbeitsteilung. Das Sprachmodell bringt Sprachverständnis mit und kennt öffentliches Wissen bis zu seinem Trainingsstand; bei aktuellen Modellen liegt dieser Stand im Jahr 2026 (Anthropic nennt für Claude Opus 5 den Mai 2026). Ihr internes Wissen steht dagegen nur in Ihren Systemen. RAG bringt beides in einer Antwort zusammen.

RAG ist kein Training. Beim Feinabstimmen (Fine-Tuning) verändern Sie das Modell selbst, was Aufwand, Daten und Wiederholung bei jeder Änderung bedeutet. Bei RAG bleibt das Modell unverändert, Sie tauschen die Dokumente aus. Genau deshalb lässt sich eine geänderte Richtlinie am selben Tag berücksichtigen.

Frage aus dem Alltag Sprachmodell ohne Anbindung Sprachmodell mit RAG
Wie lange gilt die Gewährleistung für Produkt X? Allgemeine Aussage zum Gesetz oder ein Hinweis, dass die Information fehlt. Antwort aus Ihren Verkaufsbedingungen, mit Dateiname und Fundstelle.
Welche Schritte gelten bei einer Reklamation? Branchenüblicher Ablauf, der zu Ihrem Prozess passen kann oder auch nicht. Ihr Prozess aus der internen Arbeitsanweisung, in der gültigen Fassung.
Was haben wir mit Lieferant Y zur Zahlungsfrist vereinbart? Keine belastbare Antwort möglich. Antwort aus dem Rahmenvertrag, sofern der Vertrag im Wissensspeicher liegt.

Wie funktioniert RAG? Vom Dokument zur belegten Antwort

RAG läuft in zwei Phasen: einmalig die Aufbereitung der Quellen, danach bei jeder Frage der Abruf. Fünf Schritte beschreiben den Weg vom Dokument zur belegten Antwort.

  1. 1

    Quellen aufbereiten

    Aus PDF, Office-Dateien, Wiki-Seiten oder Scans wird Text. Gescannte Dokumente brauchen Texterkennung (OCR). Gleichzeitig entstehen Metadaten wie Titel, Bereich, Gültigkeit und Vertraulichkeit, nach denen später gefiltert wird.

  2. 2

    In Abschnitte zerlegen

    Lange Dokumente werden in Abschnitte geteilt, die für sich verständlich bleiben. Bewährt hat sich, jedem Abschnitt seinen Kontext mitzugeben: Aus welchem Dokument, aus welchem Kapitel, für welchen Zeitraum stammt er.

  3. 3

    Indexieren

    Jeder Abschnitt wird sowohl für die Stichwortsuche als auch als Vektor für die Bedeutungssuche abgelegt. Die Vektorsuche findet sinnverwandte Formulierungen, die Stichwortsuche exakte Artikelnummern, Normen und Eigennamen.

  4. 4

    Abrufen und sortieren

    Zu jeder Frage werden Kandidaten aus beiden Indizes geholt, über Metadaten gefiltert und anschließend neu sortiert (Reranking). Erst die besten Treffer gehen weiter an das Modell.

  5. 5

    Antworten mit Beleg

    Die Fundstellen kommen zusammen mit der Frage in den Prompt. Eine feste Anweisung legt fest, dass die Antwort nur auf diesen Stellen beruht, die Quelle nennt und bei fehlender Information ausdrücklich sagt, dass sie fehlt.

Vernetzte Wissensdatenbank als Sinnbild für Retrieval Augmented Generation: Dokumente werden indexiert und für die KI durchsuchbar
Bei RAG bleibt das Modell unverändert. Gepflegt wird der Wissensspeicher dahinter.

RAG 2026: Was sich seit den ersten Systemen geändert hat

Aktuelle RAG-Systeme kombinieren Stichwort- und Vektorsuche, geben Abschnitten ihren Kontext mit, sortieren Treffer neu und messen die Qualität laufend. Die frühen Aufbauten von 2023 und 2024 arbeiteten dagegen mit starren Textblöcken, reiner Vektorsuche und einer festen Zahl von Treffern.

Der Unterschied ist messbar, denn die Qualität des Abrufs bestimmt die Qualität der Antwort. Anthropic berichtet für die Kombination aus angereicherten Abschnitten, Stichwortsuche und Reranking 67 % weniger fehlgeschlagene Abrufe gegenüber einfacher Vektorsuche (Stand September 2024).

Baustein Frühe Systeme Stand September 2026
Zerlegung Feste Blockgröße, ohne Rücksicht auf Kapitelgrenzen Abschnitte entlang der Struktur, jeweils mit Kontext und Metadaten
Suche Nur Vektorähnlichkeit Hybrid aus Stichwort- und Vektorsuche, dazu Filter nach Bereich und Gültigkeit
Auswahl Feste Zahl von Treffern, unsortiert Reranking nach Passung, wenige, aber sehr gute Stellen
Kontextfenster Eng, jeder Treffer kostete Platz Bis zu 1 Million Token bei aktuellen Modellen, kleine Bestände passen komplett hinein
Abruf Eine Suche je Frage Das Modell sucht mehrfach und über Werkzeuge, bis die Frage beantwortet ist
Qualität Nach Gefühl beurteilt Feste Testfragen, Kennzahlen für Treffer und Belegtreue

Der wichtigste Wandel ist der letzte Punkt in der Tabelle. Statt einer einzigen Suche je Frage bekommt das Modell Werkzeuge und ruft sie so oft auf, wie es nötig ist: Wissensspeicher durchsuchen, eine Datenbank abfragen, ein Ticketsystem lesen. Standardisiert wird diese Anbindung über das Model Context Protocol. Wie viel Platz dabei überhaupt zur Verfügung steht, erklärt unser Beitrag zum Kontextfenster.

RAG, langes Kontextfenster oder Feinabstimmung: Was passt wann?

RAG passt zu großen, wachsenden Textbeständen, das lange Kontextfenster zu kleinen und stabilen, die Abfrage über Werkzeuge zu strukturierten Daten und die Feinabstimmung zu Stil und Format. In der Praxis werden die vier Wege kombiniert.

Ansatz Sinnvoll bei Grenzen
Alles in den Prompt Kleine, stabile Bestände unter rund 200.000 Token, etwa ein Handbuch oder eine Richtlinie Kosten und Antwortzeit steigen mit jeder Anfrage; bei vielen Dokumenten nicht praktikabel
RAG Große, wachsende Textbestände: Wiki, Handbücher, Verträge, Servicefälle Antwort ist nur so gut wie der Abruf; Pflege von Quellen und Rechten nötig
Abfrage über Werkzeuge Strukturierte und tagesaktuelle Daten: Bestände, Preise, Aufträge, Kennzahlen Setzt saubere Schnittstellen und Rechte voraus; jede Abfrage muss geprüft freigegeben sein
Feinabstimmung Stil, Format und Fachsprache, die sich selten ändern Ungeeignet für Faktenwissen, das sich ändert; erneuter Aufwand bei jeder Änderung

Wo liegen die Grenzen von RAG?

RAG senkt die Zahl frei erfundener Antworten deutlich, garantiert aber keine Richtigkeit.

Stanford RegLab und das Stanford Institute for Human-Centered AI haben im Mai 2024 RAG-gestützte juristische Rechercheprodukte geprüft: Zwei Werkzeuge lagen bei über 17 % fehlerhaften Antworten, eines bei über 34 %. Die Autoren halten ausdrücklich fest, dass auch RAG-Systeme nicht frei von Halluzinationen sind.

Die typischen Ursachen sind selten exotisch:

  • Veraltete Quellen. Liegen drei Fassungen einer Richtlinie im Speicher, zitiert die KI irgendeine davon.
  • Unpassende Treffer. Findet die Suche nichts Passendes, antwortet das Modell trotzdem, wenn es nicht ausdrücklich zum Widerspruch angehalten wird.
  • Schlechte Vorlagen. Schlecht gescannte Seiten, Tabellen ohne Struktur und Bilder ohne Beschriftung liefern kaum verwertbaren Text.
  • Fragen, die Zählen und Rechnen verlangen. Wie viele Verträge laufen im vierten Quartal aus? Das beantwortet eine Datenbankabfrage zuverlässig, eine Textsuche nicht.
  • Berechtigungen. Ein gemeinsamer Wissensspeicher zeigt allen dieselben Inhalte. Was nicht für alle bestimmt ist, gehört in einen eigenen, eng berechtigten Speicher.

Deshalb gehört zu jedem produktiven Wissensassistenten eine Quellenpflicht und eine Regel für kritische Auskünfte. Welche Hebel darüber hinaus wirken, zeigt unser Leitfaden zu KI-Halluzinationen im Unternehmen.

Welche Anwendungsfälle eignen sich für RAG?

Gut geeignet sind Bereiche, in denen viele Menschen dieselben Fragen an dieselben Dokumente stellen und die Antwort belegbar sein muss.

Einsatzfeld Typische Frage Quellen Worauf es ankommt
Technischer Service Was bedeutet Fehlercode 214 bei Baureihe Z? Handbücher, Serviceanweisungen, gelöste Fälle Gültige Fassung je Baureihe, alte Stände aussortieren
Vertrieb und Angebot Welche Ausführung passt zu dieser Anforderung? Datenblätter, Katalog, Referenzprojekte Preise und Verfügbarkeit besser aus dem System abfragen als aus PDF
Personal und Onboarding Wie beantrage ich Bildungsurlaub? Betriebsvereinbarungen, Handbuch, Formulare Mitbestimmung klären, personenbezogene Unterlagen außen vor lassen
Qualität und Compliance Welche Prüfschritte verlangt unsere Verfahrensanweisung? Managementhandbuch, Normen, Auditberichte Quellenangabe verpflichtend, Freigabe durch die Fachstelle
Einkauf und Verträge Welche Kündigungsfristen haben wir mit diesem Lieferanten vereinbart? Rahmenverträge, Nachträge, Korrespondenz Enger Kreis an Berechtigten, Scans mit guter Texterkennung

Für die unternehmensweite Suche über viele Systeme hinweg gelten dieselben Prinzipien in größerem Maßstab; der Marktüberblick dazu steht in unserem Beitrag zu Enterprise Search mit KI. Wie weit Ihre Daten überhaupt schon tragen, klärt vorab die KI-Datenstrategie. Aus der Praxis: Beim Plotdesk-Kunden Siblik sind heute mehr als 40.000 Artikel und Produkte über die Plattform durchsuchbar.

Wie führen Sie RAG im Unternehmen ein?

Der Weg zum ersten produktiven Wissensassistenten führt über einen klar abgegrenzten Bereich, nicht über das gesamte Unternehmenswissen. Fünf Schritte haben sich bewährt.

Fünf Schritte zum ersten Wissensassistenten

  • Bereich und Fragen festlegen. Sammeln Sie 20 bis 30 echte Fragen aus dem Alltag des Fachbereichs. Sie sind zugleich Zielbild und späterer Testsatz.
  • Quellen sichten und bereinigen. Welche Dokumente sind gültig, welche sind Dubletten, welche Entwürfe? Aussortieren ist an dieser Stelle wirksamer als jede technische Feineinstellung.
  • Rechte klären. Wer darf welchen Wissensspeicher nutzen? Vertrauliche Unterlagen bekommen einen eigenen Speicher mit engem Zugriff, und der Betriebsrat wird früh eingebunden.
  • Mit echten Fragen testen. Lassen Sie den Testsatz gegen das System laufen und bewerten Sie jede Antwort: richtig, unvollständig, falsch belegt, erfunden.
  • Pilot, Messung, Ausbau. Erst ein Team, dann die Messung über mehrere Wochen, dann der nächste Wissensbereich. Ein erstes Ergebnis im Betrieb ist erfahrungsgemäß nach rund vier Wochen erreichbar.

Wie messen Sie die Qualität eines RAG-Systems?

Gemessen wird an einem festen Satz von Testfragen mit bekannten richtigen Antworten, der bei jeder Änderung erneut läuft. Vier Kennzahlen reichen für den Anfang:

  • Trefferquote im Abruf: Wie oft ist die richtige Fundstelle überhaupt unter den gefundenen Stellen?
  • Belegtreue: Wie oft steht die Aussage der Antwort tatsächlich in der genannten Quelle?
  • Anteil der Nichtantworten: Wie oft sagt das System, dass die Information fehlt, statt zu raten? Dieser Wert soll nicht null sein.
  • Nacharbeit: Wie oft muss die Fachabteilung eine Antwort korrigieren, bevor sie verwendet wird?

Wer diese Messung dauerhaft betreiben will, findet die Werkzeuge und Verfahren dazu in unserem Leitfaden zu AI Observability und LLM-Evaluation. Ein Nebeneffekt ist wichtig: Der Testsatz macht sichtbar, ob eine neue Modellversion Ihre Aufgaben besser oder schlechter löst.

Wie Plotdesk RAG umsetzt

Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand. Für RAG heißt das konkret:

  • Silos und Files mit OCR. Wissensspeicher nehmen Dokumentsammlungen auf, auch gescannte Unterlagen werden über Texterkennung lesbar. Die KI durchsucht sie und arbeitet mit den gefundenen Fundstellen.
  • Anbindung bestehender Quellen. Über den App-Katalog kommen SharePoint, OneDrive, Google Drive oder Confluence dazu; Confluence wird dabei live über die Schnittstelle abgefragt. Strukturierte Daten kommen über den SQL Connector und externe Datenbanken, lokale Systeme wie Fileserver oder ERP über Plotdesk Connect.
  • Instructions als Quellenpflicht. Verhaltensregeln je Organisation oder Team legen fest, dass jede Antwort ihre Quelle nennt und fehlende Information benennt, statt sie zu ergänzen.
  • Presets für wiederkehrende Fragen. Vorlagen mit Variablen machen aus einer guten Recherchefrage einen Arbeitsschritt, den das ganze Team gleich nutzt.
  • Model Garden. Mehr als 100 Modellvarianten aus zehn Provider-Typen stehen zur Wahl und lassen sich je Team steuern. Für den Abruf und für die Antwort können unterschiedliche Modelle sinnvoll sein.
  • Governance und Betrieb. SSO, Rollen und mehr als 40 Berechtigungen steuern den Zugriff, Audit-Logs machen die Nutzung nachvollziehbar. Betrieben wird Plotdesk als dedizierte Instanz in der EU oder im eigenen Tenant, mit DSGVO-konformem Auftragsverarbeitungsvertrag.

Der Weg dorthin folgt vier Schritten: KI-Potenzialanalyse, Proof of Value, produktive Lösung, systematischer Ausbau. Welcher Wissensbereich zuerst an der Reihe ist, ergibt sich aus Ihren Prozessen; als Erfahrungsbasis dienen 1.200+ Use Cases in 15 Branchen.

Der Unterschied zwischen einer netten Demo und einem nützlichen Wissensassistenten liegt fast nie im Modell. Er liegt darin, ob die richtigen Dokumente gepflegt sind, die Rechte stimmen und jemand die Antwortqualität misst.
Niklas Coors
Niklas Coors Geschäftsführer, Plotdesk

Häufige Fragen zu RAG

Braucht RAG zwingend eine Vektordatenbank?

Nein. Für kleine Bestände reicht eine gute Stichwortsuche, für sehr kleine Bestände passt der gesamte Text in das Kontextfenster. Eine Vektorsuche lohnt sich, sobald Nutzer anders formulieren als die Dokumente. In der Praxis liefert die Kombination aus Stichwort- und Vektorsuche die stabilsten Ergebnisse.

Ersetzt ein großes Kontextfenster RAG?

Nur bei kleinen Beständen. Unter rund 200.000 Token, also etwa 500 Seiten, können Sie alles direkt in den Prompt geben. Darüber wird es teuer und langsam, weil jede Anfrage den gesamten Text mitträgt.

Wie viele Dokumente braucht ein sinnvoller Start?

Entscheidend ist nicht die Menge, sondern die Abdeckung der häufigsten Fragen. Ein gepflegtes Handbuch mit 200 Seiten trägt einen produktiven Assistenten, 10.000 ungeprüfte Dateien oft nicht. Beginnen Sie mit den Quellen, die Ihre Fachleute selbst als verbindlich bezeichnen.

Sieht die KI auch vertrauliche Dokumente?

Nur, wenn sie in einem Wissensspeicher liegen, auf den die fragende Person Zugriff hat. Steuern Sie den Zugriff über Teams, Rollen und Berechtigungen und prüfen Sie vor dem Indexieren, welche Unterlagen in einen gemeinsamen Speicher gehören. Für vertrauliche Bestände ist ein eigener Speicher mit engem Kreis der Berechtigten der sichere Weg.

Wie aktuell sind die Antworten?

So aktuell wie der Index. Angebundene Quellen werden in festen Abständen übernommen, hochgeladene Dateien beim Einstellen indexiert. Legen Sie je Wissensbereich fest, wie aktuell er sein muss, und sortieren Sie alte Fassungen konsequent aus.

Was kostet der Betrieb eines RAG-Systems?

Kosten entstehen an drei Stellen: einmalig für Aufbereitung und Indexierung, laufend für Speicherung und für die Token je Anfrage, dauerhaft für die Pflege der Quellen. Die Token-Kosten lassen sich über Modellwahl und Trefferzahl steuern, die Pflege über klare Zuständigkeiten je Wissensbereich.

Fazit: RAG macht internes Wissen nutzbar

RAG ist kein Zauberwerk, sondern eine Arbeitsteilung: Das Modell formuliert, Ihre Dokumente liefern den Inhalt, die Quellenangabe macht die Antwort prüfbar. Der Nutzen entsteht dort, wo viele Menschen dieselben Fragen an dieselben Unterlagen stellen und die Suche heute Zeit kostet.

Der Aufwand liegt weniger in der Technik als in Datenpflege, Rechtekonzept und Qualitätskontrolle. Beginnen Sie mit einem abgegrenzten Wissensbereich, messen Sie Antwortqualität und Zeitersparnis, und weiten Sie erst dann aus.

Zuletzt redaktionell überarbeitet am

Nächster Schritt

Finden wir den Prozess, der sich für Sie rechnet.

In der persönlichen KI-Potenzialanalyse prüfen wir Ihre Ausgangslage und entwickeln eine konkrete Hypothese für den schnellsten wirtschaftlichen Hebel. Von der ersten Idee bis zur Lösung im Betrieb.

Persönlich sprechen
  • 1.200+Use Cases in 15 Branchen
  • 4 Wochenbis zum ersten Ergebnis im Betrieb
  • DediziertIhre Instanz in der EU oder in Ihrem eigenen Tenant

Die Expertise und Kreativität haben zu einer Lösung geführt, die unternehmensweit großen Anklang findet. Paul Töws, AI Hub Lead, Melitta

Persönliche Einschätzung

Wo liegt Ihr größter KI-Hebel?

Vier kurze Fragen zu Ihrem Unternehmen. Wir prüfen Ihre Angaben persönlich und melden uns mit einer ersten Einschätzung.

Persönliche Analyse

Wo liegt Ihr größter KI-Hebel?

Vier kurze Fragen zu Ihrem Unternehmen. Wir prüfen Ihre Angaben persönlich und bereiten eine erste Einschätzung vor.

Niklas CoorsGeschäftsführer · Strategie

Schritt 1 von 5
In welcher Branche arbeitet Ihr Unternehmen?

Damit ordnen wir passende Referenzen und Use Cases zu.

Wie groß ist Ihr Unternehmen?

So können wir einschätzen, was zu Ihrem Unternehmen und Ihren Teams passt.

Wo stehen Sie heute mit KI?

Welche Aussage beschreibt Ihren Arbeitsalltag am besten?

Welcher Hebel hat gerade höchste Priorität?

Wählen Sie den Bereich, in dem ein Ergebnis am meisten bewegen würde.

Wie dürfen wir Sie erreichen?

Wir prüfen, wo KI in Ihrem Unternehmen konkret helfen kann, und melden uns persönlich mit einer ersten Einschätzung.