RAG, kurz für Retrieval Augmented Generation, verbindet ein Sprachmodell in Echtzeit mit verifizierten Datenquellen des eigenen Unternehmens, ohne dass das Modell selbst neu trainiert werden muss. Statt alles Wissen im Modell zu speichern, holt sich das System bei jeder Anfrage die passenden Dokumente und baut die Antwort darauf auf.
Retrieval Augmented Generation verbindet ein Sprachmodell mit den eigenen Dokumenten, ohne es neu zu trainieren. Der Aufbau läuft in zwei Phasen: Dokumente laden und in Abschnitte zerlegen, dann bei jeder Anfrage die passenden Abschnitte heraussuchen und dem Modell als Kontext mitgeben. Jede Antwort bleibt auf eine konkrete Quelle zurückführbar.
Wie Retrieval Augmented Generation in der Praxis funktioniert
Der Aufbau läuft in zwei Phasen ab. In der ersten Phase werden Dokumente geladen und in kleinere Abschnitte zerlegt, ein Vorgang, den Fachleute Chunking nennen (IT-Daily, 03/2026). In der zweiten Phase sucht das System bei jeder Nutzeranfrage die passenden Textabschnitte heraus und reicht sie als zusätzlichen Kontext an das Sprachmodell weiter, das daraus die Antwort formuliert.
Der Begriff klingt technischer, als der Nutzen ist. Ein Mitarbeiter in Industrie und Handel stellt eine Frage in normaler Sprache, etwa zu Lieferantenkonditionen oder einer Maschinenspezifikation, und bekommt eine Antwort mit Verweis auf das zugrunde liegende Dokument. Die Suche in mehreren Ablagesystemen entfällt.
Als Datenquellen dienen PDF-Dateien, Word-Dokumente, interne Wikis, Datenbanken und Schnittstellen zu bestehenden Systemen. Die Qualität dieser Quellen entscheidet direkt über die Qualität der Antworten (IT-Daily, 03/2026). Vor dem eigentlichen Chunking steht deshalb oft die unterschätzte Aufgabe, die Ausgangsdaten zu bereinigen. Doppelte Dokumentversionen, widersprüchliche Preislisten aus unterschiedlichen Jahren oder handschriftliche Notizen in gescannten PDF-Dateien müssen aussortiert oder aufbereitet werden. Dieser Schritt lässt sich selten vollständig automatisieren, er verlangt Fachwissen aus der jeweiligen Abteilung.
Retrieval Augmented Generation oder Feintuning
| Merkmal | RAG | Feintuning |
|---|---|---|
| Was verändert wird | die angebundenen Dokumente | das Modell selbst |
| Neues Wissen verfügbar | sofort | erst nach erneutem Training |
| Aufwand bei Änderungen | Dokument austauschen | Trainingslauf wiederholen |
| Nachvollziehbarkeit | Quelle je Antwort | keine Quellenangabe |
| Passt bei | häufig wechselndem Wissen wie Preislisten, Produktdaten | stabilem Fachvokabular, festem Stil |
Warum Retrieval Augmented Generation als strategische Priorität gilt
Sowohl Gartner als auch Forrester stufen RAG als strategische Priorität für Unternehmen ein, die Sprachmodelle produktiv einsetzen wollen (IT-Daily, 03/2026). Der Grund dafür ist die Nachvollziehbarkeit. RAG lässt jede Antwort auf eine konkrete Quelle zurückführen. Das unterscheidet den Ansatz von einem Modell, das ausschließlich aus seinem Trainingswissen antwortet und dessen Quellen niemand mehr nachvollziehen kann. Für Betriebe mit dokumentationspflichtigen Prozessen, etwa in der Qualitätssicherung, ist diese Nachvollziehbarkeit oft ein härteres Kriterium als die reine Antwortqualität.
kostet der initiale Aufbau eines produktiven RAG-Systems. Die Spanne hängt stark davon ab, wie viele Datenquellen angebunden werden und wie gut diese bereits strukturiert sind.
Pexon Consulting, 03/2026Der Unterschied zwischen guter und schlechter Chunking-Strategie
Falsches Chunking mindert die Präzision der Antworten deutlich (IT-Daily, 03/2026). Wird ein Dokument zu grob in große Abschnitte zerlegt, findet das System die relevante Information nicht mehr genau genug. Wird zu fein zerlegt, geht der Zusammenhang zwischen benachbarten Sätzen verloren. Diese Feinabstimmung ist der Teil der Arbeit, der in Projektplänen am häufigsten unterschätzt wird.
Ein Wartungshandbuch mit nummerierten Sicherheitshinweisen braucht eine andere Chunking-Strategie als ein Fließtext-Vertrag. Wird ein Sicherheitshinweis vom zugehörigen Warnsymbol getrennt, weil die Zerlegung zu grob war, kann das System die Warnung nicht mehr korrekt zuordnen. Wer die Struktur der eigenen Dokumente nicht kennt, überlässt die Chunking-Einstellung dem Zufall.
Die Grenze von RAG: Aktualität der Quellen
In der Praxis heißt das, einen Verantwortlichen je Datenquelle zu benennen, der veraltete Dokumente entfernt oder aktualisiert. Ohne diese Zuständigkeit sammelt sich über Monate ein Bestand aus alten und neuen Versionen desselben Dokuments an, und das System kann nicht mehr zuverlässig unterscheiden, welche Fassung gilt.
Praktische Beispiele, wie eine solche Dokumentensuche im Unternehmen aussieht, zeigt der Beitrag Generative KI in Industrie und Handel.
Erste Datenquelle in vier Wochen anbindenWir starten mit einer einzigen, gut gepflegten Wissensquelle und zeigen an echten Anfragen aus Ihrem Betrieb, ob der Ansatz trägt.
Prototyp besprechenHäufige Fragen
Was unterscheidet Retrieval Augmented Generation von Feintuning?
Feintuning verändert das Modell selbst durch zusätzliches Training, ein aufwendiger und teurer Prozess, der bei jeder Wissensänderung wiederholt werden muss. RAG lässt das Modell unverändert und tauscht stattdessen die angebundenen Dokumente aus. Neues Wissen steht damit sofort zur Verfügung. Für die meisten Unternehmensanwendungen mit häufig wechselndem Wissen ist RAG deshalb der pragmatischere und günstigere Ansatz.
Bleiben die Daten bei RAG im eigenen Haus?
Das hängt vom gewählten Aufbau ab. Bei einem On-Premise-Betrieb bleiben Dokumente und Modell vollständig im eigenen Netzwerk. Bei einer Cloud-Lösung fließen Anfragen und teilweise auch Dokumentenausschnitte an einen externen Anbieter, was bei sensiblen Daten geprüft werden sollte. Details zu Hardware und Kosten eines eigenen Betriebs stehen im Beitrag zu privaten KI-Modellen.
Wie startet man ein RAG-Projekt in vier Wochen?
Ein enger Anwendungsfall mit einer überschaubaren, gut strukturierten Dokumentenmenge lässt sich in zwei bis vier Wochen als Prototyp aufbauen (Pexon Consulting, 03/2026). Der Fehler vieler Projekte liegt darin, gleich mit allen verfügbaren Datenquellen zu starten, statt zuerst mit einer einzigen Quelle zu zeigen, dass der Ansatz funktioniert.
Der nächste Schritt
torck baut RAG-Systeme für Industrie und Handel selbst, von der Chunking-Strategie bis zum Prozess, der die Datenbasis aktuell hält. Mit Teams in Maxhütte-Haidhof, Wien und Rabat übernehmen wir Aufbau und laufenden Betrieb der Systeme. Im Erstgespräch schauen wir uns die eigenen Datenquellen und den passenden Anwendungsfall an. Erstgespräch vereinbaren.