Definition: Agentisches RAG
Agentisches RAG ist eine Form von Retrieval-Augmented Generation, bei der ein autonomer KI-Agent entscheidet, wann er abruft, wonach er sucht und wie viele Abrufschritte eine Antwort benötigt.
Kernmerkmale von agentischem RAG
Agentisches RAG wendet Prinzipien agentischer KI auf den Abrufschritt selbst an: Der Agent legt die Suche in eine Entscheidungsschleife, die er selbst steuert, statt immer zuerst Dokumente zu holen.
- Entscheidet selbst, ob überhaupt ein Abruf nötig ist
- Fragt erneut nach, wenn die ersten Ergebnisse nicht ausreichen
- Zieht Informationen aus mehreren Quellen, nicht nur einem Index
- Prüft, ob die Antwort tatsächlich durch Belege gedeckt ist
Agentisches RAG vs. klassisches RAG
Klassisches RAG führt einen einzigen Ablauf aus Abruf und Generierung aus: Es bettet die Anfrage ein, holt die passendsten Treffer aus einer Vektordatenbank und generiert daraus eine Antwort. Agentisches RAG behandelt den Abruf als eine Option unter mehreren und entscheidet fallweise, ob es ihn nutzt, wiederholt oder mit Tool Calling kombiniert, wodurch mehrstufige Fragen lösbar werden, an denen ein fester Ablauf scheitert.
Bedeutung von agentischem RAG im Enterprise-KI-Umfeld
Unternehmenswissen liegt selten an einem Ort, sodass eine Antwort oft ein Richtliniendokument, einen Datenbankeintrag und einen E-Mail-Verlauf zusammenführen muss. Benchmarks zu Multi-Hop-Fragen zeigen klassisches RAG bei rund 34 % Genauigkeit gegenüber rund 89 % bei agentischem RAG (AgenticRAGTracer, 2026), ein Unterschied, der für Mittelständler mit Wissen verteilt über SharePoint, CRM und ERP entscheidet, ob eine Antwort vertrauenswürdig ist.
Methoden und Verfahren für agentisches RAG
Ein zuverlässiges agentisches RAG-System kombiniert mehrere Kontrollmechanismen, die festlegen, wann und wie der Agent abruft.
Anfrageplanung und Zerlegung
Der Agent zerlegt eine komplexe Frage in Teilanfragen, die er Schritt für Schritt beantwortet, und löst damit Multi-Hop-Fragen, an denen eine einzelne Suche scheitert.
- Klassifiziert, ob überhaupt ein Abruf nötig ist
- Zerlegt zusammengesetzte Fragen in geordnete Teilanfragen
- Leitet jede Teilanfrage an die passende Quelle oder das passende Werkzeug
Iterativer Abruf und Selbstkorrektur
Nach jedem Schritt prüft der Agent, ob die gefundenen Textstellen die Teilanfrage tatsächlich beantworten, und formuliert bei Bedarf neu oder wechselt die Quelle, bis die Beleglage ausreicht oder ein Wiederholungslimit erreicht ist. Zwei Iterationen erfassen meist rund 95 % des Gewinns von fünf, weshalb die meisten Produktivsysteme die Schleife auf zwei bis drei Versuche begrenzen.
Multi-Agenten-Orchestrierung beim Abruf
Größere Einsätze verteilen die Arbeit auf ein Multi-Agenten-System, das plant, abruft und die Antwort verfasst, was jede Aufgabe verengt und Fehler leichter zurückverfolgbar macht.
Wichtige Kennzahlen für agentisches RAG
Teams, die agentisches RAG produktiv betreiben, messen sowohl die Abrufqualität als auch die Kosten dafür, dem Agenten die eigene Suchstrategie zu überlassen.
Abruf-Leistungskennzahlen
- Retrieval Precision@k: über 80 % relevante Treffer unter den Top-Ergebnissen
- Antwort-Fundierung: über 90 % der Aussagen auf Quellen rückführbar
- Durchschnittliche Abruf-Iterationen pro Anfrage: 1,5-3
- Antwortzeit: unter 5 Sekunden für die meisten Produktivfälle
Strategische Geschäftskennzahlen
Über die reine Genauigkeit hinaus soll agentisches RAG die Eskalationsquote an Menschen senken und die Suchzeit der Mitarbeiter über mehrere Systeme hinweg verkürzen. Laut Forrester setzten bis Mitte 2026 rund 75 % der Unternehmensverantwortlichen auf agentische KI-Muster, allerdings hatten nur wenige sie in den täglichen Produktivbetrieb skaliert, genau die Lücke, die diese Kennzahlen schließen sollen.
Qualitäts- und Genauigkeitskennzahlen
Ein gut abgestimmtes System drückt unbelegte oder halluzinierte Antworten deutlich unter die Quote von klassischem RAG auf demselben Dokumentenbestand, überprüft durch regelmäßige Stichproben gegen die Quelldokumente.
Risikofaktoren und Kontrollen bei agentischem RAG
Dem Agenten die Kontrolle über die eigene Abruf-Schleife zu überlassen, bringt Risiken mit sich, die ein fester Ablauf nicht hat.
Außer Kontrolle geratene Abrufschleifen
Ohne Wiederholungslimit kann ein Agent unbegrenzt neu formulieren und abrufen, was Kosten treibt, ohne die Antwort zu verbessern. Explizite Abbruchregeln kontrollieren dies.
- Maximale Anzahl Abruf-Iterationen pro Anfrage
- Konfidenzschwelle, die die Schleife beendet
- Rückfall auf eine direkte Antwort oder Übergabe an einen Menschen
KI-Halluzination trotz Abruf
Abruf verringert Halluzinationen, beseitigt sie aber nicht vollständig, da der Agent Textstellen falsch deuten oder mehr behaupten kann, als die Quellen stützen. Gegenmaßnahmen sind Fundierungsprüfungen gegen den abgerufenen Text sowie Konfidenzbewertungen für unsichere Antworten.
Datenzugriff und regulatorisches Risiko
Weil ein agentisches System auf eigene Initiative mehrere interne Quellen abfragen kann, muss die Zugriffskontrolle auf Ebene des Abrufs greifen, nicht nur auf Anwendungsebene. Nach EU AI Act und DSGVO müssen Unternehmen zeigen können, welche Quellen ein Agent konsultiert hat und warum, weshalb die Protokollierung jedes Abrufschritts eine Grundanforderung ist.
Praxisbeispiel
Ein 150-Mitarbeiter-Hersteller von Industrieanlagen in Baden-Württemberg hatte Servicetechniker, die getrennt in SharePoint-Handbüchern, einer ERP-Ersatzteildatenbank und alten E-Mail-Verläufen nach Antworten auf Reparaturfragen suchten. Ein zunächst getesteter klassischer RAG-Chatbot gab immer dann unvollständige Antworten, wenn eine Frage mehr als ein System betraf. Das Unternehmen setzte daraufhin einen agentischen RAG-Assistenten ein, der seinen Abrufweg über alle drei Quellen selbst plant und automatisch neu nachfragt, wenn die ersten Ergebnisse unvollständig sind. Die durchschnittliche Zeit bis zur Antwort sank von rund 20 Minuten auf unter 3, und Techniker eskalieren deutlich seltener an Senior-Ingenieure.
- Leitet eine Frage automatisch über Handbücher, ERP und E-Mail-Archive
- Fragt erneut nach, wenn der erste Durchlauf unvollständig ist
- Hängt jeder Antwort Quellenangaben an
- Eskaliert an einen menschlichen Experten bei geringer Konfidenz
Aktuelle Entwicklungen und Auswirkungen
Agentisches RAG bewegt sich schnell vom Forschungsprototyp zum Produktivmuster.
Multi-Agenten-Abrufpipelines
Unternehmen verteilen den Abruf zunehmend auf spezialisierte Agenten statt auf einen Generalisten. Gartner erwartet, dass bis 2026 40 % der Unternehmensanwendungen aufgabenspezifische KI-Agenten enthalten, gegenüber unter 5 % im Jahr 2025, und die Abruf-Orchestrierung gehört zu den ersten so delegierten Fähigkeiten.
- Eigene Agenten für Planung, Abruf und Verifikation
- Gemeinsamer Kontext als strukturierter Zustand zwischen Agenten
- Wachsender Einsatz von Reranking zwischen Abruf und Generierung
Benchmarks holen die reale Komplexität auf
Neue Benchmarks wie AgenticRAGTracer prüfen Schlussfolgern über 2 bis 4 Abrufschritte statt einfacher Einzelabfragen. Selbst starke Modelle erreichen auf den schwersten Fällen deutlich unter 25 % exakte Trefferquote, was zeigt, dass agentisches RAG noch Luft hat, bis es einem menschlichen Rechercheur gleichkommt.
Selektiver Einsatz statt Standardlösung
Nicht jede Anfrage profitiert von einer agentischen Schleife, da einfache Faktenfragen mit klassischem RAG oft schneller beantwortet sind. Produktivsysteme leiten zunehmend nur mehrdeutige oder mehrstufige Fragen in den agentischen Pfad, während der Rest auf einer günstigeren, festen Pipeline bleibt.
Fazit
Agentisches RAG macht aus dem Abruf keinen festen Schritt mehr, sondern eine Entscheidung, die der Agent selbst trifft, und schließt damit einen Großteil der Genauigkeitslücke, die starre Pipelines bei komplexen Fragen offenlassen. Es kostet pro Anfrage mehr an Latenz und Rechenleistung, weshalb die meisten Einsätze es wirklich mehrdeutigen oder mehrstufigen Anfragen vorbehalten. Je mehr interne Quellen Mittelständler gleichzeitig anbinden, desto wichtiger wird die Entscheidung, wie oft gesucht wird, neben dem Abruf selbst. Agentisches RAG dürfte zur Standardarchitektur werden, wo immer Unternehmenswissen über mehr als ein System verteilt ist.
Häufig gestellte Fragen
Was unterscheidet agentisches RAG von klassischem RAG?
Klassisches RAG ruft einmal ab und antwortet aus dem, was zurückkommt. Agentisches RAG lässt den Agenten entscheiden, ob er abruft, die Anfrage neu formuliert oder erneut abruft, je nachdem, ob die Beleglage ausreicht.
Lohnt sich agentisches RAG für ein Unternehmen mit unter 200 Mitarbeitern?
Ja, sobald Wissen über mehr als ein System verteilt ist, etwa SharePoint, ein ERP und ein CRM. Bei einer einzigen gut strukturierten Wissensbasis ist klassisches RAG meist günstiger und schnell genug.
Wie passt agentisches RAG zur DSGVO und zum EU AI Act?
Jeder Abrufschritt kann protokolliert werden, einschließlich welche Quelle wann und warum abgefragt wurde, was die Transparenzpflichten aus EU AI Act und DSGVO unterstützt. Die Zugriffskontrolle greift auf Ebene des Abrufs, sodass der Agent nur Quellen erreicht, für die ein Nutzer berechtigt ist.
Was kostet eine agentische RAG-Einführung typischerweise?
Die Kosten hängen vor allem von der Zahl der Abruf-Iterationen pro Anfrage und der Anzahl angebundener Systeme ab. Die meisten Mittelstandsprojekte starten mit einem begrenzten Pilot auf zwei bis drei Quellen, bevor sie erweitert werden.
Brauchen wir dafür ein eigenes Data-Science-Team?
Nein. Die meisten mittelständischen Unternehmen setzen einen externen Partner ein, der die Abruf-Agenten und Leitplanken konfiguriert, während interne Mitarbeiter festlegen, welche Systeme angebunden werden.
Gibt es Förderung für agentische RAG-Projekte im Mittelstand?
Regionale Digitalisierungs- und KI-Förderprogramme sowie KfW-Digitalisierungskredite können Teile eines Pilotprojekts abdecken, abhängig von Unternehmensgröße und Region, weshalb sich eine Nachfrage bei der zuständigen Landesförderbank oder IHK vorab lohnt.