Enterprise RAG

RAG-Architektur für Unternehmen: vom Dokument zur belegten Antwort

Wie beantwortet eine KI Fragen aus Ihren Unternehmensdaten? Diese Referenzarchitektur zeigt den Weg vom Dokument über die Suche bis zur Antwort mit Quellen. Das Diagramm und die Umsetzungsschritte erklären, wie Datenaufnahme, Berechtigungen und ein kontrollierter Lesezugriff zusammenspielen.

Was ist eine RAG Architektur?

Eine RAG Architektur beschreibt den technischen Aufbau, mit dem ein KI-System Antworten aus geprüften Unternehmensquellen ableitet, statt ausschließlich aus Modellwissen zu generieren.

Im Kern verbindet Retrieval Augmented Generation eine kontrollierte Dokumentenaufnahme, einen zentralen Knowledge Store, einen semantischen Suchindex und eine Retrieval-Schicht für Anwendungen, Chatbots oder Agenten. Für Enterprise-Anwendungen reicht eine Vektordatenbank allein nicht aus: Versionierung, Quellenangaben, Berechtigungen, Reindex-Jobs und ein read-only Zugriffspfad müssen als Architekturentscheidungen geplant werden.

Fragestellung
RAG Architektur für Unternehmen verstehen
Zielsystem
sichere KI Wissensdatenbanken mit Quellen und Berechtigungen
Kernprinzip
Ingestion schreibt, Retrieval liest, Agenten ändern keine Wissensbasis
Enterprise-RAG-Architekturdiagramm mit deterministischer Ingestion, Knowledge Store, Retrieval-Schicht, Agent Clients, Modellruntime und Cloud-Fundament

Agenten haben keinen direkten Schreibzugriff auf Datenbank oder Objektspeicher.

Diagramm in neuem Tab öffnen

Komponenten einer Enterprise RAG Architektur

Das Diagramm verdichtet die Architektur visuell. Für Entscheider, Fachbereiche und technische Teams ist die gleiche Struktur hier zusätzlich als klarer Architekturüberblick beschrieben.

1

Quellen und Admin-Ebene

Die Architektur startet bei PDFs, Bildern, Textdateien, Markdown und kontrollierten Upload- oder Bucket-Sync-Prozessen. Entscheidend ist, dass Quellen eindeutig identifizierbar bleiben.

2

Ingestion Worker

Der Worker extrahiert Text und Seitenbilder, normalisiert Inhalte, bildet Chunks, erzeugt Hashes, erstellt Embeddings und stößt kontrollierte Reindex-Jobs an.

3

Knowledge Store

Objektspeicher und PostgreSQL mit pgvector halten Originaldateien, Previews, Metadaten, Dokumentversionen, Chunks, Embeddings und Zugriffsinformationen zusammen.

4

Retrieval Layer

Eine RAG API und ein MCP Server stellen semantische Suche, Dokument-Lookups, Chunk-Kontext, Quellenangaben, Filter und Berechtigungen bereit.

5

Agent Clients und Modellruntime

Clients wie Codex, Claude oder Open Harness greifen nur auf read-only Tools zu. Modelle können self-hosted oder als Cloud LLM betrieben werden, ohne direkten Datenbankzugriff zu erhalten.

6

Betrieb und Compliance

Kubernetes, starkAI Cloud, DSGVO-Konformität, EU AI Act Readiness und ISO-27001-nahe Kontrollen gehören zum Betriebsmodell, nicht zu einer späteren Zusatzschicht.

Warum diese Struktur trägt

Die Architektur trennt Aufnahme, Speicherung, Retrieval und Modellnutzung bewusst. Dadurch bleiben Quellen nachvollziehbar, Berechtigungen prüfbar und Agenten im produktiven Betrieb kontrollierbar.

Deterministische Ingestion

PDFs, Bilder und Markdown werden normalisiert, gehasht, versioniert und wiederholbar indexiert. Reindex-Jobs sind kontrolliert statt implizit.

Zentraler Knowledge Store

Originaldateien, Previews, Metadaten, Dokumentversionen, Chunks und Embeddings bleiben in einer klaren Speicher- und Indexschicht zusammengeführt.

Read-only Retrieval

Agenten greifen über RAG API und MCP Tools zu. Direkte Schreibrechte auf Datenbank oder Storage sind nicht Teil des Client-Pfads.

Wie prüfen Sie die Qualität einer RAG-Lösung?

Sammeln Sie typische Fragen, erwartete Antworten und passende Quellen aus Ihrem Fachbereich. Prüfen Sie die Suche und die fertige Antwort getrennt: Eine flüssige Antwort allein ist kein Qualitätsnachweis.

Findet die Suche die passende Quelle?

Vergleichen Sie die gefundenen Fundstellen mit zuvor ausgewählten, freigegebenen Referenzdokumenten. Halten Sie fest, welche relevanten Informationen fehlen oder durch unpassende Treffer verdrängt werden.

Ist die Antwort durch die Quelle gedeckt?

Prüfen Sie sachliche Richtigkeit, Vollständigkeit und Belege. Auch bei einem passenden Suchtreffer darf die Antwort keine zusätzlichen Fakten erfinden oder entscheidende Einschränkungen auslassen.

Vier Prüffälle für den Piloten

Beispiele für eine Abnahme, keine gemessenen Ergebnisse.

Die Antwort steht in einer freigegebenen Quelle
Testfall
Eine Frage zur aktuellen Reisekostenrichtlinie und die passende freigegebene Textstelle liegen vor.
Erwartetes Verhalten
Die Suche findet diese Textstelle. Die Antwort gibt ihren Inhalt korrekt wieder und nennt die passende Quelle und Version.
Die Quellen enthalten keine Antwort
Testfall
Gefragt wird nach dem Reisebudget des nächsten Jahres. Keine freigegebene Quelle nennt diesen Betrag.
Erwartetes Verhalten
Das System macht die fehlende Grundlage sichtbar und nennt keinen erfundenen Betrag. Ein plausibel klingender Text gilt hier als Fehler.
Eine Richtlinie wurde ersetzt
Testfall
Eine alte und eine aktuelle Richtlinie enthalten unterschiedliche Regeln. Die alte Fassung ist nicht mehr gültig.
Erwartetes Verhalten
Die Antwort verwendet die gültige Fassung. Prüfen Sie nach einer Änderung auch, ob veraltete oder gelöschte Inhalte noch gefunden werden.
Eine Quelle ist für die Rolle gesperrt
Testfall
Dieselbe Frage wird mit einer berechtigten und einer unberechtigten Testrolle gestellt.
Erwartetes Verhalten
Die unberechtigte Rolle erhält weder geschützte Inhalte noch verräterische Quellenangaben. Wiederholen Sie den Test nach einem Rechteentzug.

Vereinbaren Sie mit dem Fachbereich vorab die Abnahmegrenzen. Dokumentieren Sie je Testfall Quelle, Suchergebnis, Antwort und offene Fehler sowie Antwortzeit und Betriebsaufwand. Wiederholen Sie die Tests nach Änderungen an Quellen, Suche oder Modell.

Methodische Vertiefung: Haystack: Evaluation · Microsoft: RAG design and evaluation

Wann lohnt sich diese RAG Architektur?

Eine Enterprise RAG Architektur lohnt sich, wenn Wissen nicht nur durchsucht, sondern prüfbar, wiederholbar und mit klaren Verantwortlichkeiten genutzt werden soll.

Interne Wissensdatenbanken

Mitarbeitende sollen Richtlinien, Projektdokumente, Handbücher oder Prozesswissen per Suche und Chat finden, ohne die Quelle aus den Augen zu verlieren.

Dokumentenintensive Prozesse

Verträge, Rechnungen, Frachtpapiere, technische Spezifikationen oder Angebotsunterlagen sollen strukturiert aufgenommen und wiederverwendbar gemacht werden.

Agenten mit kontrolliertem Zugriff

KI-Agenten sollen Wissen nutzen, aber keine Datenbank- oder Storage-Schreibrechte besitzen. Retrieval wird zur kontrollierten Schnittstelle zwischen Agent und Wissen.

Regulierte Organisationen

Wenn Datenschutz, Auditierbarkeit, Mandantenfähigkeit, Quellenbelege und Versionshistorie relevant sind, muss die RAG Architektur diese Anforderungen von Beginn an tragen.

Häufige Fragen zur RAG Architektur

Diese Antworten decken typische Fragen ab, die vor dem Aufbau eines Enterprise RAG Systems geklärt werden sollten.

Was ist der Unterschied zwischen RAG und einer Vektordatenbank?

Eine Vektordatenbank ist nur ein Baustein. Eine RAG Architektur umfasst zusätzlich Ingestion, Chunking, Metadaten, Berechtigungen, Quellenangaben, Retrieval-APIs, MCP Tools, Modellzugriff und Betriebsprozesse.

Warum ist deterministische Ingestion wichtig?

Deterministische Ingestion sorgt dafür, dass Dokumente bei wiederholter Verarbeitung nachvollziehbar versioniert, gehasht und indexiert werden. Das ist entscheidend für Audits, Fehlersuche und verlässliche Aktualisierungen.

Welche Rolle spielt MCP in einer RAG Architektur?

MCP stellt agentenfähige Tools bereit, zum Beispiel semantische Suche, Dokument-Lookup oder Chunk-Kontext. Dadurch können Agent Clients Wissen nutzen, ohne direkten Zugriff auf Datenbank oder Objektspeicher zu erhalten.

Welche Daten gehören in den Knowledge Store?

Neben den Embeddings sollten Originaldateien, Seitenvorschauen, extrahierte Assets, Dokumentversionen, Metadaten, Zugriffsinformationen und die erzeugten Chunks gespeichert werden.

Kann die Architektur mit Cloud LLMs und self-hosted Modellen arbeiten?

Ja. Die Retrieval-Schicht entkoppelt Wissenszugriff und Modellruntime. Dadurch können self-hosted Modelle, Cloud LLMs oder hybride Setups genutzt werden, ohne den Zugriffspfad auf Unternehmensdaten zu verändern.

RAG Architektur für Ihre Wissensdatenbank planen

stark AI übersetzt verteilte Dokumente, Berechtigungen und operative Anforderungen in eine belastbare RAG Zielarchitektur mit Ingestion, Knowledge Store, Retrieval und Betriebsmodell.

Architekturgespräch starten