Modellarchitekturen
Retrieval-augmentierte & hybride Systeme
Bei Anfragen werden Belege zur Laufzeit abgerufen und einem Generator, Klassifikator oder Agenten bereitgestellt, anstatt sich ausschließlich auf die Modellparameter zu verlassen.
Denkmodell
Open-Book-Inferenz: Die Retrieval-Komponente wählt die Belege aus; die Generierungskomponente nutzt diese. Beide Komponenten können unabhängig voneinander fehlschlagen.
Datenfluss
- Ingestion → Chunking → Indexierung
- Benutzeranfrage
- Dichte, spärliche, Graph- oder hybride Retrieval-Methoden
- Reranking + Kontextzusammenstellung
- Modellantwort mit Belegverweisen
So wird trainiert
Komponenten können separat oder gemeinsam trainiert werden: Dual Encoder lernen das Retrieval, Reranker lernen die paarweise Relevanz und Generatoren lernen ein fundiertes Antwortverhalten. Viele praktische RAG-Systeme verwenden vortrainierte Komponenten ohne End-to-End-Training.
So läuft die Inferenz
Eine Anfrage kann umgeschrieben oder weitergeleitet werden; mehrere Retriever erzeugen Kandidaten; Filter und ein Reranker wählen Belege aus; das Modell antwortet auf Basis eines begrenzten Kontexts. Die Korrektheit von Zitationen erfordert die Prüfung, ob Behauptungen tatsächlich belegt sind.
Stärken
- Frisches, privates oder nachvollziehbares Wissen ohne Gewichtsupdates
- Belege können inspiziert und Zugriffsrechte verwaltet werden
- Indexe und Generatoren können unabhängig voneinander weiterentwickelt werden
Zielkonflikte
- Schlechtes Chunking oder Retrieval erzeugt selbstbewusste Antworten aus fehlenden Belegen
- Aktualität der Inhalte, Berechtigungen und Löschvorgänge werden zu Bestandteilen von Produktionssystemen
- Abgerufene Inhalte können Prompt-Injection oder vergiftete Daten enthalten
Geeignet, wenn
- Antworten hängen von sich ändernden oder proprietären Quellen ab
- Benutzer benötigen nachvollziehbare Belege
- Recall, Ranking, Grounding und Antwortqualität können separat bewertet werden
Vermeiden oder hinterfragen, wenn
- Der Korpus ist klein genug für eine deterministische Suche
- Es gibt keine vertrauenswürdige Quelle
- Die Hinzufügung einer Vektordatenbank wird als vollständiges RAG-Design betrachtet
Beispielhafte veröffentlichte Familien
- • Ursprüngliche Retrieval-Augmented Generation Forschungsarchitektur
- • Dichte + spärliches hybrides Retrieval mit Reranking
- • Graph- oder Tool-basierte Retrieval-Pipelines