Architectures de modèles
Systèmes augmentés par la recherche et hybrides
Récupérer les preuves au moment de la requête et les fournir à un générateur, un classificateur ou un agent plutôt que de se fier uniquement aux paramètres du modèle.
Modèle mental
Inférence ouverte : la récupération choisit les preuves ; la génération les utilise. Chacune peut échouer indépendamment.
Flux de données
- Ingestion → découpage → indexation
- Requête utilisateur
- Recherche dense, creuse, graphe ou hybride
- Tri + assemblage de contexte
- Réponse du modèle avec liens vers les preuves
Entraînement
Les composants peuvent être entraînés séparément ou conjointement : les encodeurs doubles apprennent la recherche, les trieurs apprennent la pertinence par paires et les générateurs apprennent un comportement de réponse étayé. De nombreux systèmes RAG pratiques utilisent des composants pré-entraînés sans formation bout en bout.
Exécution de l’inférence
Une requête peut être réécrite ou routée ; plusieurs récupérateurs produisent des candidats ; des filtres et un trieur sélectionnent les preuves ; le modèle répond à partir d'un contexte limité. La véracité des citations nécessite de vérifier que les affirmations sont effectivement étayées.
Atouts
- Connaissance actualisée, privée ou attribuable sans mise à jour des poids
- Les preuves peuvent être inspectées et soumises à un contrôle d'accès
- Les index et les générateurs peuvent évoluer indépendamment
Compromis
- Un mauvais découpage ou une mauvaise recherche crée des réponses convaincantes à partir de preuves manquantes
- La fraîcheur de l'ingestion, les autorisations et la suppression deviennent des systèmes de production
- Le contenu récupéré peut véhiculer des injections d'invite ou des données empoisonnées
À utiliser lorsque
- Les réponses dépendent de sources changeantes ou propriétaires
- Les utilisateurs ont besoin de preuves traçables
- La restitution, le classement, l'ancrage et la qualité des réponses peuvent être évalués séparément
À éviter ou remettre en question lorsque
- Le corpus est suffisamment petit pour une recherche déterministe
- Aucune source fiable n'existe
- L'ajout d'une base de données vectorielle est considéré comme une conception RAG complète
Familles publiées à titre d’exemple
- • Architecture originale de génération augmentée par la recherche
- • Recherche dense + creuse hybride avec tri
- • Pipelines de recherche basés sur des graphes ou des outils