Loading...
RAG multimodal(MMRAG)
Génération augmentée par récupération qui gère et intègre des sources de texte, d'images, d'audio, de vidéo et de données structurées
In 30 seconds
- What
- Récupère et combine texte, images, audio, vidéo et données structurées à l'aide d'embeddings alignés, pour ancrer la génération dans des preuves multimodales.
- When to use
- Problèmes exigeant des réponses ancrées dans des médias variés, comme un diagnostic médical à partir d'examens d'imagerie et de texte, ou une revue de conception à partir de documents et de captures d'écran.
- Watch out
- L'alignement des embeddings entre modalités est fragile ; des espaces mal alignés poussent la recherche à privilégier une seule modalité, ce qui dégrade les réponses nécessitant une vraie fusion.
Loading technique guide…