Architectures de modèles
Modèles de fusion multimodale
Connecter les encodeurs et générateurs spécifiques à chaque modalité via des projections, une attention croisée, des espaces de jetons partagés ou des combinaisons de ces mécanismes.
Modèle mental
Le terme "multimodal" désigne les entrées et sorties, pas une topologie unique. Demandez toujours où les modalités sont encodées, fusionnées et décodées.
Flux de données
- Texte / image / audio / vidéo
- Encodeurs ou tokeniseurs propres à chaque modalité
- Projecteur, attention croisée ou backbone partagé
- Représentation conjointe / décodeur de langage
- Sortie texte, média ou action
Entraînement
Les systèmes combinent un alignement contrastif, un sous-titrage ou une vraisemblance du prochain jeton, des objectifs masqués, des données d'instructions appariées et parfois des composants préentraînés gelés.
Exécution de l’inférence
Les entrées sont encodées en jetons ou caractéristiques spécifiques à la modalité, fusionnées avant ou pendant le backbone langage/génératif, et décodées dans une ou plusieurs modalités. La compréhension de l'entrée n'implique pas la génération de sortie.
Atouts
- Ancre le langage dans les entrées visuelles ou acoustiques
- Prend en charge les flux de travail documentaire, graphique, image, vidéo et audio
- Peut réutiliser des composants modaux préentraînés performants
Compromis
- Déséquilibre modal et goulots d'étranglement des connecteurs
- Les jetons média consomment un contexte et une puissance de calcul considérables
- L'évaluation doit séparer la perception, l'ancrage, le raisonnement et la génération
À utiliser lorsque
- La tâche dépend véritablement de preuves non textuelles
- Les sous-ensembles propres à chaque modalité et les abstentions sont évalués
- L'architecture expose suffisamment de détails pour un examen des coûts et de la confidentialité
À éviter ou remettre en question lorsque
- Une transcription, un résultat OCR ou un extracteur structuré est suffisant
- "Prend en charge les images" est supposé signifier une perception précise
- La manipulation et la conservation des médias sensibles ne sont pas définies
Familles publiées à titre d’exemple
- • Architecture Flamingo avec attention croisée
- • Connecteur d'interrogation apprise BLIP-2
- • Systèmes de décodeur multimodal à jeton partagé