Architectures de modèles
Transformers encodeur–décodeur
Encoder une entrée de manière bidirectionnelle, puis générer une sortie de manière causale tout en effectuant un mécanisme d'attention croisée sur la source encodée.
Modèle mental
Un lecteur et un rédacteur reliés par l'attention croisée.
Flux de données
- Séquence source
- Encodeur bidirectionnel
- Mémoire de la source
- Décodeur causal + attention croisée
- Séquence cible
Entraînement
La maximisation de la vraisemblance du jeton cible avec entraînement forcé est courante. Le débruitage texte-à-texte ou la corruption par intervalle permet à de nombreuses tâches de partager la même interface entrée/sortie.
Exécution de l’inférence
La source est encodée une seule fois ; le décodeur génère la cible de manière autorégressive tout en tenant compte d'états sources stables. La recherche en faisceau est utile dans certaines tâches limitées, mais n'est pas toujours optimale.
Atouts
- Séparation claire entre la compréhension de la source et la génération de la cible
- Adaptation idéale pour la traduction, le résumé, la transcription et la transformation
- La mémoire de la source est réutilisée tout au long du décodage
Compromis
- Deux empilements peuvent augmenter les paramètres et la complexité du déploiement
- Le décodage de la cible reste sériel
- Peut être moins pratique qu'une interface unique basée sur un seul décodeur pour les tâches de chat hétérogènes
À utiliser lorsque
- La sortie est étroitement conditionnée par une entrée distincte
- La source et la cible ont des structures ou des modalités différentes
- Une transformation fidèle compte plus que la continuation ouverte
À éviter ou remettre en question lorsque
- Une interface de chat générale unique est l'exigence prédominante
- Aucune séquence source distincte n'existe
- Une tête d'encodeur non générative est suffisante
Familles publiées à titre d’exemple
- • Transformateur original
- • T5
- • Architecture de reconnaissance vocale Whisper
Souvent combinée avec
Transformation de texteAudio / paroleModèles de fusion multimodale