Architectures de modèles
Transformers à décodeur uniquement
Utilisez un masque causal pour que chaque position ne voit que les jetons précédents, ce qui correspond au processus de génération gauche à droite utilisé par la plupart des modèles de discussion grand public.
Modèle mental
Compresser le préfixe dans l’état d’attention, prédire un jeton de continuation, l’ajouter et répéter.
Flux de données
- Jetons de préfixe
- Auto-attention masquée causalement
- État caché à chaque position
- Logits du vocabulaire
- Prochain jeton → répétition
Entraînement
L’entropie croisée du jeton suivant fournit un signal d’apprentissage à chaque position. Le post-entraînement peut ajouter des exemples d’instructions, des préférences, des récompenses vérifiables ou des trajectoires d’outils.
Exécution de l’inférence
Le préremplissage traite l'invite ; le décodage émet ensuite les jetons sérialement tandis que le cache KV stocke les clés et valeurs d'attention passées. La taille du contexte, la mémoire du cache et la longueur de la sortie influencent le comportement du service.
Atouts
- Une interface évolutive pour de nombreuses tâches génératives
- Forte adaptation contextuelle
- Peut intercaler prose, code, données structurées et jetons d'appel d'outil
Compromis
- Latence séquentielle du décodage
- Préremplissage quadratique dans l’attention complète standard
- La sensibilité à l’invite et la sortie probabiliste nécessitent une validation
À utiliser lorsque
- Une génération ouverte ou un chat interactif sont essentiels
- De nombreuses tâches peuvent partager un seul point de terminaison de modèle
- Vous pouvez contraindre et évaluer les sorties dans la boucle produit
À éviter ou remettre en question lorsque
- Un petit encodeur ou un composant déterministe répondent à l'exigence
- Les sorties exactes garanties sont supposées sans validation
- De longs corpus sources doivent être recherchés plutôt que placés intégralement dans le contexte
Familles publiées à titre d’exemple
- • Modèles de langage causal de type GPT
- • Famille de recherche LLaMA