Architectures de modèles
Mélange d’experts (MoE)
Remplacez les sous-couches denses sélectionnées par de nombreux réseaux experts et un routeur appris qui n'active qu'un petit sous-ensemble pour chaque jeton.
Modèle mental
Capacité de paramètres importante avec activation parcimonieuse par jeton ; le calcul creux ne correspond pas à une mémoire réduite ou un service simple.
Flux de données
- État caché du jeton
- Le routeur évalue les experts
- Acheminement vers les k meilleurs experts
- Transformations d'experts
- Fusion pondérée + chemin résiduel
Entraînement
La perte de tâche principale entraîne les experts et le routeur ensemble. L'équilibrage de la charge ou les régularisations de routage découragent l'effondrement en quelques experts ; les implémentations distribuées doivent coordonner le dispatch des jetons.
Exécution de l’inférence
Chaque jeton visite les experts sélectionnés. Les opérations arithmétiques peuvent rester creuses tandis que les poids du modèle, la communication inter-appareils, le déséquilibre de routage et le batching influencent toujours la latence et le coût.
Atouts
- Capacité de paramètres accrue sans activer tous les paramètres par jeton
- Les experts peuvent se spécialiser grâce au routage appris
- S'adapte naturellement dans les blocs feed-forward des Transformers
Compromis
- Grande mémoire de poids et communication distribuée
- Le déséquilibre du routage et le débordement de capacité compliquent l'entraînement
- Le nombre total de paramètres rapporté ne révèle pas le calcul actif ni l'efficacité du service
À utiliser lorsque
- Une infrastructure d’entraînement et de service à grande échelle peut exploiter le routage parcimonieux
- La capacité est plus contrainte que l'arithmétique par jeton
- Vous pouvez tester la topologie matérielle réelle
À éviter ou remettre en question lorsque
- Un déploiement sur un seul appareil ou avec des contraintes de mémoire est nécessaire
- On suppose à tort que la parcimonie garantit une latence inférieure
- La simplicité opérationnelle est plus précieuse que la capacité supplémentaire
Familles publiées à titre d’exemple
- • Switch Transformer
- • Couches d'experts creuses à l'intérieur de modèles linguistiques ou multimodaux