Dans l'actualité
Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine
NVIDIA Developer · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- NVIDIA Transformer Engine avec JAX améliore le débit d'entraînement Mixture of Experts de 10.4x, atteignant 1,068 TFLOPS/GPU sur DeepSeek-V3.
- Pourquoi ça compte
- Pertinent pour les ingénieurs entraînant des modèles MoE massifs à grande échelle qui doivent maximiser l'utilisation GPU et réduire la surcharge de communication inter-GPU.
- Vigilance
- Le dropless MoE nécessite des kernels spécialisés pour gérer des nombres variables de tokens; le MoE classique par capacité peut rester plus simple malgré les compromis d'efficacité.
- mixture of experts
- qwen
- deepseek
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.