Dans l'actualité
HPC-Ops × SGLang: High-Performance Attention, Router GEMM, and MoE Kernels from Tencent Hunyuan
LMSYS · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Tencent Hunyuan a intégré HPC-Ops dans la branche principale de SGLang, apportant des kernels optimisés pour l'attention, le routage et l'inférence MoE sur Hopper.
- Pourquoi ça compte
- Pour les ingénieurs déployant des modèles MoE sur GPU NVIDIA Hopper qui cherchent à accélérer le serving avec des séquences de longueurs mixtes et quantification FP8.
- Vigilance
- Ces kernels ciblent spécifiquement les GPU SM90 Hopper; les gains de performance varient selon la taille de batch, la distribution des longueurs de séquence et la précision utilisée.
- attention
- kernel
Les patterns derrière cette actualité
- Machine Learning Model-Based Routing
- Mixed-Initiative Interface Patterns
- Context Editing & Tool-Result Clearing
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.