Dans l'actualité
HPC-Ops × SGLang: High-Performance Attention, Router GEMM, and MoE Kernels from Tencent Hunyuan
LMSYS · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Tencent Hunyuan released HPC-Ops, optimized kernels for attention, routing, and MoE inference now integrated into SGLang's main branch.
- Pourquoi ça compte
- Engineers deploying large language models on NVIDIA Hopper GPUs who need faster MoE model serving with mixed-length sequences and FP8 quantization.
- Vigilance
- Kernels target SM90 Hopper GPUs specifically; performance gains vary by batch size, sequence length distribution, and quantization precision used.
Écouter ce résumé
- attention
- kernel
Les patterns derrière cette actualité
- Machine Learning Model-Based Routing
- Mixed-Initiative Interface Patterns
- Context Editing & Tool-Result Clearing
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.