Новости
HPC-Ops × SGLang: High-Performance Attention, Router GEMM, and MoE Kernels from Tencent Hunyuan
LMSYS · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- Tencent Hunyuan released HPC-Ops, optimized kernels for attention, routing, and MoE inference now integrated into SGLang's main branch.
- Почему это важно
- Engineers deploying large language models on NVIDIA Hopper GPUs who need faster MoE model serving with mixed-length sequences and FP8 quantization.
- На что обратить внимание
- Kernels target SM90 Hopper GPUs specifically; performance gains vary by batch size, sequence length distribution, and quantization precision used.
Послушать это резюме
- attention
- kernel
Паттерны, стоящие за этой новостью
- Machine Learning Model-Based Routing
- Mixed-Initiative Interface Patterns
- Context Editing & Tool-Result Clearing
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.