Dans l'actualité
Day 0 Support for Qwen3.8-2.4T-A95B on vLLM
vLLM · vLLM Team and Inferact · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- vLLM released Day-0 support for Qwen3.8-2.4T-A95B, a 2.4-trillion-parameter sparse MoE model with optimized kernels.
- Pourquoi ça compte
- When deploying inference on Qwen3.8 across NVIDIA B300 or AMD MI355X clusters with memory constraints.
- Vigilance
- Requires at least two GPU nodes for full precision or one node for FP4 quantized versions; allocate high max_tokens for reasoning.
Écouter ce résumé
- llm
- quantiz
- kernel
- vllm
- qwen
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.