Dans l'actualité
vLLM Reaches 25K Total TPS/GPU on Qwen3.5
vLLM · vLLM Team · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- vLLM atteint 25 000 tokens par seconde par GPU en servant Qwen3.5 sur systèmes GB200 NVL72 avec architecture prefill-decode désagrégée.
- Pourquoi ça compte
- Pertinent pour les ingénieurs déployant des modèles de langage à grande échelle qui cherchent à maximiser le débit d'inférence sur clusters multi-GPU.
- Vigilance
- Les résultats utilisent des longueurs fixes de 8K tokens en entrée et 1K en sortie sur données aléatoires; les performances réelles varient selon les patterns de charge.
- llm
- kernel
- serving
- vllm
- qwen
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.