Dans l'actualité
Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72
NVIDIA Developer · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Alibaba's Qwen3.8-2.4T-A95B, modèle open-weight de 2,4 trillions de paramètres, s'exécute optimisé sur le matériel NVIDIA GB300 NVL72 avec contrôles de raisonnement configurables.
- Pourquoi ça compte
- Les ingénieurs déployant des grands modèles de langage en production ont besoin d'inférence efficace à grande échelle, notamment pour les charges de travail d'IA agentive comme la génération de code et l'analyse de documents.
- Vigilance
- Le débit de 4K tokens par seconde nécessite le matériel spécialisé GB300 NVL72 de NVIDIA avec 72 GPUs; les performances sur d'autres systèmes varieront considérablement.
Écouter ce résumé
- reasoning
- context window
- attention
- token
- mixture of experts
Les patterns derrière cette actualité
- Agentic Context Engineering (Evolving Playbook)
- Energy-Efficient Inference
- Generative UI (Agent-Rendered Interfaces)
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.