Dans l'actualité
Announcing vllm-metal: Concurrent Serving on Apple Silicon
vLLM · Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- vLLM released vllm-metal v0.28.0, apportant le serving concurrent de LLM sur Macs Apple Silicon avec paged KV cache et API compatible OpenAI.
- Pourquoi ça compte
- Les ingénieurs exécutant plusieurs requêtes d'inférence chevauchées sur Macs M1-M5 ont besoin de latence prévisible, contrôle mémoire et batching.
- Vigilance
- Le speculative decoding avec MTP nécessite greedy sampling et scheduling synchrone; prefix caching pour modèles hybrides reste expérimental et incompatible.
- agent
- llm
- serving
- vllm
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.