Новости
Announcing vllm-metal: Concurrent Serving on Apple Silicon
vLLM · Ranran Haoran Zhang, Lik Xun Yuan, Chao Ju Chen, Eric Curtin, Michael Goin · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- vLLM released vllm-metal v0.28.0, bringing concurrent LLM serving to Apple Silicon Macs with paged KV cache and OpenAI-compatible API.
- Почему это важно
- Engineers running multiple overlapping inference requests on M1-M5 Macs need predictable latency, memory control, and batching beyond single-request inference.
- На что обратить внимание
- Speculative decoding with MTP requires greedy sampling and synchronous scheduling; prefix caching for hybrid models remains experimental and incompatible with speculative decoding.
- agent
- llm
- serving
- vllm
Паттерны, стоящие за этой новостью
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.