Новости
Taking vLLM Apart: A Practical Guide to Disaggregated Serving
vLLM · Martin Hickey (IBM Research) · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- vLLM v0.30.0 adds disaggregated serving, splitting LLM inference into separate prefill, decode, and CPU-only tokenization stages to reduce latency and improve throughput.
- Почему это важно
- Use this when inter-token latency p99 misses your SLO under load, or when long prompts at high concurrency cause stalls in a single-process setup.
- На что обратить внимание
- KV cache transfer speed between prefill and decode is critical; slow transfers can make time-to-first-token worse than collocated serving, and you now operate multiple services instead of one.
- llm
- serving
- vllm
Паттерны, стоящие за этой новостью
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.