Новости
LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook
Liquid AI · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- Liquid AI released DSpark draft models for three LFM2.5 models, enabling speculative decoding that speeds up inference up to 3.2x on GPUs and 2.87x on MacBooks without changing output quality.
- Почему это важно
- Matters for engineers deploying language models on GPUs or edge devices who need faster token generation for interactive applications like agentic reasoning or function calling.
- На что обратить внимание
- Speedup varies significantly by model size and hardware. The 8B model shows only 1.18x speedup on MacBooks due to current MoE implementation limitations in llama.cpp's Metal backend, requiring future optimization work.
Послушать это резюме
- inference
- lfm
Кто ещё это публиковал
- Up to 3.2x Faster Inference with LFM2.5-DSparkHugging Face
То же событие у других изданий, за которыми мы следим.
Паттерны, стоящие за этой новостью
- Function Calling
- Speculative & Parallel Tool Execution
- Agentic Context Engineering (Evolving Playbook)
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.