Новости
Scaling Laws for Mixture Pretraining Under Data Constraints
Apple Machine Learning Research · Опубликовано · 3 мин чтения
За 30 секунд
- Что произошло
- Apple researchers studied how to mix scarce target data with abundant generic data during language model pretraining, finding optimal repetition rates.
- Почему это важно
- Engineers training models on low-resource languages or specialized domains with limited data need guidance on mixture ratios and repetition.
- На что обратить внимание
- Results span 2000 runs but optimal repetition rates vary by target data size, compute budget, and model scale, requiring case-by-case analysis.
Послушать это резюме
- language model
Паттерны, стоящие за этой новостью
Каждый разбирает, как работает техника, когда она оправдывает затраты и где ломается.
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.