Архитектуры моделей
Смесь экспертов (MoE)
Заменяет выбранные плотные подслои множеством экспертных сетей и обучаемым маршрутизатором, который активирует лишь небольшую их часть для каждого токена.
Ментальная модель
Большая емкость параметров с разреженной активацией на токен; разреженные вычисления не всегда означают небольшой объем памяти или простое обслуживание.
Поток данных
- Скрытое состояние токена
- Роутер оценивает экспертов
- Выбор топ-k экспертов
- Преобразования экспертов
- Взвешенное объединение + остаточный путь
Как проходит обучение
Основная функция потерь совместно обучает экспертов и маршрутизатор. Регуляризация балансировки нагрузки и маршрутизации не дает системе задействовать лишь нескольких экспертов; распределенные реализации должны координировать передачу токенов.
Как выполняется инференс
Каждый токен посещает выбранных экспертов. Арифметические операции могут оставаться разреженными, но веса модели, межустроественная коммуникация, дисбаланс маршрутизации и батчинг все равно влияют на задержку и стоимость.
Сильные стороны
- Большая емкость параметров без активации каждого параметра для токена
- Эксперты могут специализироваться благодаря обученному маршрутизирующему механизму
- Естественно масштабируется внутри блоков прямой связи Transformer
Компромиссы
- Большой объем памяти для весов и распределенная коммуникация
- Дисбаланс маршрутизации и переполнение емкости усложняют обучение
- Заявленное общее количество параметров не отражает активные вычисления или эффективность обслуживания
Использовать, когда
- Инфраструктура масштабного обучения и обслуживания может использовать преимущества разреженной маршрутизации
- Емкость более ограничена, чем арифметические операции на токен
- Можно оценить фактическую топологию оборудования
Избегать или пересмотреть, когда
- Требуется одноустроечное развертывание или развертывание с ограниченным объемом памяти
- Предполагается, что “разреженность” гарантирует меньшую задержку
- Операционная простота более ценна, чем дополнительная емкость
Примеры опубликованных семейств
- • Switch Transformer
- • Разреженные экспертные слои внутри языковых или мультимодальных моделей