Архитектуры моделей
Модели пространства состояний и рекуррентные модели
Обновляйте компактное состояние по мере поступления токенов вместо сохранения явной связи внимания между каждой парой позиций.
Ментальная модель
Прогоняйте последовательность через изученный переход состояния; состояние — это сжатая память о прошлом.
Поток данных
- Текущий токен + предыдущее состояние
- Изученное обновление состояния
- Селективный гейт или рекуррентный миксер
- Выходной скрытый слой состояния
- Передавайте состояние вперед
Как проходит обучение
Функции потерь для моделирования последовательностей сочетаются с рекуррентными или структурированными слоями пространства состояний. Параллельные сканы или родственные формулировки могут сделать обучение более параллельным, чем наивный шаг за шагом RNN.
Как выполняется инференс
Декодирование поддерживает ограниченное рекуррентное состояние на слой. Гибридные архитектуры могут чередовать слои пространства состояний, свертки и внимания для восстановления возможностей, которые хорошо обрабатывает каждый механизм.
Сильные стороны
- Обработка последовательностей с линейным временем в основном рекуррентной части
- Компактное потоковое состояние во время вывода
- Естественная совместимость с длинными или непрерывно поступающими последовательностями
Компромиссы
- Сжатое состояние может потерять точные удаленные детали
- Инструменты и оптимизированные ядра могут быть менее зрелыми, чем стандартное внимание
- Требования к архитектурной сложности должны быть проверены от начала до конца
Использовать, когда
- Эффективность потоковой передачи или длинных последовательностей является приоритетным требованием
- Целевая среда выполнения имеет оптимизированные ядра
- Воспроизведение, качество и пропускная способность проверяются на реальной рабочей нагрузке
Избегать или пересмотреть, когда
- Предполагается точное произвольное извлечение из длинного контекста без тестирования
- Стек обслуживания не может использовать архитектуру
- Существующее зрелое развертывание Transformer уже соответствует бюджету
Примеры опубликованных семейств
- • Селективные модели пространства состояний Mamba
- • Рекуррентные языковые модели в стиле RWKV
- • Гибридные стеки внимания–SSM
Часто сочетается с
Трансформеры только с декодеромСмесь экспертов (MoE)Гибридные слои внимания