Архитектуры моделей
Авторегрессивные визуальные и аудио модели
Преобразует изображения, видео или аудио в дискретные коды и предсказывает их в заданном порядке, часто с помощью каузального трансформера.
Ментальная модель
Представить медиа как язык: токенизировать его, выбрать порядок, предсказать следующий код, затем декодировать.
Поток данных
- Токенизатор / кодек для медиаданных
- Упорядоченные дискретные коды
- Причинно-следственная модель токенов
- Сгенерированная последовательность кодов
- Декодер медиаданных
Как проходит обучение
Обучается выученный кодек для восстановления; приоритет минимизирует кросс-энтропию следующего кода, опционально с учетом текста, предыдущих кадров, семантических токенов или кодов крупномасштабной структуры.
Как выполняется инференс
Коды генерируются последовательно или по иерархическому/блочному расписанию, а затем декодируются. Порядок определяет задержку и какие зависимости легче моделировать.
Сильные стороны
- Унифицированное на основе токенов моделирование в различных модальностях
- Совместимость с инфраструктурой причинно-следственных языковых моделей
- Точная дискретная вероятность для выбранной токенизации
Компромиссы
- Длинные последовательности кодов создают сериальную задержку
- Артефакты токенизатора ограничивают качество вывода
- Одномерный порядок может быть неудобен для пространственной или мультимасштабной структуры
Использовать, когда
- Существует надежный дискретный кодек
- Важно кросс-модальное токенное моделирование или продолжение
- Иерархическая генерация соответствует целям по задержке
Избегать или пересмотреть, когда
- Длинная последовательная декодировка превышает бюджет
- Кодек теряет критические перцептивные детали
- Непрерывная диффузионная репрезентация значительно проще
Примеры опубликованных семейств
- • Моделирование пикселей/токенов в стиле ImageGPT
- • Генераторы изображений на основе VQ-токенов
- • Иерархия кодек-токенов в стиле AudioLM
Часто сочетается с
Трансформеры только с декодеромVQ-VAE / нейронный кодекМногомодальное токенное объединение