Архитектуры моделей
Модели мультимодального слияния
Соединяйте кодировщики и генераторы, специфичные для каждой модальности, посредством проекций, кросс-внимания, общих токеновых пространств или комбинаций этих механизмов.
Ментальная модель
"Мультимодальный" определяет входы и выходы, а не одну топологию. Всегда спрашивайте, где модальности кодируются, объединяются и декодируются.
Поток данных
- Текст / изображение / аудио / видео
- Кодировщики или токенизаторы для каждой модальности
- Проектор, кросс-внимание или общая основа
- Совместное представление / языковой декодер
- Выход: текст, медиа или действие
Как проходит обучение
Системы сочетают контрастивное выравнивание, подписывание изображений или оценку вероятности следующего токена, маскированные цели, парные обучающие данные и иногда предварительно обученные замороженные компоненты.
Как выполняется инференс
Входы кодируются в токены или признаки для каждой модальности, объединяются до или внутри языковой/генеративной основы и декодируются в одну или несколько модальностей. Понимание входных данных не подразумевает генерацию выходных данных.
Сильные стороны
- Основывает язык на визуальных или акустических входных данных
- Поддерживает рабочие процессы с документами, диаграммами, изображениями, видео и аудио
- Может повторно использовать сильные предварительно обученные компоненты для каждой модальности
Компромиссы
- Дисбаланс модальностей и узкие места соединителей
- Медиа-токены потребляют значительный контекст и вычислительные ресурсы
- Оценка должна разделять восприятие, привязку, рассуждение и генерацию
Использовать, когда
- Задача действительно зависит от нетекстовых доказательств
- Специфичные для модальности секции и воздержание оцениваются
- Архитектура предоставляет достаточно деталей для анализа стоимости и конфиденциальности
Избегать или пересмотреть, когда
- Транскрипция, результат OCR или структурированный извлечение достаточны
- "Поддержка изображений" подразумевает точное восприятие
- Обращение с чувствительными медиаданными и их хранение не определены
Примеры опубликованных семейств
- • Архитектура Flamingo с кросс-вниманием
- • BLIP-2 – обучаемый запросной соединитель
- • Системы мультимодального декодера на основе общих токенов