Архитектуры моделей
Визуальные кодировщики
Преобразует пиксели в карты признаков, токены-патчи или агрегированные векторы для последующей обработки классификаторами, поисковыми системами, декодерами либо мультимодальными моделями.
Ментальная модель
Визуальный читатель. Он создает представления; генерация требует декодера или генеративной модели.
Поток данных
- Изображение или кадры
- Стем на основе патчей, сверток или гибридный
- Визуальная основа (backbone)
- Пространственные токены / пирамида признаков / объединенный вектор
- Головка задачи или соединитель модальностей
Как проходит обучение
Обучение с учителем, маскированное моделирование изображений, самодистилляция, реконструкция и целевые функции контрастного сопоставления изображений и текста создают различные визуальные инварианты и уровни пространственных деталей.
Как выполняется инференс
Кодировщик запускается один раз для каждой партии изображений или кадров. Объединенные выходные данные предпочтительнее для поиска и классификации; плоские карты токенов сохраняют больше информации о локализации для обнаружения или мультимодальных рассуждений.
Сильные стороны
- Повторно используемые визуальные признаки
- Эффективная классификация, поиск и восприятие
- Можно связать изображения с языковыми моделями через проектор или механизм кросс-внимания
Компромиссы
- Разрешение и размер патча определяют потерянные детали и стоимость токена
- Целевые функции обучения создают различные "слепые зоны"
- Объединенный вектор недостаточен для многих пространственных задач
Использовать, когда
- Система должна понимать или извлекать визуальный контент
- Вы можете выбрать объединенные или пространственные признаки в зависимости от задачи
- Небольшие тексты, диаграммы и изображения предметной области оцениваются явно
Избегать или пересмотреть, когда
- Генерация изображений ошибочно ожидается только от кодировщика
- Разрешение входного изображения удаляет необходимые детали
- Общий бенчмарк ошибочно подменяет оценку в реальной предметной области
Примеры опубликованных семейств
- • Vision Transformer (ViT)
- • Сверточные и иерархические визуальные основы (backbones)
- • Изображение-башня в CLIP