Архитектуры моделей
Практическое руководство по архитектурам
Архитектуры генеративных моделей
Разберитесь, что находится внутри текстовых, векторных, графических, видео-, аудио- и мультимодальных продуктов, а затем осознанно выберите основу, представление, генератор и системную оболочку.
22 семейства архитектур · 5 групп · отдельная страница для каждого семейства
Главное различие
Возможность - не архитектура
«Чат», «изображение» и «мультимодальность» описывают интерфейс. Decoder-only, пространство состояний, DiT и MoE описывают внутренние вычисления. RAG и инструменты описывают среду выполнения вокруг модели. Одна промышленная система может обоснованно иметь метки всех трёх типов.
= возможность чата
+ основа Decoder-only
+ поиск и переранжирование
+ типизированный контроллер инструментов
+ политики и передача человеку
Составить паспорт архитектуры
- 1Возможность: Входы, выходы, задача пользователя и необходимые доказательства
- 2Представление: Токены, векторы, пиксели, коды кодека или непрерывные латентные переменные
- 3Основа: Энкодер, декодер, seq2seq, внимание, SSM или гибрид
- 4Ёмкость: Плотная или с маршрутизацией по экспертам; все и активные параметры
- 5Генерация: Авторегрессионная, диффузионная/потоковая, состязательная или детерминированная
- 6Система: Поиск, инструменты, валидаторы, разрешения, мониторинг и участие людей
Все семейства: 22
Для каждого семейства есть страница об обучении, инференсе, преимуществах, компромиссах и критериях выбора.
Функциональные возможности продукта
Что продукт принимает и возвращает. Это конфигурации развертывания, а не взаимоисключающие нейронные архитектуры.
Языковые модели для текста и чатов
Генерирует текст по одному токену, обычно с помощью каузального декодера, обученного предсказывать следующий токен и затем адаптированного для выполнения инструкций.
Модели эмбеддингов
Преобразуют текст, изображения, аудио, пользователей или элементы в векторы, геометрия которых обучена для сохранения полезного понятия о сходстве.
Генерация и редактирование изображений
Синтезирует или преобразует пиксели, чаще всего с помощью текстового либо визуального условия, латентного генератора и декодера изображений.
Генерация видео
Создание пространственной и временной структуры одновременно с использованием представлений видео в виде кадров, патчей или латентных векторов с межкадровыми вычислениями.
Модели аудио, речи и музыки
Семейство специализированных конвейеров: распознавание речи, синтез речи, понимание аудио, преобразование голоса, генерация звука и генерация музыки – это не одна архитектура.
Основные компоненты сети
Как информация передается по обучаемой сети. Развернутая модель может сочетать в себе несколько из этих вариантов.
Трансформеры только с энкодером
Позвольте каждому входному токену обращать внимание на токены с обеих сторон, создавая контекстные представления вместо цикла неограниченной генерации.
Трансформеры только с декодером
Каузальная маска позволяет каждой позиции учитывать только предыдущие токены, что соответствует генерации слева направо в большинстве универсальных чат-моделей.
Трансформеры «энкодер-декодер»
Двунаправленно кодирует входные данные, затем каузально генерирует выходную последовательность, используя кросс-внимание к закодированному источнику.
Смесь экспертов (MoE)
Заменяет выбранные плотные подслои множеством экспертных сетей и обучаемым маршрутизатором, который активирует лишь небольшую их часть для каждого токена.
Модели пространства состояний и рекуррентные модели
Обновляйте компактное состояние по мере поступления токенов вместо сохранения явной связи внимания между каждой парой позиций.
Представление и генерация
Как изображения, аудио, видео и другие многомерные выходные данные представляются, изучаются и семплируются.
Автокодировщики, VAE и обученные токенизаторы
Обучите кодировщик, который сжимает данные, и декодировщик, восстанавливающий их; вариационные и квантованные варианты формируют латентное пространство для семплирования или последующей генерации.
Генеративно-состязательные сети (GAN)
Обучите генератор обманывать дискриминатор, в то время как дискриминатор учится отличать сгенерированные образцы от обучающих данных.
Нормализующие потоки
Преобразуйте простое распределение в сложное распределение данных посредством последовательности обратимых отображений с вычисляемыми Якобианами.
Диффузионные модели и генерация на основе оценок (score-based generation)
Обучитесь обращать постепенный процесс добавления шума, генерируя данные путем многократной трансформации шума в образцы.
Латентная диффузия
Выполняйте диффузию в пространстве латентных представлений автокодировщика меньшей размерности, а затем декодируйте полученное представление обратно в пиксели или другой сигнал.
Диффузионные трансформеры (DiT)
Трансформер обрабатывает зашумленные патчи изображений или видео и служит денойзером в диффузионном либо потоковом генеративном процессе.
Авторегрессивные визуальные и аудио модели
Преобразует изображения, видео или аудио в дискретные коды и предсказывает их в заданном порядке, часто с помощью каузального трансформера.
Интерфейсы для разных модальностей
Как визуальные данные, текст, звук и другие модальности кодируются, выравниваются, объединяются или связываются с генератором.
Визуальные кодировщики
Преобразует пиксели в карты признаков, токены-патчи или агрегированные векторы для последующей обработки классификаторами, поисковыми системами, декодерами либо мультимодальными моделями.
Контрастивные и двухбашенные энкодеры
Независимо кодируют два входных сигнала (например, запрос и документ или изображение и подпись) и обучают парные примеры располагаться близко друг к другу.
Модели мультимодального слияния
Соединяйте кодировщики и генераторы, специфичные для каждой модальности, посредством проекций, кросс-внимания, общих токеновых пространств или комбинаций этих механизмов.
Архитектуры систем искусственного интеллекта
Исполняемые структуры вокруг модели, которые добавляют знания, инструменты, контроль и верифицируемое поведение.
Системы, дополненные поиском и гибридные системы
Извлекайте данные по запросу и предоставляйте их генератору, классификатору или агенту вместо того, чтобы полагаться только на параметры модели.
Системы с инструментами и рассуждениями
Поместите модель в контроллер, который может планировать, вызывать типизированные инструменты, просматривать результаты, пересматривать, проверять, останавливать и передавать управление человеку.