Архитектуры моделей
Матрица выбора модели
Начните с задачи пользователя и возможного сбоя. Это исходные архитектуры для первичной проверки, а не универсальные победители.
| Потребность продукта | Сначала проверить эту основу | Почему она подходит | Что тщательно контролировать |
|---|---|---|---|
| Открытый ассистент или помощник по кодированию | Декодер-ориентированная языковая модель + извлечение/инструменты при необходимости | Гибкая генерация и адаптация к задачам на основе контекста | Обоснованность, внедрение подсказок, полномочия инструмента, последовательная задержка |
| Классификация, извлечение или переранжирование в больших объемах | Модель только с кодировщиком или компактный кодировщик-декодировщик | Однопроходное предсказание с ограниченными ресурсами может быть дешевле и проще в калибровке | Сдвиг предметной области, длина входных данных, калибровка меток |
| Перевод, транскрипция или точная передача исходного текста | Модель «энкодер-декодер» | Выделенная память источника задает условия для каждого сгенерированного токена | Пропуски, имена/числа, длина исходника, задержка декодирования |
| Семантический поиск в большом корпусе документов | Двойной энкодер + векторный индекс + необязательный переранжировщик | Векторные представления кандидатов могут быть построены один раз и использоваться для эффективного поиска | Полнота, негативные примеры, фильтры, калибровка оценки |
| Ответы из текущих или приватных источников знаний | Гибридный RAG + переранжировщик + основанный на фактах генератор | Знания остаются внешними, проверяемыми и обновляемыми | Загрузка данных, контроль доступа, отсутствие доказательств, отравленный контекст |
| Создание или редактирование изображений | Лате́нтная диффузия с шумоподавителем U-Net или DiT | Сжатая итеративная генерация поддерживает сильную обусловленность и позволяет вносить правки | Потеря деталей кодека, задержка дискретизации, права и происхождение |
| Создание видео | Пространственно-временная латентная диффузия или генератор медиатокенов | Обе визуальные детали и временная зависимость учитываются | Смещение идентичности, движение, продолжительность, вычисления, синхронизация аудио |
| Распознавание речи | Аудиокодировщик-декодер, разработанный для АСР | Разделяет акустическое понимание и генерацию текста | Язык, акцент, наложение, шум, задержка потоковой передачи |
| Длинная потоковая последовательность при ограниченном бюджете ресурсов | SSM/рекуррентная или гибридная схема внимания–SSM | Обеспечивает компактное рекуррентное состояние вместо полного кэша внимания | Точное запоминание на большие расстояния, поддержка ядра, реальная пропускная способность |
| Ассистент для работы с мультимодальными документами или диаграммами | Кодировщик изображений + языковой декодер + извлечение документов | Сохраняет визуальные доказательства при одновременной привязке ответов к исходным страницам | Небольшой текст, пространственные ссылки, стоимость токенов медиафайлов, цитирования |
| Надежное выполнение действий в бизнес-системах | Инструментальная языковая модель внутри детерминированного правила/контроллера | Язык обрабатывает намерения, а код обеспечивает права доступа и побочные эффекты | Идемпотентность, согласования, повторные попытки, схемы данных, журнал аудита |
Откройте любое семейство на боковой панели, чтобы прочитать полное руководство по обучению, инференсу и выбору.