Архитектуры моделей
Языковые модели для текста и чатов
Генерирует текст по одному токену, обычно с помощью каузального декодера, обученного предсказывать следующий токен и затем адаптированного для выполнения инструкций.
Ментальная модель
Вероятностный движок продолжения, заключенный в протокол диалога, а не база данных, поисковая система или движок детерминированных правил.
Поток данных
- Сообщения, документы или код
- Токенизатор + маркеры ролей/инструментов
- Причинная языковая модель (основа)
- Распределение следующего токена
- Декодирование до условия остановки
Как проходит обучение
Предварительное обучение обычно минимизирует кросс-энтропию следующего токена по большим последовательностям токенов. Тонкая настройка на инструкциях, оптимизация предпочтений, обучение безопасности и примеры использования инструментов затем формируют поведение взаимодействия; они не меняют основную потребность в доказательствах и оценке.
Как выполняется инференс
Модель многократно предсказывает следующий токен, а затем выбирает или семплирует его. Кэш KV повторно использует предыдущее состояние внимания; длинные ответы остаются последовательными, а настройки декодирования меняют вариативность, но не достоверность.
Сильные стороны
- Свободное письмо, преобразование, объяснение, код и разговор
- Учится задачам на основе инструкций и примеров в контексте
- Может выдавать структурированные вызовы инструментов или схемы при ограничениях и проверке
Компромиссы
- Может генерировать беглые необоснованные утверждения
- Авторегрессивный вывод добавляет задержку на токен
- Контекст, подсказки и выбор семплирования существенно влияют на поведение
Использовать, когда
- Задача требует гибкой генерации или синтеза языка
- Рубрика и репрезентативный набор оценок могут определить приемлемое поведение
- Свежие факты могут быть основаны на извлечении или инструментах
Избегать или пересмотреть, когда
- Задача надежно решается детерминированным парсером, запросом или движком правил
- Требуются точные актуальные факты, но надежный источник не подключен
- Непроверенный вывод может напрямую вызвать действие с высоким воздействием
Примеры опубликованных семейств
- • Языковые модели в стиле GPT
- • Потомки, настроенные на инструкции, такие как исследовательская система InstructGPT