Загружаем паттерны…
Оптимизация предпочтений по отношению шансов(ORPO)
Выравнивание предпочтений без опорной модели, добавляющее к языковой цели для выбранного ответа штраф на основе отношения шансов для отклонённых ответов
За 30 секунд
- Что это
- Обучает модель на выбранных ответах, одновременно штрафуя отклонённые ответы через функцию потерь на основе отношения шансов, полностью обходясь без референсной модели.
- Когда применять
- У вас есть парные данные предпочтений и нужно более быстрое и дешёвое выравнивание без отдельной референсной модели.
- Осторожно
- Штраф на основе отношения шансов может дестабилизировать обучение при неверно подобранной лямбде; чтобы не потерять способности модели, нужен тщательный поиск гиперпараметров.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Оптимизация предпочтений по отношению шансов: Обзор
Выравнивание предпочтений без опорной модели, добавляющее к языковой цели для выбранного ответа штраф на основе отношения шансов для отклонённых ответов
- Reference-model-free training
- Chosen-response SFT objective
- Odds-ratio preference penalty
- Single training phase
- Paired preference data
- Preference and capability evaluation
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
От инженера, создавшего этот каталог
Проведите ревью архитектуры ваших агентов
На этой странице описан один паттерн. Ваша система использует десятки, и большинство сбоев возникает на стыках. Мы разберём весь дизайн по 288 паттернам каталога: архитектура, надёжность, оценка и стоимость, каждая находка связана с паттерном, который её устраняет.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября