Загружаем паттерны…
Обучение с подкреплением на проверяемых наградах (RLVR)
Обучает модели рассуждения с помощью обучения с подкреплением на автоматически проверяемых наградах (например, совпадает ли математический ответ с эталоном или проходит ли код свои тесты), а не на обученных моделях предпочтений. Поскольку награда оценивает только итоговую правильность, длинные цепочки рассуждений с возвратами и самопроверкой возникают без размеченных обоснований. Это отличается от RLHF, RLAIF и DPO, которые оптимизируют предпочтения человека или ИИ.
За 30 секунд
- Что это
- Обучает модель методом RL по автоматически проверяемым наградам (правильность математики, тесты кода), выставляемым только за конечный ответ, благодаря чему цепочки рассуждений и самопроверка возникают без размеченных обоснований.
- Когда применять
- Задачи с детерминированным, проверяемым эталонным ответом, где вы хотите, чтобы модель сама нашла свой способ рассуждения без размеченных пошаговых решений.
- Осторожно
- Требует огромных вычислений, чтобы сэмплировать множество кандидатных решений на каждую задачу; большинство из них неверны, что делает обучение дорогим и медленным по сравнению с обучением с учителем.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Обучение с подкреплением на проверяемых наградах (RLVR): Обзор
Обучает модели рассуждения с помощью обучения с подкреплением на автоматически проверяемых наградах (например, совпадает ли математический ответ с эталоном или проходит ли код свои тесты), а не на обученных моделях предпочтений. Поскольку награда оценивает только итоговую правильность, длинные цепочки рассуждений с возвратами и самопроверкой возникают без размеченных обоснований. Это отличается от RLHF, RLAIF и DPO, которые оптимизируют предпочтения человека или ИИ.
- Automatically verifiable rewards (math or code correctness)
- No supervised reasoning traces required
- Emergent long chain-of-thought with backtracking
- Emergent self-verification and re-checking
- Group-relative policy optimization (GRPO)
- Distinct from preference-based RLHF, RLAIF, and DPO
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
От инженера, создавшего этот каталог
Проведите ревью архитектуры ваших агентов
На этой странице описан один паттерн. Ваша система использует десятки, и большинство сбоев возникает на стыках. Мы разберём весь дизайн по 288 паттернам каталога: архитектура, надёжность, оценка и стоимость, каждая находка связана с паттерном, который её устраняет.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября