Loading...
Обучение на основе памяти(MBL)
Улучшает поведение агента за счёт извлечения и повторного использования сохранённого опыта в момент принятия решения, а не обновления весов модели. Прошлые взаимодействия, результаты и обратная связь пользователей индексируются как воспоминания и извлекаются по сходству, формируя новые решения, что обеспечивает непрерывную персонализацию без переобучения.
In 30 seconds
- What
- Сохраняет прошлые взаимодействия вместе с их исходами и обратной связью, а в момент принятия решения извлекает похожие случаи, чтобы направлять новый выбор без переобучения модели.
- When to use
- Персонализация важна на протяжении повторяющихся взаимодействий, и вы можете собирать надёжные сигналы обратной связи, чтобы взвешивать, какой прошлый опыт переиспользовать.
- Watch out
- Качество извлечения резко падает, если у воспоминаний нет чётких меток исхода или если поиск по сходству затягивает в текущие решения нерелевантные прошлые случаи.
Loading technique guide…