core-ai
Словарь ↗Прямая оптимизация предпочтений (DPO)
Прямая оптимизация предпочтений (DPO) — метод обучения модели человеческим предпочтениям напрямую на парах ранжированных ответов — «лучшем» и «худшем» — без отдельной модели вознаграждения и цикла обучения с подкреплением, которых требует классический RLHF. Предложенный в 2023 году, он превращает настройку по предпочтениям в более простую задачу, близкую к обучению с учителем, что делает её дешевле, стабильнее и проще в запуске, чем полный конвейер RLHF. Для разработчиков DPO — причина, по которой дообучение модели на собственных данных о предпочтениях стало гораздо доступнее: вместо того чтобы поднимать целый RL-стек, вы собираете примеры хороших и плохих выходов для своего сценария и оптимизируете модель в сторону хороших. Многие открытые инструктивные модели теперь выравниваются с помощью DPO или его вариантов. Практическая заметка: DPO хорош ровно настолько, насколько хороши ваши пары предпочтений — шумные, противоречивые или нерепрезентативные сравнения учат не тому, поэтому вкладывайтесь в чистую, продуманную разметку, а не в объём.
Похожие термины