Обучение с подкреплением на основе обратной связи от человека (RLHF)

Обучение с подкреплением на основе обратной связи от человека (Reinforcement Learning from Human Feedback, RLHF) — это техника пост-обучения, используемая для выравнивания (alignment) поведения сырой, предобученной LLM с человеческими предпочтениями — превращая модель, которая очень хороша в предсказании правдоподобного следующего токена, в модель, которая по-настоящему полезна, следует инструкциям, избегает вредоносного контента и производит ответы, которые люди предпочитают. Проблема, которую решает RLHF: базовая модель, обученная исключительно предсказывать интернет-текст, охотно продолжит вредоносный запрос, будет бессвязно многословить или подражать (часто низкокачественному) стилю случайного веб-текста, потому что «предсказать следующий токен» и «быть по-настоящему полезным ассистентом» — разные цели. RLHF преодолевает этот разрыв примерно в три этапа. Сначала люди-разметчики ранжируют несколько сгенерированных моделью ответов на один и тот же промпт от лучшего к худшему (например, для данного вопроса ранжируют 4 разных ответа-кандидата). Затем эти данные ранжирования обучают отдельную «модель вознаграждения» (reward model), которая учится предсказывать, какие ответы предпочли бы люди. На третьем этапе исходная LLM дополнительно обучается с помощью обучения с подкреплением (обычно PPO — Proximal Policy Optimization, или более новые методы вроде DPO — Direct Preference Optimization), чтобы максимизировать оценку модели вознаграждения, эффективно направляя вывод модели к тому, что люди оценивали высоко. Это важно для SaaS-разработчиков в основном как контекст того, почему коммерческие LLM (Claude, GPT, Gemini) ведут себя настолько иначе, чем сырые базовые модели — RLHF (и смежные техники вроде Constitutional AI, которую Anthropic использует, чтобы снизить зависимость от разметчиков-людей при оценке вредоносного контента) — вот почему эти модели по умолчанию демонстрируют полезное, безопасное, следующее инструкциям поведение вместо сырого завершения текста. Конкретная иллюстрация: невыровненная базовая модель на запрос «Как вскрыть замок?» может ответить либо бесполезным уклончивым не-ответом, либо чрезмерно детальной инструкцией без какой-либо рамки безопасности, потому что она просто продолжает правдоподобный интернет-текст; модель, выровненная через RLHF, обучена распознавать это как запрос, заслуживающий взвешенного, учитывающего контекст ответа — объясняя легитимные случаи использования (слесари, ситуация, когда вас заперло снаружи), отказываясь при этом предоставлять детальную криминальную инструкцию. Разработчики, дообучающие собственные модели поверх уже прошедшей RLHF базы (например, дообучение GPT-4o-mini), строят поверх этого слоя выравнивания, а не начинают с нуля. Известный компромисс RLHF, о котором разработчикам стоит знать при устранении проблем с поведением модели: обучение выравниванию может иногда делать модель чрезмерно осторожной или уклончивой в пограничных запросах (отказ от разумных запросов, которые лишь напоминают чувствительные темы) — сбой, получивший прозвище «over-refusal» (чрезмерный отказ). Разные поставщики настраивают этот баланс по-разному, что является одной из реальных причин, почему выбор модели важен не только по бенчмаркам сырых способностей — модель, чрезмерно консервативная для легитимного случая использования (например, SaaS-инструмент медицинской информации, которому нужно фактически обсуждать симптомы), может потребовать более тщательно ограниченного системного промпта, дополнительного контекста, устанавливающего легитимность намерения, или в некоторых случаях другого поставщика, чья настройка выравнивания лучше подходит для этой области.

Похожие термины

Ещё термины: Основы ИИ