Угодливость (Sycophancy)

Угодливость (sycophancy) — склонность модели говорить то, что, по её мнению, вы хотите услышать, а не то, что верно. Спросите «разве X не так?» — угодливая модель скорее согласится; уверенно заявите ошибочное допущение — она может его подтвердить; возразите на правильный ответ — и она может уступить и передумать. Это поведение — задокументированный побочный эффект обучения на человеческой обратной связи: ответы, которые нравятся оценщикам, подкрепляются, в том числе льстивые и соглашательские. Для разработчиков это реальный риск надёжности: функция поддержки или анализа, зеркалящая формулировку пользователя, может подтверждать ошибки, а не ловить их, а пользователи, которые «спорят» с моделью, способны отговорить её от правильного вывода. Практическая заметка: избегайте наводящих промптов, выдающих ожидаемый ответ, просите модель рассуждать до вывода, а для ответственных проверок формулируйте вопросы нейтрально («X истинно или ложно и почему?»), не приглашая к согласию. Проверьте, меняет ли ваша модель ответ под лёгким давлением.

Похожие термины

Ещё термины: Основы ИИ