Попарная оценка

Попарная оценка (pairwise evaluation) оценивает выводы модели, сравнивая два из них напрямую и спрашивая, какой лучше, вместо выставления каждому абсолютной оценки. Она опирается на известный факт о людях и LLM-судьях: относительные суждения («A или B?») куда стабильнее абсолютных («оцени от 1 до 10»), где оценки плывут и слипаются. Chatbot Arena популяризировала подход в масштабе — собирая попарные голоса между анонимными моделями и превращая их в рейтинги в стиле Elo. Для разработчиков это надёжный способ ответить на вопрос «мой новый промпт или модель реально стали лучше?»: покажите судье (или человеку) старый и новый вывод для каждого случая из набора оценки и посчитайте победы, ничьи и поражения. Контролируйте две вещи: позиционное смещение — судьи склонны предпочитать ответ, идущий первым, поэтому меняйте порядок и усредняйте, — и то, что для ранжирования более чем двух вариантов нужно много сравнений. Сообщайте долю побед с учётом ничьих, а не одну хрупкую усреднённую оценку.

Похожие термины

Ещё термины: Промпт-инжиниринг