prompt-eng
Словарь ↗LLM в роли судьи (LLM-as-Judge)
LLM в роли судьи (LLM-as-judge) — это техника оценки, при которой сама большая языковая модель используется для оценки, критики или сравнения выводов другого вызова модели (или двух разных версий промпта, применённых к одному и тому же входу) согласно определённой рубрике, заданной в промпте самого судьи, — специализированное применение паттерна мета-промпта, используемое конкретно для автоматизации оценки качества в масштабе, недостижимом для ручной проверки человеком. Это стало одним из важнейших инструментов в продакшен-промпт-инжиниринге и рабочих процессах разработки ИИ-продуктов, потому что традиционное тестирование ПО (утверждения точного совпадения) плохо работает для свободного текста, недетерминированного вывода LLM — два правильных резюме одного и того же документа могут быть сформулированы совершенно по-разному, поэтому нельзя просто утверждать «вывод равен ожидаемой строке». LLM-как-судья заполняет этот пробел, используя собственную способность модели понимать язык для оценки более нюансированных качеств: фактическую точность относительно эталона, соответствие заданному тону или формату, полезность, лаконичность, или прямое сравнение двух кандидатских выводов («Ответ A против Ответа B: какой лучше отвечает на вопрос пользователя? Ответь A, B или НИЧЬЯ»). Используется для попарного сравнения (решение, лучше ли новая версия промпта текущей продакшен-версии на наборе оценки), абсолютной оценки (оценка одного вывода по шкале 1-10 согласно рубрике, полезно для отслеживания трендов качества со временем) и оценки на основе эталона (сравнение ответа модели с известным правильным ответом для задач фактической точности). Хорошо известное ограничение состоит в том, что у судей-LLM есть собственные предвзятости — тенденция отдавать предпочтение более длинным ответам (предвзятость к многословности), отдавать предпочтение ответам, похожим на собственный стиль письма судьи (предвзятость самопредпочтения, когда судья и генератор — одно семейство моделей), и позиционная предвзятость в попарных сравнениях (предпочтение того ответа, который представлен первым) — поэтому зрелые схемы оценки рандомизируют порядок ответов, периодически валидируют оценки судьи по выборке реальных человеческих оценок и иногда используют другую, как правило более сильную модель в качестве судьи, чем оцениваемая, чтобы снизить предвзятость самопредпочтения. Разобранный пример: команда, поддерживающая генератор ответов на клиентские письма с ИИ, хочет сравнить новую версию промпта с текущей продакшен-версией на 300 исторических обращениях в поддержку перед принятием решения о выкатке. Ручное прочтение 600 пар ответов непрактично для рутинного изменения промпта, поэтому они строят оценку LLM-как-судья: «Дано это обращение клиента и два кандидатских ответа агента, оцени каждый по шкале 1-10 по полезности и профессионализму, затем укажи, какой лучше в целом. ОБРАЩЕНИЕ: {{ticket}}. ОТВЕТ A: {{response_a}}. ОТВЕТ B: {{response_b}}». Запущенный на всех 300 парах с рандомизированным порядком ответов для контроля позиционной предвзятости, новый вариант побеждает со счётом 214-86 — результат, дающий команде количественную, масштабируемую уверенность для выкатки, выборочно сверенный с выборкой из 20 обращений, проверенных человеком, чтобы подтвердить, что оценка судьи соответствует реальной человеческой оценке качества.
Похожие термины