core-ai
Словарь ↗Загрязнение бенчмарка (Benchmark Contamination)
Загрязнение бенчмарка (также утечка данных или тестового набора) происходит, когда вопросы и ответы из публичного бенчмарка попадают в обучающие данные модели. Тогда модель «набирает» высокий балл отчасти потому, что запомнила тест, а не потому, что действительно его решает, — как студент, заранее увидевший экзамен. Поскольку передовые модели обучаются на огромных веб-выгрузках, а популярные бенчмарки разбросаны по всему интернету, некоторое загрязнение — обычное дело, и это одна из причин, почему цифры из рейтингов могут завышать реальные способности. Для разработчиков, сравнивающих модели, вывод такой: не выбирайте модель по одним лишь опубликованным баллам бенчмарков. Модель, возглавляющая рейтинг, может оказаться не лучшей на вашей реальной задаче. Практическая заметка: соберите небольшой приватный набор для оценки из собственных реальных входов и ожидаемых выходов, держите его подальше от логов промптов, которые могут пойти в обучение, и сравнивайте кандидатов напрямую на нём. Ваш собственный отложенный набор гораздо надёжнее публичного бенчмарка, который модель, возможно, уже видела.
Похожие термины