mlops
Словарь ↗Разметка данных
Разметка данных — работа по присвоению каждому примеру в наборе правильного ответа, чтобы модель можно было на нём обучить или проверить: пометить обращение как биллинг или баг, обвести дефект рамкой, приписать расшифровке намерение, оценить ответ модели как приемлемый. Это самая невзрачная и самая решающая часть большинства прикладных ML-проектов, потому что модель не может быть последовательнее разметки, на которой училась: шумные метки ставят жёсткий потолок измеримого качества, который не пробивается никакой настройкой модели. Успех разметки определяют три вещи. Письменная инструкция, разбирающая не только очевидные, но и спорные случаи, — расхождения почти всегда касаются пограничных ситуаций, которые никто не описал. Измеренный уровень согласия между разметчиками, показывающий, достаточно ли вообще определена задача, прежде чем её масштабировать. И цикл проверки, потому что качество меток падает на длинных сменах и дрейфует по мере переосмысления инструкции. В работе с языковыми моделями разметка не исчезла, а сместилась. Меньше её уходит в обучающие данные и больше — в наборы для оценки, попарные сравнения и критерии приёмки, то есть в те размеченные примеры, которые решают, помогло ли изменение промпта или модели. Метки, сгенерированные моделью, дёшево поднимают набор с нуля, но честным его держит проверенный человеком срез: модель, оценивающая вывод собственного рода, наследует его слепые зоны.
Похожие термины