[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-train-test-split::ru":3,"gloss-cluster-train-test-split::ru":26,"gloss-next-train-test-split::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"train-test-split","mlops","Разделение на обучение и тест","Разделение на обучение и тест делит набор данных так, чтобы модель училась на одной части, а измерялась на другой, которой никогда не видела. Обычно частей три: обучающая выборка, на которой модель подгоняется, валидационная, по которой сравнивают варианты при настройке, и отложенный тест, к которому прикасаются только в конце. Разделение нужно потому, что оценка модели на данных, на которых она обучалась, измеряет запоминание, а не обобщение: достаточно сложная модель покажет хороший результат на своей обучающей выборке независимо от того, насколько плохо она работает в реальности. За большинством обманчивых результатов стоят две ошибки. Утечка: информация из теста попадает в обучение — напрямую (дубликаты строк, пример, оказавшийся с обеих сторон) или незаметно (признак, посчитанный по всему набору до разделения: статистика нормализации или агрегат, выведенный из целевой переменной). И разбиение, игнорирующее структуру данных. Если примеры сгруппированы — несколько обращений от одного клиента, несколько кадров из одного видео, — случайное разбиение раскладывает почти одинаковые примеры по обе стороны и завышает оценку; делить нужно по группам. Данные с временным порядком требуют той же аккуратности в другой форме: учиться на прошлом и проверяться на будущем, ведь случайное разбиение позволяет модели учиться на ещё не наступивших событиях. Та же логика управляет наборами для оценки языковых моделей: аналог утечки — бенчмарк, содержимое которого попало в данные предобучения, а аналог группового разбиения — тест, собранный из тех же шаблонов промптов, на которых промпт и разрабатывали.","Разделение на обучение и тест меряет модель на невиданных данных: как утечка, сгруппированные строки и временной порядок незаметно завышают оценку.",null,[11,14,17,20,23],{"slug":12,"name":13},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":15,"name":16},"cross-validation","Перекрёстная проверка",{"slug":18,"name":19},"golden-dataset","Золотой датасет",{"slug":21,"name":22},"overfitting","Переобучение (Overfitting)",{"slug":24,"name":25},"supervised-learning","Обучение с учителем",[27,31,35,38,41,45,48,51,52,55,58,61],{"slug":28,"category":5,"name":29,"updated_at":30},"annotation-guidelines","Инструкции по разметке","2026-08-24T03:30:02+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"baseline-model","Базовая модель (baseline)","2026-08-24T02:46:38+00:00",{"slug":36,"category":5,"name":37,"updated_at":34},"batch-inference","Батч-инференс",{"slug":39,"category":5,"name":40,"updated_at":34},"canary-prompt","Канареечный промпт",{"slug":42,"category":5,"name":43,"updated_at":44},"champion-challenger","Чемпион–претендент (A\u002FB-тестирование моделей)","2026-08-24T02:46:37+00:00",{"slug":46,"category":5,"name":47,"updated_at":34},"class-imbalance","Дисбаланс классов",{"slug":49,"category":5,"name":50,"updated_at":34},"continuous-batching","Continuous Batching (непрерывная пакетная обработка)",{"slug":15,"category":5,"name":16,"updated_at":34},{"slug":53,"category":5,"name":54,"updated_at":34},"data-labeling","Разметка данных",{"slug":56,"category":5,"name":57,"updated_at":44},"drift-detection","Обнаружение дрейфа (Drift Detection)",{"slug":59,"category":5,"name":60,"updated_at":44},"eval-harness","Испытательный стенд оценки (Eval Harness)",{"slug":62,"category":5,"name":63,"updated_at":44},"experiment-tracking","Трекинг экспериментов (Experiment Tracking)"]