[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-model-serving::ru":3,"gloss-cluster-model-serving::ru":26,"gloss-next-model-serving::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"model-serving","mlops","Обслуживание модели (Model Serving)","Обслуживание модели — это инфраструктурный слой, который ставит обученную модель за API, чтобы приложения могли запрашивать предсказания в реальном времени. Он берёт на себя загрузку весов в память, батчинг входящих запросов, автомасштабирование GPU и предоставление версионированных эндпоинтов. Если обучение — разовое событие, то обслуживание работает вечно, и именно здесь по-настоящему выигрываются или проигрываются задержка, стоимость и надёжность. Когда вы вызываете закрытую модель вроде Claude или GPT, обслуживанием занимается провайдер. Тема становится практической в тот момент, когда вы разворачиваете открытую модель сами: тут в ход идут движки вроде vLLM, Text Generation Inference или NVIDIA Triton либо управляемые платформы Modal, Replicate и Baseten. Батчинг запросов и квантизация резко снижают счёт за GPU на запрос. Практическая заметка: измеряйте хвостовую задержку и стоимость на тысячу запросов, а не только средние — один медленный процентиль способен погубить функцию реального времени, а простаивающие GPU тихо сжигают взлётную полосу стартапа.","Обслуживание модели — слой, который ставит обученную модель за API: грузит веса, батчит запросы, масштабирует GPU и отдаёт версионированные эндпоинты.",null,[11,14,17,20,23],{"slug":12,"name":13},"gpu","GPU (графический процессор)",{"slug":15,"name":16},"inference","Инференс",{"slug":18,"name":19},"latency","Задержка (Latency)",{"slug":21,"name":22},"model-weights","Веса модели",{"slug":24,"name":25},"quantization","Квантизация",[27,31,35,38,41,45,48,51,54,57,60,63],{"slug":28,"category":5,"name":29,"updated_at":30},"annotation-guidelines","Инструкции по разметке","2026-08-24T03:30:02+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"baseline-model","Базовая модель (baseline)","2026-08-24T02:46:38+00:00",{"slug":36,"category":5,"name":37,"updated_at":34},"batch-inference","Батч-инференс",{"slug":39,"category":5,"name":40,"updated_at":34},"canary-prompt","Канареечный промпт",{"slug":42,"category":5,"name":43,"updated_at":44},"champion-challenger","Чемпион–претендент (A\u002FB-тестирование моделей)","2026-08-24T02:46:37+00:00",{"slug":46,"category":5,"name":47,"updated_at":34},"class-imbalance","Дисбаланс классов",{"slug":49,"category":5,"name":50,"updated_at":34},"continuous-batching","Continuous Batching (непрерывная пакетная обработка)",{"slug":52,"category":5,"name":53,"updated_at":34},"cross-validation","Перекрёстная проверка",{"slug":55,"category":5,"name":56,"updated_at":34},"data-labeling","Разметка данных",{"slug":58,"category":5,"name":59,"updated_at":44},"drift-detection","Обнаружение дрейфа (Drift Detection)",{"slug":61,"category":5,"name":62,"updated_at":44},"eval-harness","Испытательный стенд оценки (Eval Harness)",{"slug":64,"category":5,"name":65,"updated_at":44},"experiment-tracking","Трекинг экспериментов (Experiment Tracking)"]