mlops
Словарь ↗Батч-инференс
Батч-инференс выполняет запросы к модели как задачу в очереди, а не как интерактивный вызов. Вы отправляете много входов, провайдер обрабатывает их по мере свободных мощностей, а результаты забираются позже — обычно в пределах часов и с крупной скидкой к синхронной цене. Проверка на пригодность простая: кто-нибудь этого ждёт? Классификация вчерашних тикетов, обогащение каталога, генерация эмбеддингов для корпуса, ночная суммаризация документов — за спиннером никто не смотрит, значит задержка ничего не стоит, а скидка становится чистой маржой. Инженерная разница в основном в обработке сбоев. Интерактивный вызов падает громко и повторяется сразу; батч падает частично, спустя часы, когда за клавиатурой никого нет. Пишите результаты инкрементально, привязывайте их к входам, чтобы можно было перезапустить часть, и считайте задачу возобновляемой, а не атомарной. Стратегический смысл для SaaS: батч меняет то, что вообще по карману. Функции, бессмысленные по интерактивным ценам — ночная переоценка каждой записи, прогон оценки по всему корпусу, — становятся рутиной, когда те же токены стоят вдвое дешевле.
Похожие термины