Задержка инференса

Задержка инференса — время ответа модели, и это два числа, а не одно. Время до первого токена — пауза, пока не появилось ничего; пропускная способность в токенах в секунду — скорость, с которой приходит остальное. Пользователь ощущает их по-разному, и оптимизация не той метрики тратит усилия впустую. В чате восприятие определяет время до первого токена. Ответ, который начинается через 300 мс и течёт четыре секунды, кажется быстрее, чем появившийся целиком через две, — поэтому стриминг это продуктовая функция, а не техническая деталь. В батч-задаче, за которой никто не смотрит, важно только общее время. Основной вклад обычно вносит не модель. Длина промпта определяет время префилла, поэтому системный промпт, разросшийся до 4 000 токенов, облагает налогом каждый запрос. Поиск и вызовы инструментов добавляют круговые задержки. Цепочка из трёх вызовов даёт три холодных старта. А роутер, отправляющий сложные запросы в модель побольше, меняет задержку на качество ровно там, где пользователь наименее терпелив. Измеряйте p95, а не среднее: среднее прячет хвост, а запоминается именно хвост.

Похожие термины

Ещё термины: Основы ИИ