[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-inference-latency::ru":3,"gloss-cluster-inference-latency::ru":23,"gloss-next-inference-latency::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"inference-latency","core-ai","Задержка инференса","Задержка инференса — время ответа модели, и это два числа, а не одно. Время до первого токена — пауза, пока не появилось ничего; пропускная способность в токенах в секунду — скорость, с которой приходит остальное. Пользователь ощущает их по-разному, и оптимизация не той метрики тратит усилия впустую.\n\nВ чате восприятие определяет время до первого токена. Ответ, который начинается через 300 мс и течёт четыре секунды, кажется быстрее, чем появившийся целиком через две, — поэтому стриминг это продуктовая функция, а не техническая деталь. В батч-задаче, за которой никто не смотрит, важно только общее время.\n\nОсновной вклад обычно вносит не модель. Длина промпта определяет время префилла, поэтому системный промпт, разросшийся до 4 000 токенов, облагает налогом каждый запрос. Поиск и вызовы инструментов добавляют круговые задержки. Цепочка из трёх вызовов даёт три холодных старта. А роутер, отправляющий сложные запросы в модель побольше, меняет задержку на качество ровно там, где пользователь наименее терпелив.\n\nИзмеряйте p95, а не среднее: среднее прячет хвост, а запоминается именно хвост.","Задержка инференса — это два числа: время до первого токена и скорость выдачи. Первое решает, живой ли продукт, второе — сколько ждать.",null,[11,14,17,20],{"slug":12,"name":13},"cost-per-task","Стоимость задачи",{"slug":15,"name":16},"latency","Задержка (Latency)",{"slug":18,"name":19},"llm","Большая языковая модель (LLM)",{"slug":21,"name":22},"semantic-cache","Семантический кэш",[24,28,32,36,39,42,45,48,51,54,57,60],{"slug":25,"category":5,"name":26,"updated_at":27},"agentic","Агентный AI (Agentic AI)","2026-08-24T02:46:36+00:00",{"slug":29,"category":5,"name":30,"updated_at":31},"alignment-tax","Налог на выравнивание (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":33,"category":5,"name":34,"updated_at":35},"artificial-intelligence","Искусственный интеллект (ИИ)","2026-08-24T02:46:38+00:00",{"slug":37,"category":5,"name":38,"updated_at":27},"attention","Внимание (Attention)",{"slug":40,"category":5,"name":41,"updated_at":35},"beam-search","Лучевой поиск",{"slug":43,"category":5,"name":44,"updated_at":31},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":46,"category":5,"name":47,"updated_at":31},"catastrophic-forgetting","Катастрофическое забывание (Catastrophic Forgetting)",{"slug":49,"category":5,"name":50,"updated_at":35},"computer-vision","Компьютерное зрение",{"slug":52,"category":5,"name":53,"updated_at":31},"constitutional-ai","Конституционный ИИ (Constitutional AI)",{"slug":55,"category":5,"name":56,"updated_at":27},"context-window","Контекстное окно",{"slug":58,"category":5,"name":59,"updated_at":35},"deep-learning","Глубокое обучение",{"slug":61,"category":5,"name":62,"updated_at":27},"diffusion-model","Диффузионная модель (Diffusion Model)"]