[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-prompt-caching::ru":3,"gloss-cluster-prompt-caching::ru":20,"gloss-next-prompt-caching::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"prompt-caching","prompt-eng","Кэширование промптов","Кэширование промптов — это функция API, предлагаемая Anthropic, OpenAI и другими провайдерами, которая позволяет обработать один раз и закэшировать на стороне сервера статичную, повторяющуюся часть промпта (длинный системный промпт, справочные документы, few-shot примеры или определения инструментов), так что последующие вызовы API, повторно использующие идентичный префикс, полностью пропускают повторную обработку этой части — резко снижая как стоимость (закэшированные входные токены тарифицируются с крутой скидкой, часто на 90% дешевле), так и задержку (пропуск вычислений по закэшированному префиксу ускоряет время до первого токена) для любого приложения, которое многократно отправляет большие объёмы неизменяемого контекста. Это напрямую решает один из крупнейших скрытых центров затрат в продакшен-приложениях на LLM: многие реальные промпты состоят из большой стабильной части (системные инструкции, выдержка из базы знаний, обширный набор few-shot примеров, определения инструментов\u002Fфункций) плюс небольшой переменной части (собственно сообщение пользователя), и без кэширования вся стабильная часть полностью повторно обрабатывается и тарифицируется при каждом отдельном вызове, даже если она не изменилась. Например, реализация Anthropic позволяет разработчикам помечать конкретные точки разрыва промпта как кэшируемые, при этом кэш сохраняется в течение короткого окна (как правило, около 5 минут, обновляясь при каждом использовании, некоторые провайдеры предлагают варианты кэша с более длительным сроком по другой цене) — это означает, что сессия чата или всплеск связанных вызовов API в течение этого окна получает существенную выгоду, тогда как для по-настоящему новых сессий преимущества кэша сбрасываются после истечения окна. Для разработчиков SaaS кэширование промптов — одна из оптимизаций с самой высокой отдачей и наименьшими усилиями, доступных, как только ИИ-функция получает реальный продакшен-трафик: обычно требуется лишь реструктурировать промпт так, чтобы статичная часть шла первой и была явно помечена как кэшируемая, без изменения содержимого промпта или поведения модели, что делает это почти «бесплатным» выигрышем по стоимости и задержке по сравнению со сжатием (которое требует реального укорачивания контента и рискует потерей информации) или понижением модели (которое рискует потерей точности). Разобранный пример: SaaS-инструмент для анализа юридических документов отправляет системный промпт на 12 000 токенов (детальная рубрика юридического анализа плюс 8 few-shot примеров) с каждым запросом на рецензирование документа и обрабатывает примерно 3000 документов в день. Без кэширования этот префикс на 12 000 токенов полностью тарифицируется и повторно обрабатывается 3000 раз в день. При включённом кэшировании промптов и статичной рубрике\u002Fпримерах, помеченных как кэшируемый префикс, только первый запрос в каждом окне кэша платит полную цену за этот префикс — последующие запросы в течение окна кэша вместо этого платят по крутой скидке за чтение из кэша, — сокращая ежедневные затраты команды на входные токены более чем вдвое без каких-либо изменений в фактическом качестве анализа, поскольку закэшированный контент побайтово идентичен тому, что всё равно было бы повторно обработано.","Кэширование промптов позволяет API повторно использовать обработанный повторяющийся префикс промпта между вызовами, снижая стоимость и задержку.",null,[11,14,17],{"slug":12,"name":13},"context-stuffing","Переполнение контекста (Context Stuffing)",{"slug":15,"name":16},"context-window","Контекстное окно",{"slug":18,"name":19},"prompt-compression","Сжатие промпта",[21,25,28,31,35,38,41,44,45,48,51,54],{"slug":22,"category":5,"name":23,"updated_at":24},"analogical-prompting","Analogical Prompting","2026-08-24T02:46:37+00:00",{"slug":26,"category":5,"name":27,"updated_at":24},"automatic-prompt-optimization","Автоматическая оптимизация промптов",{"slug":29,"category":5,"name":30,"updated_at":24},"chain-of-density","Цепочка плотности (CoD)",{"slug":32,"category":5,"name":33,"updated_at":34},"chain-of-thought-prompting","Chain-of-thought-промптинг (промптинг с цепочкой рассуждений)","2026-08-24T02:46:36+00:00",{"slug":36,"category":5,"name":37,"updated_at":24},"chain-of-verification","Chain-of-Verification",{"slug":39,"category":5,"name":40,"updated_at":34},"chunking","Чанкинг (Chunking)",{"slug":42,"category":5,"name":43,"updated_at":34},"constrained-decoding","Ограниченное декодирование (Constrained Decoding)",{"slug":12,"category":5,"name":13,"updated_at":34},{"slug":46,"category":5,"name":47,"updated_at":34},"delimiter","Разделитель (Delimiter)",{"slug":49,"category":5,"name":50,"updated_at":24},"directional-stimulus-prompting","Directional Stimulus Prompting",{"slug":52,"category":5,"name":53,"updated_at":24},"emotion-prompting","Emotion Prompting",{"slug":55,"category":5,"name":56,"updated_at":34},"few-shot-prompting","Few-shot-промптинг (промптинг с примерами)"]