[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-prompt-compression::ru":3,"gloss-cluster-prompt-compression::ru":20,"gloss-next-prompt-compression::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"prompt-compression","prompt-eng","Сжатие промпта","Сжатие промпта — это практика сокращения количества токенов в промпте — через резюмирование, удаление избыточности, структурное упрощение или специализированные алгоритмы сжатия — при сохранении информации, действительно необходимой модели для точного выполнения задачи. Это становится всё более важной продакшен-задачей по мере того, как приложения всё сильнее опираются на большие контексты (длинная история разговора, документы, извлечённые через RAG, обширные few-shot примеры), поскольку каждый токен в промпте напрямую стоит денег и добавляет задержку при каждом вызове API, а неоправданно длинные промпты, согласно проблеме переполнения контекста, могут и вовсе активно вредить точности, а не помогать ей. Подходы к сжатию варьируются от простых до сложных: ручная подрезка (удаление избыточных инструкций, сведение многословных примеров к их сути, резюмирование длинной истории разговора в текущую сводку вместо повторной отправки каждого предыдущего сообщения дословно); автоматизированное резюмирование (использование более дешёвой, быстрой модели для сжатия длинного документа или блока контекста в более короткую версию перед включением в основной промпт, иногда называемое шагом «map» в цепочке map-reduce); и специализированные исследовательские техники и инструменты сжатия промптов (например, LLMLingua от Microsoft), которые используют меньшую модель для выявления и удаления токенов, наименее способствующих выполнению задачи целевой моделью, достигая значительных коэффициентов сжатия при минимальной потере точности на бенчмарк-задачах. Связанная и всё более важная дополняющая техника — кэширование промптов, предлагаемое крупными провайдерами (Anthropic, OpenAI), которое не сокращает количество токенов, но кэширует обработку статичного префикса промпта (длинный системный промпт, большой справочный документ) между повторными вызовами, резко снижая стоимость и задержку кэшированной части при каждом вызове после первого — это другой рычаг (стоимость\u002Fскорость повторной обработки), чем сжатие (плотность исходной информации), и их часто используют вместе. Для разработчиков SaaS сжатие промптов и кэширование становятся приоритетом, когда ИИ-функция достигает значимого продакшен-объёма, где сокращение числа токенов напрямую переводится в пропорциональную экономию средств в масштабе, а более быстрое время отклика — реальный дифференциатор качества продукта. Разобранный пример: ИИ-ассистент для программирования, включающий целый документ гайда по стилю на 8000 токенов в каждый вызов промпта, переходит на сжатую сводку ключевых правил гайда по стилю на 800 токенов (сгенерированную один раз через промпт резюмирования, затем закэшированную), плюс кэширование промпта для этого блока сводки, чтобы он полностью повторно обрабатывался только раз за сессию, а не при каждом сообщении — сокращая стоимость этой части каждого вызова в совокупности примерно на 90%, без измеримого падения соответствия ассистента ключевым правилам гайда по стилю на их наборе оценки.","Сжатие промпта сокращает количество токенов в промпте — через резюмирование, подрезку или специальные инструменты — сохраняя нужную модели информацию.",null,[11,14,17],{"slug":12,"name":13},"context-stuffing","Переполнение контекста (Context Stuffing)",{"slug":15,"name":16},"context-window","Контекстное окно",{"slug":18,"name":19},"prompt-caching","Кэширование промптов",[21,25,28,31,35,38,41,44,45,48,51,54],{"slug":22,"category":5,"name":23,"updated_at":24},"analogical-prompting","Analogical Prompting","2026-08-24T02:46:37+00:00",{"slug":26,"category":5,"name":27,"updated_at":24},"automatic-prompt-optimization","Автоматическая оптимизация промптов",{"slug":29,"category":5,"name":30,"updated_at":24},"chain-of-density","Цепочка плотности (CoD)",{"slug":32,"category":5,"name":33,"updated_at":34},"chain-of-thought-prompting","Chain-of-thought-промптинг (промптинг с цепочкой рассуждений)","2026-08-24T02:46:36+00:00",{"slug":36,"category":5,"name":37,"updated_at":24},"chain-of-verification","Chain-of-Verification",{"slug":39,"category":5,"name":40,"updated_at":34},"chunking","Чанкинг (Chunking)",{"slug":42,"category":5,"name":43,"updated_at":34},"constrained-decoding","Ограниченное декодирование (Constrained Decoding)",{"slug":12,"category":5,"name":13,"updated_at":34},{"slug":46,"category":5,"name":47,"updated_at":34},"delimiter","Разделитель (Delimiter)",{"slug":49,"category":5,"name":50,"updated_at":24},"directional-stimulus-prompting","Directional Stimulus Prompting",{"slug":52,"category":5,"name":53,"updated_at":24},"emotion-prompting","Emotion Prompting",{"slug":55,"category":5,"name":56,"updated_at":34},"few-shot-prompting","Few-shot-промптинг (промптинг с примерами)"]