[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-context-window::ru":3,"gloss-cluster-context-window::ru":23,"gloss-next-context-window::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"context-window","core-ai","Контекстное окно","Контекстное окно — это максимальный объём текста, измеряемый в токенах, который LLM может удерживать «в поле зрения» одновременно — включая системный промпт, историю диалога, извлечённые документы и собственный ответ модели. Считайте это рабочей памятью модели для одного запроса. Как только диалог или документ превышает контекстное окно, более старый контент должен быть отброшен, суммирован, либо запрос просто завершится ошибкой. Контекстные окна выросли драматически: ранний GPT-3 предлагал 4K токенов (~3000 слов), тогда как современные топовые модели вроде Claude Sonnet 4.5 и Gemini 2.5 Pro предлагают окна от 200K до 1M+ токенов (сотни тысяч слов — целые кодовые базы или книги). Это напрямую важно для SaaS-разработчиков, проектирующих AI-функции: большое контекстное окно позволяет впихнуть в один промпт больше извлечённых документов, истории диалога или целую кодовую базу без сложного разбиения на части или суммирования — но это не значит «безлимитно и бесплатно». Каждый токен в контекстном окне тарифицируется как входной токен при каждом отдельном вызове (даже если это один и тот же системный промпт, повторённый 50 раз в диалоге), а очень длинные контексты могут увеличивать задержку и иногда снижать точность на информации, погребённой в середине (эффект «потерянности в середине», при котором модели надёжнее обращают внимание на контент ближе к началу и концу контекста). Конкретный пример: кодовому ассистенту с контекстным окном на 200K токенов можно дать целиком среднего размера кодовую базу (скажем, 150K токенов исходных файлов) плюс вопрос на 500 токенов вроде «где логика аутентификации пользователя и обрабатывает ли она обновление токена?» — модель может ответить напрямую, прочитав всю кодовую базу за один проход, что невозможно с окном на 4K, которое потребовало бы разбиения и RAG. Разработчики управляют контекстными окнами с помощью таких техник, как усечение по скользящему окну (отбрасывание самых старых сообщений), суммирование (сжатие старых реплик в более короткое резюме) и RAG (извлечение только релевантного среза вместо загрузки всего) — правильный выбор зависит от того, что важнее для конкретного случая использования: полнота или стоимость\u002Fзадержка. Размер контекстного окна также напрямую связан с уровнями ценообразования: многие поставщики берут больше за токен, когда запрос пересекает определённый порог длины контекста (отражая реально более высокую вычислительную стоимость обработки внимания по большему числу токенов), поэтому разработчик, наивно запихивающий целый 100-страничный документ в каждый запрос, когда релевантна только одна страница, платит и штраф по задержке, и по стоимости за контент, который модели вообще не нужно было видеть. Это основной аргумент в пользу RAG вместо «просто используй окно побольше»: даже при технически доступном окне на 1M токенов извлечение только 3-5 наиболее релевантных фрагментов для данного вопроса почти всегда быстрее, дешевле и часто точнее, чем сваливание всего корпуса в контекст в надежде, что модель найдёт нужную иголку в огромном стоге сена.","Контекстное окно — максимальное число токенов, которое LLM может обработать за один запрос; это кратковременная рабочая память модели.",null,[11,14,17,20],{"slug":12,"name":13},"latency","Задержка (Latency)",{"slug":15,"name":16},"llm","Большая языковая модель (LLM)",{"slug":18,"name":19},"retrieval-augmented-generation","Генерация с дополненным поиском (RAG)",{"slug":21,"name":22},"token","Токен",[24,28,32,36,39,42,45,48,51,54,57,60],{"slug":25,"category":5,"name":26,"updated_at":27},"agentic","Агентный AI (Agentic AI)","2026-08-24T02:46:36+00:00",{"slug":29,"category":5,"name":30,"updated_at":31},"alignment-tax","Налог на выравнивание (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":33,"category":5,"name":34,"updated_at":35},"artificial-intelligence","Искусственный интеллект (ИИ)","2026-08-24T02:46:38+00:00",{"slug":37,"category":5,"name":38,"updated_at":27},"attention","Внимание (Attention)",{"slug":40,"category":5,"name":41,"updated_at":35},"beam-search","Лучевой поиск",{"slug":43,"category":5,"name":44,"updated_at":31},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":46,"category":5,"name":47,"updated_at":31},"catastrophic-forgetting","Катастрофическое забывание (Catastrophic Forgetting)",{"slug":49,"category":5,"name":50,"updated_at":35},"computer-vision","Компьютерное зрение",{"slug":52,"category":5,"name":53,"updated_at":31},"constitutional-ai","Конституционный ИИ (Constitutional AI)",{"slug":55,"category":5,"name":56,"updated_at":35},"deep-learning","Глубокое обучение",{"slug":58,"category":5,"name":59,"updated_at":27},"diffusion-model","Диффузионная модель (Diffusion Model)",{"slug":61,"category":5,"name":62,"updated_at":31},"direct-preference-optimization","Прямая оптимизация предпочтений (DPO)"]