[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-chunking::ru":3,"gloss-cluster-chunking::ru":20,"gloss-next-chunking::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"chunking","prompt-eng","Чанкинг (Chunking)","Чанкинг — это процесс разбиения большого документа или массива текста на более мелкие, управляемые части («чанки») перед обработкой ИИ-конвейером — чаще всего это подготовительный этап для retrieval-augmented generation (RAG), где документы нужно разбить на чанки, достаточно небольшие, чтобы каждый можно было отдельно превратить в эмбеддинг, проиндексировать в векторной базе данных и извлечь по релевантности, но при этом достаточно крупные, чтобы каждый чанк сохранял достаточно окружающего контекста и оставался самостоятельно осмысленным, когда позже вставляется в промпт без исходного контекста документа. Стратегия чанкинга оказывает непропорционально большое, часто недооцениваемое влияние на качество RAG-системы: если чанк слишком мал (одно предложение или фрагмент абзаца), извлечённым чанкам часто не хватает окружающего контекста, необходимого для полного или однозначного ответа на вопрос, даже когда этап извлечения правильно определяет нужную общую область документа; если чанк слишком велик (целый раздел документа на несколько страниц), эмбеддинг, представляющий этот чанк, становится размытым усреднением множества разных подтем, что снижает точность семантического поиска, а также впустую расходует бюджет контекстного окна на нерелевантный окружающий материал после извлечения в промпт (что напрямую связано с проблемой переполнения контекста). Распространённые стратегии чанкинга включают: чанкинг фиксированного размера (разбиение через каждые N токенов, простое, но наивно режущее предложения или абзацы посреди мысли), рекурсивный\u002Fструктурный чанкинг (разбиение по естественным границам документа — абзацам, затем предложениям, если абзац всё ещё слишком велик — лучше сохраняющий смысловую целостность, чем разбиение фиксированного размера), семантический чанкинг (использование сходства эмбеддингов между соседними предложениями для обнаружения реальных границ тем и разбиения именно там, а не в произвольном месте по размеру) и чанкинг с перекрытием (каждый чанк включает небольшое перекрывающееся окно текста из соседнего чанка, так что информация рядом с границей чанка не теряется и не остаётся оторванной от контекста с обеих сторон). Для разработчиков SaaS, создающих любую ИИ-функцию поверх корпуса документов — чат-бота для вопросов по документации, инструмента анализа контрактов, ассистента поиска по базе знаний — стратегия чанкинга является одним из самых выгодных, но часто недофинансируемых рычагов качества RAG, зачастую влияющим на итоговую точность больше, чем выбор модели эмбеддингов или LLM, используемых далее. Конкретный пример: SaaS-инструмент чат-бота документации изначально разбивает статьи справочного центра на фиксированные окна по 500 токенов без учёта структуры, и пользователи сообщают, что бот часто даёт неполные ответы на процедурные вопросы «как сделать...» — потому что граница чанка фиксированного размера часто попадает в середину нумерованного списка шагов, извлекая только шаги 1-3 из 6-шагового процесса, в то время как шаги 4-6 оказываются в следующем чанке, который не извлекается. Переход на структурный чанкинг (разбиение по заголовкам markdown с сохранением каждого полного нумерованного списка или процедуры целиком в одном чанке, с перекрытием в 50 токенов на границах) заметно улучшает полноту ответов на их оценочном наборе без каких-либо изменений в модели эмбеддингов, ретривере или промпте генерации — явная демонстрация того, что именно стратегия чанкинга была узким местом точности.","Чанкинг — это разбиение крупных документов на более мелкие, семантически цельные части перед превращением в эмбеддинги, извлечением или вставкой в промпт.",null,[11,14,17],{"slug":12,"name":13},"context-stuffing","Переполнение контекста (Context Stuffing)",{"slug":15,"name":16},"embedding","Эмбеддинг (векторное представление)",{"slug":18,"name":19},"retrieval-augmented-generation","Генерация с дополненным поиском (RAG)",[21,25,28,31,35,38,41,42,45,48,51,54],{"slug":22,"category":5,"name":23,"updated_at":24},"analogical-prompting","Analogical Prompting","2026-08-24T02:46:37+00:00",{"slug":26,"category":5,"name":27,"updated_at":24},"automatic-prompt-optimization","Автоматическая оптимизация промптов",{"slug":29,"category":5,"name":30,"updated_at":24},"chain-of-density","Цепочка плотности (CoD)",{"slug":32,"category":5,"name":33,"updated_at":34},"chain-of-thought-prompting","Chain-of-thought-промптинг (промптинг с цепочкой рассуждений)","2026-08-24T02:46:36+00:00",{"slug":36,"category":5,"name":37,"updated_at":24},"chain-of-verification","Chain-of-Verification",{"slug":39,"category":5,"name":40,"updated_at":34},"constrained-decoding","Ограниченное декодирование (Constrained Decoding)",{"slug":12,"category":5,"name":13,"updated_at":34},{"slug":43,"category":5,"name":44,"updated_at":34},"delimiter","Разделитель (Delimiter)",{"slug":46,"category":5,"name":47,"updated_at":24},"directional-stimulus-prompting","Directional Stimulus Prompting",{"slug":49,"category":5,"name":50,"updated_at":24},"emotion-prompting","Emotion Prompting",{"slug":52,"category":5,"name":53,"updated_at":34},"few-shot-prompting","Few-shot-промптинг (промптинг с примерами)",{"slug":55,"category":5,"name":56,"updated_at":24},"generated-knowledge-prompting","Generated Knowledge Prompting"]