[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-vram::ru":3,"gloss-cluster-vram::ru":23,"gloss-next-vram::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"vram","core-ai","VRAM (видеопамять)","VRAM — это выделенная память с высокой пропускной способностью, размещённая прямо на GPU; во время обучения или инференса в ней лежат веса модели, активации, возникающие при прохождении данных через сеть, и KV-кэш, накапливаемый за одну генерацию. Её объём — жёсткое ограничение, а не вопрос предпочтений по производительности: если рабочий набор не помещается, модель на этом устройстве не запустится вовсе, и никакое терпение этого не компенсирует. Именно эта бинарность объясняет, почему VRAM оказывается первым числом, которое команды проверяют, оценивая, можно ли разместить конкретную модель с открытыми весами на своём или арендованном железе, и почему облачные GPU-инстансы принято тарифицировать и выбирать по объёму памяти больше, чем по любой другой отдельной характеристике. Отсюда же растут два самых распространённых обходных приёма во всём стеке: квантизация, уменьшающая занимаемый весами объём за счёт снижения числовой точности, и параллелизм модели, разделяющий одну модель между несколькими GPU, чтобы её удержала их суммарная память. Две детали регулярно подводят людей. Требования к VRAM не масштабируются строго линейно от числа параметров при фиксированной точности: память под активации, накладные расходы фреймворка и прежде всего KV-кэш, растущий одновременно с длиной контекста и размером батча, существенно добавляются к голому объёму весов, — поэтому модель, которая на бумаге вроде бы впритык помещается, чаще всего не помещается, стоит начать обслуживать реальный параллельный трафик на длинном контексте. И достаточный для загрузки модели объём VRAM не гарантирует приемлемой скорости. Пропускная способность памяти и вычислительная производительность — независимые свойства карты, так что GPU с щедрым объёмом, но скромной пропускной способностью загрузит крупную модель и всё равно будет медленно выдавать токены. Это частый и дорогой сюрприз при выборе железа по одной лишь ёмкости. KV-кэш заслуживает отдельного упоминания: именно он масштабируется вместе с вашим трафиком, а не с выбором модели, и именно он ломает планирование ёмкости, сделанное на тихой машине разработчика. Веса — фиксированная стоимость с момента выбора модели; кэш — переменная, растущая с каждым параллельным пользователем и каждым дополнительным токеном контекста. А значит, развёртывание, спокойно работавшее в тестах, способно упереться в потолок памяти под продакшн-конкурентностью на длинных контекстах, притом что в самой модели ничего не изменилось. Планируйте ёмкость по худшему реалистичному сочетанию длины контекста и конкурентности, а не по одним весам. Если цифры не сходятся, порядок рычагов примерно такой: квантизовать веса, ограничить или резюмировать контекст, снизить предельную конкурентность на устройство и только затем делить модель между GPU — параллелизм добавляет накладные расходы на обмен и операционную сложность, которых предыдущие варианты не несут.","VRAM — собственная быстрая память GPU, где лежат веса, активации и KV-кэш; обычно именно она задаёт жёсткий предел моделям для самостоятельного хостинга.",null,[11,14,17,20],{"slug":12,"name":13},"gpu","GPU (графический процессор)",{"slug":15,"name":16},"inference","Инференс",{"slug":18,"name":19},"kv-cache","KV-кэш (KV Cache)",{"slug":21,"name":22},"quantization","Квантизация",[24,28,32,36,39,42,45,48,51,54,57,60],{"slug":25,"category":5,"name":26,"updated_at":27},"agentic","Агентный AI (Agentic AI)","2026-08-24T02:46:36+00:00",{"slug":29,"category":5,"name":30,"updated_at":31},"alignment-tax","Налог на выравнивание (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":33,"category":5,"name":34,"updated_at":35},"artificial-intelligence","Искусственный интеллект (ИИ)","2026-08-24T02:46:38+00:00",{"slug":37,"category":5,"name":38,"updated_at":27},"attention","Внимание (Attention)",{"slug":40,"category":5,"name":41,"updated_at":35},"beam-search","Лучевой поиск",{"slug":43,"category":5,"name":44,"updated_at":31},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":46,"category":5,"name":47,"updated_at":31},"catastrophic-forgetting","Катастрофическое забывание (Catastrophic Forgetting)",{"slug":49,"category":5,"name":50,"updated_at":35},"computer-vision","Компьютерное зрение",{"slug":52,"category":5,"name":53,"updated_at":31},"constitutional-ai","Конституционный ИИ (Constitutional AI)",{"slug":55,"category":5,"name":56,"updated_at":27},"context-window","Контекстное окно",{"slug":58,"category":5,"name":59,"updated_at":35},"deep-learning","Глубокое обучение",{"slug":61,"category":5,"name":62,"updated_at":27},"diffusion-model","Диффузионная модель (Diffusion Model)"]