GPU (графический процессор)

GPU (Graphics Processing Unit, графический процессор) — это процессор, изначально разработанный для рендеринга графики, который оказался исключительно хорошо приспособлен к массово-параллельному перемножению матриц, требуемому нейросетями — один GPU может выполнять тысячи простых арифметических операций одновременно на своих многочисленных ядрах, тогда как у CPU лишь несколько ядер, оптимизированных для последовательных задач общего назначения. Именно это архитектурное соответствие сделало GPU (особенно чипы NVIDIA для дата-центров вроде A100 и H100) базовым оборудованием современной AI-индустрии — как для обучения крупных моделей (требующего огромных параллельных вычислений на протяжении недель), так и для инференса (запуска обученных моделей для обслуживания пользовательских запросов, где пропускная способность памяти GPU и параллельная производительность определяют, насколько быстро и сколько запросов можно обслуживать одновременно). Это важно для разработчиков SaaS в нескольких прямых отношениях. Если вы вызываете размещённый API LLM (Claude, GPT, Gemini), стоимость и доступность GPU — проблема провайдера, но она заложена в цену за токен — дефицит и стоимость GPU являются главной причиной, почему ценообразование на API топовых моделей именно такое, и почему меньшие/дистиллированные/квантованные модели (которым требуется меньше видеопамяти и вычислений GPU на запрос) настолько дешевле в вызове. Если вы самостоятельно размещаете модель с открытыми весами (Llama, Mistral) по соображениям суверенитета данных или стоимости при масштабе, выбор GPU становится прямым, первостепенным инфраструктурным решением: количество параметров модели и точность вычислений (квантована она или нет) определяет, сколько видеопамяти GPU вам нужно, что, в свою очередь, определяет, нужен ли вам один потребительский GPU, один дата-центровый GPU или мультиGPU-кластер с быстрыми межсоединениями. Конкретный пример: стартап, самостоятельно размещающий модель с 13 млрд параметров в FP16, нуждается примерно в 26 ГБ видеопамяти GPU только для загрузки весов, плюс накладные расходы на контекстное окно и батчинг — это комфортно помещается на одном NVIDIA A100 (вариант на 40 или 80 ГБ), тогда как та же модель с полной точностью при 70 млрд параметров требует примерно 140 ГБ, что требует либо нескольких GPU с параллелизмом модели, либо агрессивного квантования, чтобы уместиться на более дешёвом оборудовании. Доступность и цена GPU (спотовые против выделенных облачных инстансов или долгосрочная резервируемая мощность) стали настоящим стратегическим ограничением для AI-ориентированных стартапов, а не просто строкой расходов. Для команд, взвешивающих самостоятельный хостинг против доступа через API чисто по стоимости, точка безубыточности сильно зависит от объёма и утилизации: ценообразование API включает стоимость GPU провайдера плюс маржу, но не требует первоначальных вложений или риска простаивающих мощностей, тогда как самостоятельный хостинг требует либо покупки оборудования (крупные первоначальные затраты, текущая амортизация), либо аренды облачных GPU-инстансов (которые дороги за час при низкой утилизации, поскольку GPU оплачиваются независимо от того, обслуживают ли они запросы активно) — самостоятельный хостинг обычно становится экономически выгодным только при устойчиво высоком объёме, когда фиксированная стоимость GPU амортизируется на достаточном количестве запросов, чтобы превзойти цену API за токен, поэтому большинство SaaS-продуктов при значимом масштабе по умолчанию выбирают доступ через API, а не управление собственным парком GPU.

Похожие термины

Ещё термины: Основы ИИ