core-ai
Sözlük ↗GPU (Grafik İşleme Birimi)
GPU (Grafik İşleme Birimi), başlangıçta grafik render etmek için tasarlanmış ancak sinir ağlarının gerektirdiği türden büyük ölçekli paralel matris çarpımına olağanüstü uygun olduğu ortaya çıkan bir işlemcidir — tek bir GPU, birçok çekirdeği boyunca aynı anda binlerce basit aritmetik işlem gerçekleştirebilir; oysa bir CPU'nun sıralı, genel amaçlı görevler için optimize edilmiş yalnızca birkaç çekirdeği vardır. Bu mimari uyum, GPU'ların (özellikle NVIDIA'nın A100 ve H100 gibi veri merkezi çiplerinin) hem büyük modelleri eğitmek (haftalarca süren muazzam paralel hesaplama gerektirir) hem de çıkarım (eğitilmiş modelleri kullanıcı isteklerine hizmet vermek için çalıştırmak; GPU bellek bant genişliği ve paralel verimin kaç isteğin ne kadar hızlı eş zamanlı olarak sunulabileceğini belirlediği) için modern AI endüstrisinin temel donanımı haline gelmesinin nedenidir. Bu, SaaS geliştiricileri için birkaç doğrudan açıdan önemlidir. Barındırılan bir LLM API'sini (Claude, GPT, Gemini) çağırıyorsanız, GPU maliyeti ve erişilebilirliği sağlayıcının sorunudur ama token başına fiyatlandırmanıza gömülüdür — GPU kıtlığı ve maliyeti, sınır model API fiyatlandırmasının neden böyle olduğunun önemli bir nedenidir ve neden daha küçük/damıtılmış/nicelenmiş modellerin (istek başına daha az GPU belleği ve hesaplama gerektiren) çağırmanın çok daha ucuz olduğunun nedenidir. Veri egemenliği veya ölçekte maliyet nedenleriyle açık ağırlıklı bir modeli (Llama, Mistral) kendiniz barındırıyorsanız, GPU seçimi doğrudan, birinci dereceden bir altyapı kararı haline gelir: bir modelin parametre sayısı ve hassasiyeti (nicelenmiş olup olmadığı), ne kadar GPU VRAM'e ihtiyacınız olduğunu belirler; bu da tek bir tüketici GPU'suna mı, tek bir veri merkezi GPU'suna mı yoksa hızlı ara bağlantılara sahip çoklu GPU kümesine mi ihtiyacınız olduğunu belirler. Somut bir örnek: 13B parametreli bir modeli FP16'da kendi kendine barındıran bir girişim, yalnızca ağırlıkları yüklemek için yaklaşık 26GB GPU VRAM'e, artı bağlam penceresi ve batching için ek yüke ihtiyaç duyar — bu, tek bir NVIDIA A100'e (40GB veya 80GB varyantı) rahatça sığar; oysa aynı model 70B parametrede tam hassasiyette yaklaşık 140GB gerektirir, bu da ya model paralelliğine sahip birden fazla GPU ya da daha ucuz donanıma sığmak için agresif niceleme gerektirir. GPU erişilebilirliği ve fiyatlandırması (spot ile talep üzerine bulut örnekleri veya uzun vadeli rezerve kapasite), AI ağırlıklı girişimler için gerçek bir stratejik kısıtlama haline gelmiştir, yalnızca bir maliyet kalemi değil. Kendi kendine barındırma ile API erişimini yalnızca maliyet açısından tartan ekipler için, başabaş noktası büyük ölçüde hacme ve kullanım oranına bağlıdır: API fiyatlandırması, sağlayıcının GPU maliyetini artı marjı içerir ama sıfır ön yatırım veya boşta kapasite riski gerektirir; kendi kendine barındırma ise ya donanım satın almayı (büyük ön maliyet, devam eden amortisman) ya da bulut GPU örnekleri kirlamayı (kullanım düşükse saat başına pahalıdır, çünkü GPU'lar aktif olarak isteklere hizmet etseler de etmeseler de faturalandırılır) gerektirir — kendi kendine barındırma tipik olarak yalnızca sürdürülebilir yüksek hacimde maliyet açısından etkili hale gelir; burada sabit GPU maliyeti, API token başına fiyatlandırmasını yenecek kadar çok istek üzerinden amorti edilir — bu yüzden anlamlı ölçekteki çoğu SaaS ürünü, kendi GPU filolarını yönetmek yerine varsayılan olarak API erişimini seçer.
İlgili terimler