[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-kv-cache::tr":3,"gloss-cluster-kv-cache::tr":26,"gloss-next-kv-cache::tr":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"kv-cache","core-ai","KV Önbelleği (KV Cache)","KV önbelleği (anahtar-değer önbelleği), bir LLM'in üretim sırasında işi yeniden hesaplamamak için kullandığı bellektir. Transformer her yeni token'ı üretirken önceki tüm token'ların dikkat anahtarlarına ve değerlerine ihtiyaç duyar; bunları her adımda yeniden hesaplamak yerine önbelleğe alır. Bin'inci token'ı üretmenin hızlı olmasının nedeni budur — ama aynı zamanda bellek, bağlam uzunluğuyla doğrusal olarak büyür; yani uzun bir konuşma veya büyük bir belge, yalnızca önbellek için gigabaytlarca GPU belleği tüketebilir. SaaS geliştiricileri için KV önbelleği pek çok gerçeği açıklar: uzun bağlamların neden daha pahalı ve yavaş olduğunu, tekrar eden sistem prompt'ları için \"prompt önbellekleme\" özelliklerinin (yeniden kullanılan bir önek için KV önbelleğini saklayan) gecikmeyi ve maliyeti neden çarpıcı biçimde düşürdüğünü ve çok sayıda eşzamanlı uzun bağlamlı kullanıcıya hizmet vermenin neden bellekle sınırlı olduğunu. Çıkarım faturanız veya gecikmeniz bağlam uzunluğuyla şişiyorsa, sebebi genellikle KV önbelleğidir — önbelleğe alınmış önekleri yeniden kullanmak ve bağlamı kısaltmak elinizdeki başlıca kaldıraçlardır. Mekanik olarak önbellek, her dikkat katmanının dizideki mevcut token'lar için zaten hesapladığı anahtar ve değer izdüşüm vektörlerini tutar; model bunları bir daha türetmez, her adımda yalnızca en yeni token'ın izdüşümleri taze hesaplanır. Ayak izi hem dizi uzunluğuyla hem de parti (batch) boyutuyla birlikte büyür; bu yüzden tek bir GPU'nun aynı anda kaç isteği taşıyabileceğini belirleyen şey genellikle ağırlıklar değil, önbelleğin kendisidir. Bu kısıt doğrudan fiyat listesine yansır: önbellek baskısı sağlayıcının GPU başına istek sayısını sınırlar, GPU başına istek sayısı da token başına fiyatın altına bir taban çeker. Birkaç sağlayıcının duyurduğu \"önbelleğe alınmış girdi\" indirimlerinin teknik dayanağı da budur. İki yaygın yanılgıyı düzeltmekte fayda var. Birincisi, KV önbelleği varsayılan olarak ayrı API çağrıları arasında kalıcı değildir — etkin ya da yakın zamanda etkin olmuş bir bağlamı işleyen çıkarım sunucusunun belleğinde yaşar; çağrılar arası prompt önbelleklemesinin kendiliğinden gerçekleşen bir şey değil de açıkça sağlayıcı tarafından sunulan bir özellik olmasının nedeni tam olarak budur. İkincisi, daha büyük bir önbellek modeli daha akıllı yapmaz: bu sadece bir verimlilik mekanizmasıdır, yetenek artışı değil; dolayısıyla \"daha çok önbellek\" bir kalite sorununun yanıtı olamaz. Pratikte elinizdeki kaldıraçlar ayarlanabilir değil yapısaldır — prompt'unuzun sabit kısmını (sistem talimatları, birkaç örnek, değişmeyen bir referans belge) en başa koyun ki sağlayıcının önek önbelleği isabet alsın, oynak kısmı sona bırakın ve yuvarlanan bir özet yeterliyken sınırsız konuşma geçmişi eklemekten kaçının. Sunum yığınları parçalanmayı sınırlamak için önbelleği sayfalar hâlinde yönetir; paged attention ile continuous batching'in neredeyse hep birlikte anılmasının sebebi budur. Bağlam penceresiyle karıştırmayın: bağlam penceresi modelin tek seferde ne kadarını görebileceğini söyler, KV önbelleği ise o bağlamı üretim boyunca taşımanın donanım üzerindeki bedelidir.","KV önbelleği, önceki token'ların dikkat anahtar ve değerlerini saklar; böylece LLM onları yeniden hesaplamaz ve uzun bağlamlı üretim ucuzlar.",null,[11,14,17,20,23],{"slug":12,"name":13},"attention","Attention (Dikkat Mekanizması)",{"slug":15,"name":16},"context-window","Bağlam Penceresi (Context Window)",{"slug":18,"name":19},"inference","Çıkarım (Inference)",{"slug":21,"name":22},"latency","Gecikme (Latency)",{"slug":24,"name":25},"prompt-caching","Prompt Önbellekleme",[27,31,35,39,40,43,46,49,52,55,56,59],{"slug":28,"category":5,"name":29,"updated_at":30},"agentic","Agentic AI (Ajan Tabanlı Yapay Zeka)","2026-08-24T02:46:36+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"alignment-tax","Hizalama Vergisi (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":36,"category":5,"name":37,"updated_at":38},"artificial-intelligence","Yapay Zekâ (AI)","2026-08-24T02:46:38+00:00",{"slug":12,"category":5,"name":13,"updated_at":30},{"slug":41,"category":5,"name":42,"updated_at":38},"beam-search","Işın Arama (Beam Search)",{"slug":44,"category":5,"name":45,"updated_at":34},"benchmark-contamination","Kıyaslama Kirlenmesi (Benchmark Contamination)",{"slug":47,"category":5,"name":48,"updated_at":34},"catastrophic-forgetting","Felaketvari Unutma (Catastrophic Forgetting)",{"slug":50,"category":5,"name":51,"updated_at":38},"computer-vision","Bilgisayarlı Görü",{"slug":53,"category":5,"name":54,"updated_at":34},"constitutional-ai","Anayasal Yapay Zekâ (Constitutional AI)",{"slug":15,"category":5,"name":16,"updated_at":30},{"slug":57,"category":5,"name":58,"updated_at":38},"deep-learning","Derin Öğrenme",{"slug":60,"category":5,"name":61,"updated_at":30},"diffusion-model","Difüzyon Modeli (Diffusion Model)"]