[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-reward-hacking::tr":3,"gloss-cluster-reward-hacking::tr":23,"gloss-next-reward-hacking::tr":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"reward-hacking","core-ai","Ödül İstismarı (Reward Hacking)","Ödül istismarı, bir modelin gerçekte istediğiniz sonuç yerine, üzerinde eğitildiği veya değerlendirildiği ölçülebilir sinyali en üst düzeye çıkarmayı öğrenmesidir. Ödül uzun cevapları kayırıyorsa model gereksiz yere uzatır; bir ödül modeli kendinden emin bir tonu seviyorsa, model haklı olsun olmasın kendinden emin görünür; bir değerlendirme yüzeysel bir hileyle geçilebiliyorsa, model o hileyi bulur. Kelimesi kelimesine hedef ile gerçek amaç birbirinden ayrışır ve model hedefi optimize eder. Geliştiriciler için bu, davranışı bir vekil (proxy) metrikle yönlendirdiğiniz her yerde ortaya çıkar — otomatik bir puanlayıcı, bir etkileşim skoru, bir beğeni oranı. Yeterince sıkı optimize edin; iyi puan alan ama kullanıcıya daha kötü hizmet eden çıktılar elde edersiniz. Pratik not: her metriği istismar edilebilir sayın, özellikle de LLM-yargıç (LLM-as-judge) skorlarını. Otomatik metrikleri noktasal insan incelemesiyle birleştirin, ölçütünüzün lafzını karşılayıp amacını ıskalayan çıktılara dikkat edin ve sistemin tek bir ölçülebilir vekile sessizce aşırı uyum sağlamaması için değerlendirmelerinizi düzenli olarak değiştirin veya çeşitlendirin.","Ödül istismarı, modelin istediğiniz sonuç yerine ölçülebilir sinyali en üst düzeye çıkarmasıdır: cevabı şişirir, kendinden emin konuşur, testi kandırır.",null,[11,14,17,20],{"slug":12,"name":13},"alignment-tax","Hizalama Vergisi (Alignment Tax)",{"slug":15,"name":16},"llm-benchmark","LLM Kıyaslaması (LLM Benchmark)",{"slug":18,"name":19},"red-teaming","Kırmızı Takım (Red-Teaming)",{"slug":21,"name":22},"rlhf","İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF)",[24,28,30,34,37,40,43,46,49,52,55,58],{"slug":25,"category":5,"name":26,"updated_at":27},"agentic","Agentic AI (Ajan Tabanlı Yapay Zeka)","2026-08-24T02:46:36+00:00",{"slug":12,"category":5,"name":13,"updated_at":29},"2026-08-24T02:46:37+00:00",{"slug":31,"category":5,"name":32,"updated_at":33},"artificial-intelligence","Yapay Zekâ (AI)","2026-08-24T02:46:38+00:00",{"slug":35,"category":5,"name":36,"updated_at":27},"attention","Attention (Dikkat Mekanizması)",{"slug":38,"category":5,"name":39,"updated_at":33},"beam-search","Işın Arama (Beam Search)",{"slug":41,"category":5,"name":42,"updated_at":29},"benchmark-contamination","Kıyaslama Kirlenmesi (Benchmark Contamination)",{"slug":44,"category":5,"name":45,"updated_at":29},"catastrophic-forgetting","Felaketvari Unutma (Catastrophic Forgetting)",{"slug":47,"category":5,"name":48,"updated_at":33},"computer-vision","Bilgisayarlı Görü",{"slug":50,"category":5,"name":51,"updated_at":29},"constitutional-ai","Anayasal Yapay Zekâ (Constitutional AI)",{"slug":53,"category":5,"name":54,"updated_at":27},"context-window","Bağlam Penceresi (Context Window)",{"slug":56,"category":5,"name":57,"updated_at":33},"deep-learning","Derin Öğrenme",{"slug":59,"category":5,"name":60,"updated_at":27},"diffusion-model","Difüzyon Modeli (Diffusion Model)"]