[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-llm-as-judge::tr":3,"gloss-cluster-llm-as-judge::tr":20,"gloss-next-llm-as-judge::tr":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"llm-as-judge","prompt-eng","Hakem Olarak LLM (LLM-as-Judge)","Hakem olarak LLM (LLM-as-judge), bir büyük dil modelinin kendisinin, hakemin kendi promptunda sağlanan tanımlanmış bir kritere göre başka bir model çağrısının çıktılarını (veya aynı girdiye uygulanan iki farklı prompt sürümünü) puanlamak, eleştirmek veya karşılaştırmak için kullanıldığı bir değerlendirme tekniğidir -meta prompt deseninin, özellikle manuel insan incelemesinin pratik olarak eşleşemeyeceği bir ölçekte kalite değerlendirmesini otomatikleştirmek için kullanılan özelleşmiş bir uygulamasıdır. Bu, üretim prompt mühendisliği ve yapay zeka ürün geliştirme iş akışlarındaki en önemli araçlardan biri haline gelmiştir çünkü geleneksel yazılım testi (tam eşleşme iddiaları) serbest metin, deterministik olmayan LLM çıktısı için iyi çalışmaz -aynı belgenin iki doğru özeti tamamen farklı şekilde ifade edilebilir, bu yüzden basitçe \"çıktı beklenen dizeye eşittir\" diye iddia edemezsiniz. Hakem olarak LLM, bir modelin kendi dil anlama yeteneğini daha nüanslı nitelikleri değerlendirmek için kullanarak bu boşluğu doldurur: bir referansa göre olgusal doğruluk, belirtilen bir ton veya formata uyum, yardımseverlik, özlülük veya iki aday çıktı arasında kafa kafaya bir karşılaştırma (\"Yanıt A vs Yanıt B: hangisi kullanıcının sorusunu daha iyi ele alıyor? A, B veya EŞİT ile yanıt ver\"). İkili karşılaştırma (yeni bir prompt sürümünün bir değerlendirme kümesi genelinde mevcut üretim sürümünden daha iyi olup olmadığına karar vermek), mutlak puanlama (bir kritere göre tek bir çıktıyı 1-10 arasında derecelendirmek, zaman içinde kalite trendlerini izlemek için yararlı) ve referans tabanlı derecelendirme (olgusal doğruluk görevleri için bir modelin cevabını bilinen doğru bir cevapla karşılaştırmak) için kullanılır. İyi bilinen bir sınırlama, LLM hakemlerin kendi önyargılarına sahip olmasıdır -daha uzun yanıtları tercih etme eğilimi (ayrıntılılık önyargısı), hakemin kendi yazı stiline benzeyen yanıtları tercih etme (hakem ve üretici aynı model ailesi olduğunda öz-tercih önyargısı) ve ikili karşılaştırmalarda konumsal önyargı (hangi yanıt önce sunulursa onu tercih etme)- bu yüzden olgun değerlendirme kurulumları yanıt sırasını rastgeleleştirir, zaman zaman hakem puanlarını gerçek insan derecelendirmelerinin bir örneğine karşı doğrular ve öz-tercih önyargısını azaltmak için bazen değerlendirilen modelden farklı, tipik olarak daha güçlü bir modeli hakem olarak kullanır. Somut örnek: bir yapay zeka müşteri e-posta yanıt üreticisi sürdüren bir ekip, göndermeye karar vermeden önce yeni bir prompt sürümünü 300 geçmiş destek bileti genelinde mevcut üretim sürümüyle karşılaştırmak istiyor. 600 yanıt çiftini manuel okumak rutin bir prompt değişikliği için pratik değil, bu yüzden bir hakem olarak LLM değerlendirmesi kurarlar: \"Bu müşteri bileti ve iki aday temsilci yanıtı verildiğinde, her birini yardımseverlik ve profesyonellik açısından 1-10 arasında puanla, ardından hangisinin genel olarak daha iyi olduğunu belirt. BİLET: {{ticket}}. YANIT A: {{response_a}}. YANIT B: {{response_b}}.\" Konumsal önyargıyı kontrol etmek için yanıt sırası rastgeleleştirilerek 300 çiftin tamamında çalıştırıldığında, yeni sürüm 214-86 kazanır -bu sonuç ekibe göndermek için nicel, ölçeklenebilir bir güven verir; hakemin puanlamasının gerçek insan kalite değerlendirmesiyle uyumlu olduğunu doğrulamak için 20 biletlik insan tarafından incelenmiş bir örnekle nokta kontrolü yapılır.","Hakem olarak LLM, bir yapay zeka modelini başka bir modelin (veya promptun) çıktılarını tanımlı bir kritere göre puanlamak için kullanır.",null,[11,14,17],{"slug":12,"name":13},"meta-prompt","Meta Prompt",{"slug":15,"name":16},"prompt-versioning","Prompt Sürümleme",{"slug":18,"name":19},"self-consistency","Self-Consistency (Öz Tutarlılık)",[21,25,28,31,35,38,41,44,47,50,53,56],{"slug":22,"category":5,"name":23,"updated_at":24},"analogical-prompting","Analogical Prompting","2026-08-24T02:46:37+00:00",{"slug":26,"category":5,"name":27,"updated_at":24},"automatic-prompt-optimization","Otomatik Komut Optimizasyonu",{"slug":29,"category":5,"name":30,"updated_at":24},"chain-of-density","Yoğunluk Zinciri (CoD)",{"slug":32,"category":5,"name":33,"updated_at":34},"chain-of-thought-prompting","Chain-of-Thought Prompting (Düşünce Zinciri İstemi)","2026-08-24T02:46:36+00:00",{"slug":36,"category":5,"name":37,"updated_at":24},"chain-of-verification","Chain-of-Verification",{"slug":39,"category":5,"name":40,"updated_at":34},"chunking","Chunking (Parçalama)",{"slug":42,"category":5,"name":43,"updated_at":34},"constrained-decoding","Kısıtlanmış Çözümleme (Constrained Decoding)",{"slug":45,"category":5,"name":46,"updated_at":34},"context-stuffing","Bağlam Doldurma (Context Stuffing)",{"slug":48,"category":5,"name":49,"updated_at":34},"delimiter","Ayırıcı (Delimiter)",{"slug":51,"category":5,"name":52,"updated_at":24},"directional-stimulus-prompting","Directional Stimulus Prompting",{"slug":54,"category":5,"name":55,"updated_at":24},"emotion-prompting","Emotion Prompting",{"slug":57,"category":5,"name":58,"updated_at":34},"few-shot-prompting","Few-Shot Prompting (Az Örnekli İstem)"]