[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-eval-harness::tr":3,"gloss-cluster-eval-harness::tr":26,"gloss-next-eval-harness::tr":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"eval-harness","mlops","Değerlendirme Koşumu (Eval Harness)","Değerlendirme koşumu, model çıktıları için otomatik bir test takımıdır — makine öğreniminin birim testleri gibi düşünün. Sabit bir girdi veri kümesini puanlama mantığıyla eşleştirir: tam eşleşme kontrolleri, regex ya da şema doğrulaması, rubrik puanlaması veya her yanıtı derecelendiren bir LLM-hakem. Koşumu her istem değişikliğinde, model yükseltmesinde ya da ince ayarda çalıştırdığınızda içgüdü yerine karşılaştırılabilir bir skor elde edersiniz. Yapay zekâ özelliği yayınlayan SaaS geliştiricileri için bu, kendinden emin iterasyon ile 'umarım bir şey bozulmamıştır' arasındaki farktır. Koşum olmadan beş örneğe göz atar, yayınlar ve gerilemeyi öfkeli bir müşteriden öğrenirsiniz. Koşumla, vakaların %12'sini sessizce kötüleştiren bir istem değişikliği CI'da kırmızı bir sayı olarak belirir. Araçlar arasında promptfoo, OpenAI Evals, LangSmith ve Braintrust bulunur. Pratik not: gerçekten önem verdiğiniz yirmi-elli gerçek vakayla küçük başlayın, ucuz deterministik kontrolleri birkaç hakem tabanlı skorla harmanlayın ve üretime her bir hata kaçtığında kümeyi büyütün.","Değerlendirme koşumu, model çıktıları için birim test takımıdır: sabit veri kümesi artı puanlama — tam eşleşme, şema, rubrik ya da LLM hakem — her değişiklikte.",null,[11,14,17,20,23],{"slug":12,"name":13},"ci-cd","Sürekli Entegrasyon \u002F Sürekli Dağıtım (CI\u002FCD)",{"slug":15,"name":16},"golden-dataset","Altın Veri Kümesi",{"slug":18,"name":19},"llm-as-judge","Hakem Olarak LLM (LLM-as-Judge)",{"slug":21,"name":22},"llm-benchmark","LLM Kıyaslaması (LLM Benchmark)",{"slug":24,"name":25},"prompt-testing","Prompt Testi (İstem Testi)",[27,31,35,38,41,45,48,51,54,57,60,63],{"slug":28,"category":5,"name":29,"updated_at":30},"annotation-guidelines","Etiketleme Kılavuzu","2026-08-24T03:30:02+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"baseline-model","Temel Model (Baseline)","2026-08-24T02:46:38+00:00",{"slug":36,"category":5,"name":37,"updated_at":34},"batch-inference","Toplu Çıkarım",{"slug":39,"category":5,"name":40,"updated_at":34},"canary-prompt","Kanarya Prompt",{"slug":42,"category":5,"name":43,"updated_at":44},"champion-challenger","Şampiyon-Meydan Okuyan (A\u002FB Model Testi)","2026-08-24T02:46:37+00:00",{"slug":46,"category":5,"name":47,"updated_at":34},"class-imbalance","Sınıf Dengesizliği",{"slug":49,"category":5,"name":50,"updated_at":34},"continuous-batching","Sürekli Toplu İşleme (Continuous Batching)",{"slug":52,"category":5,"name":53,"updated_at":34},"cross-validation","Çapraz Doğrulama",{"slug":55,"category":5,"name":56,"updated_at":34},"data-labeling","Veri Etiketleme",{"slug":58,"category":5,"name":59,"updated_at":44},"drift-detection","Sapma Tespiti (Drift Detection)",{"slug":61,"category":5,"name":62,"updated_at":44},"experiment-tracking","Deney Takibi (Experiment Tracking)",{"slug":64,"category":5,"name":65,"updated_at":34},"explainability","Açıklanabilirlik"]