core-ai
Sözlük ↗Kıyaslama Kirlenmesi (Benchmark Contamination)
Kıyaslama kirlenmesi (veri veya test seti sızıntısı olarak da bilinir), herkese açık bir kıyaslamadaki (benchmark) soru ve cevapların bir modelin eğitim verisine karışmasıyla oluşur. Model o zaman kısmen testi ezberlediği için "yüksek puan" alır, onu gerçekten çözdüğü için değil — sınavı önceden görmüş bir öğrenci gibi. Öncü modeller devasa web taramalarıyla eğitildiğinden ve popüler kıyaslamalar internetin her yerinde bulunduğundan, bir miktar kirlenme yaygındır; bu da liderlik tablosu sayılarının gerçek dünyadaki yeteneği neden abartabildiğinin bir nedenidir. Model karşılaştıran geliştiriciler için ders şu: bir modeli yalnızca yayınlanmış kıyaslama puanlarına göre seçmeyin. Bir liderlik tablosunun zirvesindeki model, sizin gerçek görevinizde en iyisi olmayabilir. Pratik not: kendi gerçek girdileriniz ve beklenen çıktılarınızdan küçük, özel bir değerlendirme seti oluşturun, bunu eğitime dahil edilebilecek prompt kayıtlarından uzak tutun ve aday modelleri doğrudan bununla karşılaştırın. Kendi ayrı tuttuğunuz değerlendirme, modelin daha önce görmüş olabileceği herkese açık bir kıyaslamadan çok daha güvenilirdir.
İlgili terimler