mlops
Sözlük ↗Etiketleyiciler Arası Uzlaşma
Etiketleyiciler arası uzlaşma, iki ya da daha çok kişinin aynı örneğe bağımsız olarak ne sıklıkla aynı etiketi verdiğini ölçer. Bir etiketleme görevinin sağlık kontrolüdür ve büyük bir etiketleme çabasından sonra değil, önce yapılmalıdır. Eğitimli iki etiketleyici örneklerin dörtte birinde anlaşamıyorsa görevin kendisi yeterince tanımlanmamıştır ve sonraki bütün sayılar — eğitim isabeti, değerlendirme puanları, model karşılaştırmaları — bu belirsizliği hiçbir modelin çözemeyeceği bir gürültü olarak devralır. Ham yüzde uzlaşması tabloyu olduğundan iyi gösterir, çünkü ağır dengesiz bir kümeyi etiketleyen iki kişi yalnızca rastlantıyla bile sık sık aynı yanıtı verecektir. İki değerlendirici için Cohen kappa, daha fazlası için Krippendorff alfa gibi rastlantıya göre düzeltilmiş istatistikler standart alternatiftir; bunların bildirdiği şey, aynı dağılımın rastgele etiketlenmesinin üreteceğinin ötesindeki uzlaşmadır. Tek bir evrensel eşik yoktur ve bir tane söylemek genellikle hatadır — ihtiyacınız olan düzey, uygulamanızda bir hatanın maliyetine bağlıdır. Düşük uzlaşmaya doğru tepki neredeyse hiçbir zaman etiketlerin ortalamasını almak değildir. Anlaşmazlıkları okumak, örtüşen kategorileri ya da gerçek bir durumu kapsamayan yönergeyi bulmak, kılavuzu yeniden yazmak ve yeniden ölçmektir. Büyük dil modeli değerlendirmesinde aynı disiplin model hakemler için de geçerlidir: bir modele çıktı notlandırtmadan önce aynı örneklem üzerinde insan değerlendiricilerle uzlaşmasını ölçün ve aradaki farkı, sonrasında ürettiği her puanın hata payı sayın.
İlgili terimler