Doğrudan Tercih Optimizasyonu (DPO)

Doğrudan Tercih Optimizasyonu (DPO), bir modele insan tercihlerini, sıralanmış yanıt çiftleri üzerinde — bir "daha iyi" ve bir "daha kötü" cevap — doğrudan eğiterek öğreten bir yöntemdir; geleneksel RLHF'in gerektirdiği ayrı ödül modeline ve pekiştirmeli öğrenme döngüsüne ihtiyaç duymaz. 2023'te tanıtılan yöntem, tercih ayarını daha basit, denetimli öğrenmeye benzer bir hedefe dönüştürür; bu da onu tam bir RLHF hattından daha ucuz, daha kararlı ve çalıştırması daha kolay kılar. Geliştiriciler için DPO, bir modeli kendi tercih verilerinizle ince ayarlamayı çok daha erişilebilir hale getiren şeydir: bir RL eğitim yığını kurmak yerine, kullanım senaryonuz için iyi ve kötü çıktı örnekleri toplar ve modeli iyilere doğru optimize edersiniz. Birçok açık ağırlıklı, talimat-ayarlı model artık DPO veya türevleriyle hizalanıyor. Pratik not: DPO ancak tercih çiftleriniz kadar iyidir — gürültülü, tutarsız veya temsili olmayan karşılaştırmalar yanlış dersi öğretir; bu yüzden salt hacim yerine temiz, özenli etiketlemeye yatırım yapın.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi