Yapay zekâ sözlüğü
İleri düzey
Doğrudan Tercih Optimizasyonu (DPO)
Direct Preference Optimization (DPO)
29.08.2026 tarihinde güncellendi
İnsan tercihlerinden gelen cevap çiftleriyle modeli doğrudan hizalayan optimizasyon yöntemidir.
Genel bakış
Kavramın çerçevesiDPO, tercih verisini bir politika optimizasyonu hedefiyle doğrudan kullanır. Her örnekte aynı prompt için tercih edilen cevap ve daha az tercih edilen cevap bulunur. Yöntem, ödül modeli ve karmaşık pekiştirmeli öğrenme döngüsü kurmadan model olasılıklarını tercih yönünde ayarlar. Veri kalitesi ve tercih ölçütlerinin açıklığı sonuç için kritiktir.
Çalışma mantığı: Model, tercih edilen cevabın olasılığını artırırken reddedilen cevabın olasılığını göreli olarak azaltır. Referans model, aşırı uzaklaşmayı sınırlamak için kullanılabilir.
Kullanım alanları: Yardımseverlik, güvenlik, ton, alan bilgisi ve cevap biçimi iyileştirmelerinde kullanılır.
Sınırlılıklar: Tercih verisindeki önyargı modele taşınabilir; nadir durumlar, doğruluk ve güvenlik ayrıca değerlendirilmelidir.
Çalışma mantığı: Model, tercih edilen cevabın olasılığını artırırken reddedilen cevabın olasılığını göreli olarak azaltır. Referans model, aşırı uzaklaşmayı sınırlamak için kullanılabilir.
Kullanım alanları: Yardımseverlik, güvenlik, ton, alan bilgisi ve cevap biçimi iyileştirmelerinde kullanılır.
Sınırlılıklar: Tercih verisindeki önyargı modele taşınabilir; nadir durumlar, doğruluk ve güvenlik ayrıca değerlendirilmelidir.
Teknik tanım ve açıklama
Temel mekanizmaBir modelin tercih edilen ve reddedilen cevap çiftlerinden, ayrı bir ödül modeli kurmadan insan tercihlerini takip edecek şekilde ayarlanmasıdır.
Gerçek hayatta kullanım
Örnek senaryoAynı soruya verilen iki cevaptan kaynak kullanan ve güvenli olan tercih edilir; DPO eğitimi modelin benzer durumlarda bu cevabı seçme olasılığını artırır.