Yapay zekâ sözlüğü İleri düzey

RLHF (Reinforcement Learning from Human Feedback)

Reinforcement Learning from Human Feedback (RLHF)

28.08.2026 tarihinde güncellendi

RLHF, dil modelinin insan değerlendiricilerin tercihleriyle daha yararlı, anlaşılır ve güvenli yanıtlar vermesi için hizalanmasıdır.

Genel bakış

Kavramın çerçevesi
RLHF genellikle insan tercihleriyle yanıt çiftlerini değerlendirme, bu tercihlerden bir ödül modeli öğrenme ve dil modelini ödülü artıracak şekilde ayarlama aşamalarını içerir. Yöntem, modelin yalnızca dilsel olasılığa değil faydalılık, üslup ve güvenlik beklentilerine de yaklaşmasına yardımcı olur. Değerlendirici önyargısı, talimatların belirsizliği ve ödül modelinin yanlış genellemesi sonucu etkileyebilir. İnsan geri bildirimi güçlü bir hizalama sinyali olsa da doğruluk için kaynak ve test gerekir.

Çalışma mantığı: İnsanlar yanıt çiftlerini tercih sırasına koyar, bu sinyalden ödül modeli öğrenilir ve dil modeli ödülü artıracak şekilde ayarlanır. Veri kalitesi ve değerlendirme yönergeleri hizalamanın yönünü belirler.

Kullanım alanları: Asistan üslubu, yardımseverlik, güvenlik politikaları ve insan beklentilerine uyum gerektiren üretken modellerde kullanılır.

Sınırlılıklar: İnsan tercihi doğrulukla aynı değildir; ödül modelinin açığı, değerlendirici önyargısı ve aşırı uyum bağımsız doğrulama ile kontrol edilmelidir.

Teknik tanım ve açıklama

Temel mekanizma
İnsan geri bildirimleriyle pekiştirmeli öğrenme. Dil modellerini daha yararlı ve güvenli hale getirmek için insan değerlendiricilerin tercihlerinden öğrenme yöntemidir.

Gerçek hayatta kullanım

Örnek senaryo
İnsan değerlendiricilerin tercihleri, dil modelinin daha yararlı ve güvenli yanıtlar üretmesi için eğitim sinyali olarak kullanılabilir. Editoryal bir uygulamada bu kavramı kullanırken önce hedefi ve başarı ölçütünü yazın, ardından küçük bir örnek üzerinde sonucu kontrol edip üretime almadan önce insan doğrulaması yapın.