Yapay zekâ sözlüğü Orta seviye

Reinforcement Learning

Reinforcement Learning

28.08.2026 tarihinde güncellendi

Pekiştirmeli öğrenme, bir ajanın eylemlerinin sonucunda aldığı ödül veya cezadan yararlanarak daha iyi politika öğrenmesidir.

Genel bakış

Kavramın çerçevesi
Pekiştirmeli öğrenmede ajan bir durum görür, eylem seçer ve çevreden ödül alır. Amaç tek bir doğru etiketi ezberlemek değil, zaman içinde toplam ödülü yükselten politika veya değer tahmini öğrenmektir. Keşif ile bilinen iyi eylemleri kullanma arasındaki denge temel zorluklardan biridir. Ödül yanlış tasarlanırsa ajan hedefin görünürde başarılı ama istenmeyen bir kısayolunu öğrenebilir.

Çalışma mantığı: Ajan durum gözlemler, politika ile eylem seçer ve ödülü çevreden alır; eğitim, gelecekteki ödülleri de hesaba katan güncellemelerle sürer. Keşif, güvenli sınırlar ve ödül tasarımı sürecin merkezindedir.

Kullanım alanları: Oyun, robotik, kaynak tahsisi, kontrol, öneri ve simülasyon ortamlarında kullanılır.

Sınırlılıklar: Kötü ödül istenmeyen kısayollar doğurur; gerçek dünyada keşif maliyetli ve tehlikeli olabilir, bu nedenle simülasyon, kısıt ve insan onayı gerekir.

Teknik tanım ve açıklama

Temel mekanizma
Bir ajanın çevresiyle etkileşerek ödül ve ceza mekanizmasıyla öğrendiği makine öğrenme paradigmasıdır. AlphaGo bu teknikle eğitilmiştir.

Gerçek hayatta kullanım

Örnek senaryo
Bir robot, hedefe ulaştığında ödül alıp hatalı hareketlerde ceza görerek davranış politikasını geliştirebilir. Editoryal bir uygulamada bu kavramı kullanırken önce hedefi ve başarı ölçütünü yazın, ardından küçük bir örnek üzerinde sonucu kontrol edip üretime almadan önce insan doğrulaması yapın.