Ana içeriğe geç

Pekiştirmeli Öğrenme

İngilizcesi
Reinforcement Learning
Türkçe karşılığı
takviyeli öğrenme
Okunuşu
riinforsmınt lörning
Güncellendi 2 dk okuma

Bu sayfayı paylaşın

Bağlantıyı gönderin, tanımı bağlantısıyla birlikte alıntılayın ya da kendi sitenizde bir kart olarak gösterin.

https://softwaredictionary.org/tr/terimler/reinforcement-learning

Kısaca

Pekiştirmeli öğrenme, bir ajanın iyi eylemler için ödül kazanarak deneme yanılmayla karar vermeyi öğrendiği bir makine öğrenmesi türüdür.

Pekiştirmeli öğrenme nedir?

Pekiştirmeli öğrenme (RL), yazılımı bir dizi karar verecek şekilde eğitme yöntemidir. Sabit bir doğru cevaplar kümesinden öğrenmek yerine bir ajan bir ortamla etkileşime girer, eylemler yapar ve ödül ya da ceza alır. Birçok denemeden sonra bir politika (policy) öğrenir; bu, her durumda hangi eylemi yapacağını söyleyen ve zaman içinde en çok ödülü kazandıran stratejidir.

Her adım aynı döngüyü izler: ajan mevcut durumu gözlemler, bir eylem seçer ve ortam yeni bir durum ile bir ödül döndürür. Temel zorluk, daha iyi seçenekleri keşfetmek için yeni eylemler denemek olan keşif (exploration) ile zaten işe yaradığı bilinen eylemleri tekrarlamak olan sömürü (exploitation) arasında denge kurmaktır. Q-learning gibi klasik algoritmalar her durumda her eylemin ne kadar değerli olduğunu tahmin eder; derin pekiştirmeli öğrenme ise bir video oyunu ekranının pikselleri gibi devasa durum uzaylarını ele almak için sinir ağları kullanır.

Klasik benzetme, köpeği mamayla eğitmektir: kimse kuralları açıklamaz, ama iyi davranış mama kazandırır ve köpek onu giderek tekrarlar. RL; masa oyunlarında ve video oyunlarında ustalaşmak, robotları kontrol etmek ve RLHF (insan geri bildiriminden pekiştirmeli öğrenme) ile büyük dil modellerine ince ayar yapmak için kullanılmıştır; RLHF'de insanların yanıtlara verdiği puanlar ödül işlevi görür.

Pekiştirmeli öğrenme çoğu zaman denetimli öğrenmeyle karıştırılır. Denetimli öğrenmede modele her örnek için 'kedi' etiketli bir görüntü gibi doğru cevap gösterilir; RL'de ise ajana yalnızca bir sonucun ne kadar iyi olduğu söylenir ve bu çoğu zaman sonucu doğuran eylemden çok sonra olur. Bu, RL'yi karar verme problemleri için güçlü kılar ama eğitmesi daha zordur, çünkü kötü tasarlanmış bir ödül, ajana gerçek görevi çözmek yerine kaçak yolları sömürmeyi öğretebilir.

Önemli noktalar

  • Bir RL ajanı, ödül ve cezalardan deneme yanılmayla öğrenir.
  • Temel döngü durum, eylem, ödül ve sonraki durumdur.
  • Ajanlar yeni eylemleri keşfetmekle bilinen iyi eylemleri sömürmek arasında denge kurmalıdır.
  • Denetimli öğrenmenin aksine RL'de etiketli doğru cevaplar yoktur; yalnızca sonuçlara dair geri bildirim vardır.
  • RLHF, dil modellerine ince ayar yapmak için ödül olarak insan geri bildirimini kullanır.

Örnek

Epsilon-greedy bir ajanla ödüllerden öğrenmekpython
import random

# Two buttons with hidden payout rates; the agent must discover the better one
payout_rates = [0.3, 0.7]
value = [0.0, 0.0]  # the agent's estimate of each button's reward
count = [0, 0]

for step in range(1000):
    # Explore 10% of the time, otherwise exploit the best-known button
    action = random.randrange(2) if random.random() < 0.1 else value.index(max(value))
    reward = 1 if random.random() < payout_rates[action] else 0
    count[action] += 1
    value[action] += (reward - value[action]) / count[action]  # running average

print(value)  # roughly [0.3, 0.7]

Sık sorulan sorular

Pekiştirmeli öğrenme ile denetimli öğrenme arasındaki fark nedir?

Denetimli öğrenme doğru cevabı içeren örneklerle eğitilir; pekiştirmeli öğrenme ise ajana doğru hamleyi söylemeden eylemleri için ödüller vererek onu eğitir. RL, en iyi eylemin önceden bilinmediği karar verme görevlerine uygundur.

RLHF nedir?

RLHF, insan geri bildiriminden pekiştirmeli öğrenme anlamına gelir. İnsanlar bir modelin yanıtlarını puanlar ya da sıralar, bu tercihler bir ödül modelini eğitir ve dil modeli daha yüksek puan alan yanıtlar üretmesi için pekiştirmeli öğrenmeyle ince ayardan geçirilir.

Ödül fonksiyonu (reward function) nedir?

Ödül fonksiyonu, ajana her eylemden ya da bölümden sonra bir puan veren ve başarının ne demek olduğunu tanımlayan kuraldır. Özenle tasarlanması çok önemlidir, çünkü ajanlar tam olarak ödüllendirileni, istenmeyen yollarla bile olsa, optimize eder.

İlgili sayfalar

Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin

Daha fazla

Ayarlar