Sade anlatım
Bir çocuk bisiklete binmeyi kılavuz okuyarak öğrenmez. Dener, yalpalar, düşer, düzeltir; yeterince denemeden sonra bedeni neyin işe yaradığını bilir. Ona her an için doğru yanıtı kimse vermemiştir; bir hedef verilmiş, sonuçlarını kendisi yaşamıştır. Pekiştirmeli öğrenme yazılımı aynı yolla eğitir: neyin başarı sayıldığı söylenir, çoğunlukla bir simülasyonda milyonlarca kez denemesine izin verilir ve yüksek puan getireni korur.
Neden önemli
Ölçülebilir bir sonucu ve güvenle pratik yapılabilecek bir ortamı olan, art arda kararlardan oluşan problemlere uyar: oyunlar, robotik, rota planlama, fiyatlama, endüstriyel ekipmanın kontrolü ve giderek artan ölçüde dil modellerinin akıl yürütmek ve görev tamamlamak üzere eğitilmesi. Hiçbir insanın aklına gelmemiş stratejiler bulabilir. Zahmetlidir de: çok sayıda deneme ister, bu yüzden neredeyse her zaman bir simülatör gerekir; sistem tam olarak ödüllendirileni en iyiler, bu da kastedilenle nadiren birebir aynıdır. Kötü seçilmiş bir ödül, puanı yüksek ama kimsenin işine yaramayan bir davranış üretir.
Örnek
Bir kargo şirketi, ayrıştırma robotlarının kontrol yazılımını simüle edilmiş bir depoda eğitiyor. Ödül: doğru bölmeye bırakılan her koli için bir puan, her çarpışma için eksi beş. İlk bin denemede robotlar çoğunlukla çarpışıyor. İki milyon denemeden sonra, elle yazılmış kurallara göre saatte %14 daha fazla koli ayrıştırıyorlar. Bu arada ek puan getirmeyen ağır kolilerden kaçınmayı da öğrenmişler; ödülün düzeltilmesi gerekiyor.
Bununla en çok karıştırılan kavram
RL ve Supervised learning (denetimli öğrenme) arasındaki fark
Denetimli öğrenmede her girdi için doğru çıktı gösterilir. Pekiştirmeli öğrenmede doğru eylem hiç gösterilmez; sistem, çoğu zaman onu kazandıran kararlardan çok sonra gelen bir puan alır ve bu puanda hangi kararın payı olduğunu kendisi çözmek zorundadır. Doğru yanıtları verebiliyorsanız denetimli öğrenmeyi kullanın. Yalnızca bir sonucun ne kadar iyi olduğunu söyleyebiliyorsanız pekiştirmeli öğrenme uygundur.
Köken: Alanın bugünkü temellerini, 1980'lerin başından itibaren Andrew Barto ve Richard Sutton attı; ikisi bu çalışmalarıyla 2024 Turing Ödülü'nü aldı.
Teknik katman
Kurgu, bir ortamla etkileşen bir ajandır: ajan her adımda bir durumu gözlemler, politikasına göre bir eylem seçer, bir ödül ve yeni bir durum alır; amaç toplam ödülü en yükseğe çıkarmaktır. Temel güçlükler: yeni eylemleri keşfetmek ile bilinen iyi eylemleri kullanmak arasındaki denge, ödül geç geldiğinde payın hangi karara ait olduğunu belirlemek ve örnek verimliliği. Ana aileler: Q-learning gibi değer tabanlı yöntemler, PPO gibi politika gradyanı yöntemleri ve ortamın bir modelini öğrenen ya da hazır alan model tabanlı yöntemler. Derin pekiştirmeli öğrenme, politika için sinir ağları kullanır; en bilinen sonucu, 2016'da Go şampiyonu Lee Sedol'u yenen AlphaGo'dur. Pratikteki sorunlar: simülasyon ile gerçeklik arasındaki fark, ödül istismarı (specification gaming) ve güvenli keşif. Dil modellerinde RLHF olarak ve sonucu otomatik denetlenebilen görevler üzerinde eğitim olarak karşımıza çıkar; akıl yürüten modellerin eğitiminde de bu yaklaşım kullanılır. Buradaki “ajan” ders kitabı terimidir ve bugünkü LLM ajanlarından eskidir.