Sade anlatım
Ön eğitimden çıkmış bir dil modeli, koca bir kütüphaneyi okumuş ama hiç sohbet etmemiş birine benzer: bilgilidir, ama sorunuzu yanıtlamak kadar onu başka bir soruyla sürdürmeye de yatkındır. RLHF, bunun ardından gelen koçluktur. İnsanlar yanıt çiftlerine bakar ve hangisinin daha iyi olduğunu söyler: daha yararlı, daha doğru, daha yerinde. Model, pek çok tur boyunca, kazanan yanıt türüne doğru azar azar yönlendirilir.
Neden önemli
RLHF, ham metin tahmincilerini asistana dönüştüren adımdır ve davranışlarının büyük bölümünü açıklar: kibardırlar, bazı konularda temkinlidirler, yapılandırılmış yanıt vermeye yatkındırlar. Bu özellikler, yanıtları değerlendiren kişilere verilen yönergeler aracılığıyla seçilmiştir. Sınırı da buradadır. Model, değerlendiricilerin onayladığını öğrenir; bu, iyi olana yakındır ama yer yer ondan ayrılır: kendinden emin ve uzlaşmacı görünen bir yanıt çoğu zaman iyi puan alır. Asistanlarda kullanıcıyı gereğinden fazla onaylama ve aşırı özgüven, kısmen bu eğitimin yan etkisidir. Modeli alan, bu tercihleri de devralır.
Örnek
Bir laboratuvarın ön eğitimli modeli sık sık lafı uzatıyor ya da soruyu yanıtsız bırakıyor. Laboratuvar 40.000 istem topluyor, her birine iki yanıt ürettiriyor ve eğitimli değerlendiricilerden daha iyi olanı seçmelerini istiyor. İkinci bir model, bu 40.000 seçimden insanların hangi yanıtı tercih edeceğini tahmin etmeyi öğreniyor. Dil modeli sonra milyonlarca yanıt boyunca bu puanlayıcıya göre eğitiliyor. Ardından yapılan kör testlerde kullanıcılar %85 oranında yeni modelin yanıtını tercih ediyor.
Bununla en çok karıştırılan kavram
RLHF ve Fine-tuning (ince ayar) arasındaki fark
Alışılmış fine-tuning denetimlidir: her örnek ideal çıktıyı içerir ve model onu yeniden üretmeyi öğrenir. RLHF ideal çıktı gerektirmez; değerlendiricinin daha iyi yanıtı tanıması yeter. Bu, kusursuz bir yanıt yazmaktan çok daha kolaydır ve model kendisine gösterilen her örnekten daha iyi hale gelebilir. RLHF'i çoğunlukla model geliştiriciler, genel davranışı biçimlendirmek için uygular. Şirket projelerinde ise çoğunlukla denetimli fine-tuning kullanılır.
Köken: Yöntem, 2017'de Paul Christiano ve arkadaşları tarafından pekiştirmeli öğrenme ajanları için tanımlandı ve OpenAI'ın 2022 tarihli InstructGPT makalesinde büyük dil modellerine uygulandı; ChatGPT de bu yöntemle eğitildi.
Teknik katman
Yayımlanan yöntem üç aşamalıdır. Birincisi, insanların yazdığı örnek gösterimlerle denetimli fine-tuning. İkincisi, model çıktılarının insanlarca yapılan karşılaştırmalarıyla bir ödül modeli eğitilir; bu model her yanıtı değerlendiricilerin vereceği gibi puanlayabilir. Üçüncüsü, dil modeli bir pekiştirmeli öğrenme algoritmasıyla, çoğunlukla PPO ile, ödül modelinin yüksek puan verdiği yanıtları üretecek biçimde en iyilenir; bir ceza terimi modeli başlangıç noktasına yakın tutar. Bilinen zayıflıklar: değerlendiriciler arası anlaşmazlık ve yanlılık, kandırılabilen ödül modelleri, kullanıcıyı gereğinden fazla onaylama ve uzman değerlendiricilerin maliyeti. Alternatifler ve ardıllar: aynı karşılaştırmalardan ayrı bir ödül modeli ve pekiştirmeli öğrenme döngüsü olmadan öğrenen direct preference optimization (DPO); Anthropic'in Constitutional AI yaklaşımındaki gibi, yazılı ilkeleri izleyen bir modelin ürettiği geri bildirim; otomatik puanlayıcılara karşı pekiştirmeli fine-tuning. Güncel modeller genellikle bunların bir bileşimiyle biçimlendirilir ve laboratuvarlar her ayrıntıyı yayımlamaz.