Model uyarlama

Reinforcement Learning from Human Feedback

RLHF

İnsan geri bildirimiyle pekiştirmeli öğrenme

İnsanların bir modelin yanıtlarını puanladığı ya da karşılaştırdığı, modelin de insanların tercih ettiği türden yanıtlar üretecek biçimde ayarlandığı eğitim tekniği.

RLHF'İN ÜÇ AŞAMASI1 · Karşılaştırinsanlar iyi yanıtı seçer2 · Ödül modelitercihi tahmin etmeyi öğrenir3 · Pekiştirmodel yüksek puana ayarlanır40.000 insan tercihi, milyonlarca yanıtı puanlayabilen bir ödül modeline dönüşür (temsili sayı).

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/rlhf

Sade anlatım

Ön eğitimden çıkmış bir dil modeli, koca bir kütüphaneyi okumuş ama hiç sohbet etmemiş birine benzer: bilgilidir, ama sorunuzu yanıtlamak kadar onu başka bir soruyla sürdürmeye de yatkındır. RLHF, bunun ardından gelen koçluktur. İnsanlar yanıt çiftlerine bakar ve hangisinin daha iyi olduğunu söyler: daha yararlı, daha doğru, daha yerinde. Model, pek çok tur boyunca, kazanan yanıt türüne doğru azar azar yönlendirilir.

Neden önemli

RLHF, ham metin tahmincilerini asistana dönüştüren adımdır ve davranışlarının büyük bölümünü açıklar: kibardırlar, bazı konularda temkinlidirler, yapılandırılmış yanıt vermeye yatkındırlar. Bu özellikler, yanıtları değerlendiren kişilere verilen yönergeler aracılığıyla seçilmiştir. Sınırı da buradadır. Model, değerlendiricilerin onayladığını öğrenir; bu, iyi olana yakındır ama yer yer ondan ayrılır: kendinden emin ve uzlaşmacı görünen bir yanıt çoğu zaman iyi puan alır. Asistanlarda kullanıcıyı gereğinden fazla onaylama ve aşırı özgüven, kısmen bu eğitimin yan etkisidir. Modeli alan, bu tercihleri de devralır.

Örnek

Bir laboratuvarın ön eğitimli modeli sık sık lafı uzatıyor ya da soruyu yanıtsız bırakıyor. Laboratuvar 40.000 istem topluyor, her birine iki yanıt ürettiriyor ve eğitimli değerlendiricilerden daha iyi olanı seçmelerini istiyor. İkinci bir model, bu 40.000 seçimden insanların hangi yanıtı tercih edeceğini tahmin etmeyi öğreniyor. Dil modeli sonra milyonlarca yanıt boyunca bu puanlayıcıya göre eğitiliyor. Ardından yapılan kör testlerde kullanıcılar %85 oranında yeni modelin yanıtını tercih ediyor.

Bununla en çok karıştırılan kavram

RLHF ve Fine-tuning (ince ayar) arasındaki fark

RLHFYargılardan öğrenir: iki yanıttan hangisi daha iyi
Fine-tuning (ince ayar)Örnek gösterimlerden öğrenir: doğru yanıt şudur

Alışılmış fine-tuning denetimlidir: her örnek ideal çıktıyı içerir ve model onu yeniden üretmeyi öğrenir. RLHF ideal çıktı gerektirmez; değerlendiricinin daha iyi yanıtı tanıması yeter. Bu, kusursuz bir yanıt yazmaktan çok daha kolaydır ve model kendisine gösterilen her örnekten daha iyi hale gelebilir. RLHF'i çoğunlukla model geliştiriciler, genel davranışı biçimlendirmek için uygular. Şirket projelerinde ise çoğunlukla denetimli fine-tuning kullanılır.

Köken: Yöntem, 2017'de Paul Christiano ve arkadaşları tarafından pekiştirmeli öğrenme ajanları için tanımlandı ve OpenAI'ın 2022 tarihli InstructGPT makalesinde büyük dil modellerine uygulandı; ChatGPT de bu yöntemle eğitildi.

Teknik katman

Yayımlanan yöntem üç aşamalıdır. Birincisi, insanların yazdığı örnek gösterimlerle denetimli fine-tuning. İkincisi, model çıktılarının insanlarca yapılan karşılaştırmalarıyla bir ödül modeli eğitilir; bu model her yanıtı değerlendiricilerin vereceği gibi puanlayabilir. Üçüncüsü, dil modeli bir pekiştirmeli öğrenme algoritmasıyla, çoğunlukla PPO ile, ödül modelinin yüksek puan verdiği yanıtları üretecek biçimde en iyilenir; bir ceza terimi modeli başlangıç noktasına yakın tutar. Bilinen zayıflıklar: değerlendiriciler arası anlaşmazlık ve yanlılık, kandırılabilen ödül modelleri, kullanıcıyı gereğinden fazla onaylama ve uzman değerlendiricilerin maliyeti. Alternatifler ve ardıllar: aynı karşılaştırmalardan ayrı bir ödül modeli ve pekiştirmeli öğrenme döngüsü olmadan öğrenen direct preference optimization (DPO); Anthropic'in Constitutional AI yaklaşımındaki gibi, yazılı ilkeleri izleyen bir modelin ürettiği geri bildirim; otomatik puanlayıcılara karşı pekiştirmeli fine-tuning. Güncel modeller genellikle bunların bir bileşimiyle biçimlendirilir ve laboratuvarlar her ayrıntıyı yayımlamaz.

Yazan Mehmet Erkek · Son güncelleme: