Model uyarlama

Distillation

Damıtma · bilgi damıtma

Öğrenci denen küçük bir modeli, öğretmen denen büyük bir modelin davranışını yeniden üretecek biçimde eğitmek; böylece kalitenin büyük bölümü, maliyetin ve yanıt süresinin küçük bir kısmıyla korunur.

Öğretmenbüyük model · %93 uyum300.000 karargerekçeleriyle birlikteÖğrenciküçük model · %91 uyumemin olamadığı ilanlar yine öğretmene giderMaliyetilan başına yirmide birHızbeş kat hızlı yanıt

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/distillation

Sade anlatım

Kıdemli bir uzman her dosyaya kendisi bakamaz; bu yüzden genç bir meslektaşını yetiştirir: işte binlerce dosya, işte verdiğim kararlar, işte gerekçelerim. Genç meslektaş onun bildiği her şeyi asla bilmeyecektir; ama bu tür dosyalarda ona yaklaşır, daha hızlı çalışır ve daha ucuza gelir. Damıtma, modeller arasındaki bu usta-çırak ilişkisidir. Büyük modelin yanıtları küçük modelin ders malzemesi olur.

Neden önemli

Damıtma, tam boyutuyla fazla yavaş ya da fazla pahalı olan bir yeteneğin yüksek hacimde karşılanabilir hale gelmesinin yoludur. Model sağlayıcıları küçük ve hızlı kademelerini de böyle üretir. Bir şirket için pahalı bir prototipten ucuz bir üretim sistemine geçiş yolu sunar. Bedelleri: öğrenci yalnızca kendisine gösterilen iş türünde iyidir, öğretmenin hatalarını devralır ve öğretmen ya da görev değiştiğinde yeniden kurulması gerekir. Kullanım koşullarına da bakın: sağlayıcılar, modellerinin çıktılarıyla rakip bir model eğitilmesini genellikle yasaklar.

Örnek

Bir çevrimiçi pazaryeri, ayda 2 milyon ilanı içerik kurallarına göre büyük bir modelle denetliyor; model, insan denetçilerle %93 oranında aynı kararı veriyor. Şirket bu modele 300.000 ilanı gerekçeleriyle değerlendirtiyor ve sonuçlarla küçük bir modeli eğitiyor. Öğrenci, denetçilerle %91 oranında örtüşüyor, ilan başına yirmide bir maliyetle çalışıyor ve beş kat hızlı yanıt veriyor. Emin olamadığı ilanlar yine öğretmene gidiyor.

Bununla en çok karıştırılan kavram

Distillation ve Quantization (nicemleme) arasındaki fark

DistillationBüyük modeli taklit eden yeni ve küçük bir model eğitir
Quantization (nicemleme)Aynı modeli korur, sayılarını daha kaba saklar

İkisi de modeli çalıştırmayı ucuzlatır, ama farklı yollardan. Damıtma, daha az parametreli başka bir model üretir; veri ve bir eğitim süreci ister. Quantization'da mimari değişmez ve yaygın biçiminde eğitim gerekmez: aynı ağırlıklar daha az bit ile kaydedilir. Damıtma modeli çok daha fazla küçültebilir; quantization dakikalar sürer. İkisi sıkça birlikte kullanılır: önce damıt, sonra öğrenciyi nicemle.

Köken: Bu adla, Geoffrey Hinton, Oriol Vinyals ve Jeff Dean'in 2015 tarihli “Distilling the Knowledge in a Neural Network” makalesiyle tanıtıldı.

Teknik katman

Özgün yaklaşımda öğrenci, öğretmenin bir sıcaklık değeriyle yumuşatılmış tam çıktı olasılıkları (soft targets) üzerinde eğitilir; çünkü öğretmenin yanlış seçeneklere verdiği göreli ağırlık, tek bir doğru etiketin taşımadığı bilgiyi taşır. Bunun için öğretmenin iç çıktılarına erişmek gerekir. API üzerinden kullanılan dil modellerinde damıtma çoğu zaman daha yalın bir anlama gelir: öğretmene, çoğunlukla gerekçeleriyle birlikte, büyük bir yanıt kümesi ürettirilir ve öğrenciye bu sentetik eğitim verisiyle ince ayar yapılır. Bazı türler çıktıların yanında ara katmanları da eşleştirir ya da birden çok öğretmen kullanır. Öğrenciyi ayrılmış gerçek vakalarla değerlendirin; öğretmenin etiketlediği örnekler tek başına yetmez. Üretimdeki tipik düzen: öğrenci rutin hacmi üstlenir, emin olmadığı vakaları öğretmene aktarır. Amazon Bedrock gibi bulut platformlarında yönetilen damıtma hizmetleri vardır. Sözcük, birkaç üretim adımına indirilmiş difüzyon modelleri için de kullanılır.

Yazan Mehmet Erkek · Son güncelleme: