Sade anlatım
Basılı bir ders kitabı ile üzerine konan şeffaf bir asetat düşünün. Kitap basıldığı gibi kalır; düzeltmeleriniz ve eklemeleriniz asetata yazılır. Asetatı üstüne koyduğunuzda kitap sizin istediğiniz gibi okunur; kaldırdığınızda özgün hali geri gelir. LoRA adaptörü bir model için bu asetattır: ayarlamaları taşıyan küçük bir ek dosya. Modelin milyarlarca özgün sayısına hiç dokunulmaz. Aynı kitabın üzerine farklı asetatlar konabilir.
Neden önemli
LoRA, fine-tuning'i bir küme gerektiren bir projeden tek bir ekran kartına sığan bir işe çevirdi; açık ağırlıklı modelleri uyarlamanın sıradanlaşması da bundandır. Eğitim ucuzlar, sonuç megabaytlarla ölçülen bir dosyadır ve taban modelin tek bir kopyası, her biri kendi adaptörünü kullanan birçok ekibe hizmet edebilir. Sınırları: adaptör yalnızca eğitildiği taban modelin tam o sürümüyle çalışır, sağlayıcı sunmadıkça kapalı bir modele uygulanamaz ve davranışta büyük değişiklikler için tam fine-tuning hâlâ daha iyi sonuç verebilir.
Örnek
Bir banka, 8 milyar parametreli ve 16 GB boyutunda açık ağırlıklı bir modeli kendi sunucularında çalıştırıyor. Hukuk, müşteri hizmetleri ve finans, modelin kendi biçimlerinde yazmasını istiyor. Üç ayrı tam fine-tuning, 16 GB'lık üç model ve üç ayrı donanım demek. LoRA ile her ekip bir öğleden sonrada yaklaşık 50 MB'lık bir adaptör eğitiyor; üçü de taban modelin tek ortak kopyası üzerinde çalışıyor.
Bununla en çok karıştırılan kavram
LoRA ve Full fine-tuning (tam ince ayar) arasındaki fark
İkisi de modele örneklerle öğretir. Tam fine-tuning modeli yeniden yazar ve elinizde saklanması, sunulması ve bakımı gereken, gigabaytlarca yer tutan ikinci bir kopya bırakır. LoRA modeli olduğu gibi bırakır; takılıp çıkarılabilen, değiştirilebilen küçük bir dosya üretir. Kurumsal uyarlamaların çoğunda kalite birbirine yakındır; LoRA'nın alışılmış başlangıç noktası olması bundandır. Tam fine-tuning, bol verili köklü değişikliklere ayrılır.
Köken: 2021'de Microsoft'tan Edward Hu ve arkadaşları tarafından “LoRA: Low-Rank Adaptation of Large Language Models” makalesiyle tanıtıldı.
Teknik katman
Bir ağırlık matrisi W dondurulur; güncelleme, çok daha küçük iki matrisin, B ve A'nın çarpımı olarak ifade edilir. Bu iki matrisin ortak iç boyutuna rank (r) denir. 4.096 × 4.096'lık, yani yaklaşık 16,8 milyon sayılık bir matriste rank 8, toplam 65.536 sayının eğitilmesi demektir: yüzde yarımın altında. Başlıca ayarlar: rank (çoğunlukla 4 ile 64 arası), alpha denen ölçekleme katsayısı ve adaptörün hangi katmanlara ekleneceği; özgün makale dikkat matrislerini kullanmıştı. Eğitimden sonra adaptör ağırlıklara birleştirilebilir, bu durumda çıkarımda ek gecikme olmaz; ya da ayrı tutulur ve tek bir taban model üzerinde birkaç adaptör değiştirilerek kullanılır. QLoRA, yöntemi 4 bit'e nicemlenmiş bir taban modelle birleştirerek bellek ihtiyacını daha da düşürür. Yaygın uygulama Hugging Face'in PEFT kütüphanesidir. Aynı teknik, görsel üretim modellerine bir üslubu ya da bir konuyu öğretmek için de yaygın biçimde kullanılır. LoRA, parametre verimli fine-tuning (PEFT) denen ailenin bir üyesidir.