Model nasıl çalışır

Pre-training

Ön eğitim

Eğitimin ilk ve en büyük aşaması: model, herhangi bir göreve uyarlanmadan önce çok geniş bir metin birikiminden dilin ve bilginin genel örüntülerini öğrenir.

Ön eğitimgenel dil ve dünya bilgisiİnce ayar, hizalamadavranışı ve görevi şekillendirirKullanımistem ve bağlamla yönlendiriliraylar · çok büyük hesaplamagünler · haftalarsaniyelerGPT'deki P: pre-trained. Temel modeller bu ilk aşamanın ürünüdür.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/pre-training

Sade anlatım

Bir hekim uzmanlaşmadan önce yıllarca genel eğitim alır. Ön eğitim, modelin genel eğitimidir: insanların yazdıklarının büyük bir bölümünü okur, dilin nasıl işlediğini ve dünyanın nasıl anlatıldığını öğrenir. Ortaya, sonraki aşamaların yardımsever bir asistana dönüştürdüğü yetenekli bir genel uzman çıkar.

Neden önemli

Tek bir modelin, kimsenin onu eğitmediği binlerce işte kullanılabilmesinin ve birkaç iyi finanse edilmiş laboratuvarın herkese model sağlamasının nedeni ön eğitimdir. Satın alan taraf için ekonomiyi de açıklar: pahalı kısmın bedeli bir kez ödenmiş ve tüm müşterilere paylaştırılmıştır; sizin yatırımınız uyarlamaya ve uygulamaya gider.

Örnek

Bir hastane grubu klinik notları özetleyen bir model istiyor. Bunun için milyarlarca belge toplayıp model eğitmiyor. Zaten akıcı okuyup yazan, ön eğitimli bir model alıyor ve kurum formatını öğretmek için kendi örneklerinden birkaç yüz tanesini, istem ya da fine-tuning yoluyla veriyor.

Bununla en çok karıştırılan kavram

Pre-training ve Fine-tuning (ince ayar) arasındaki fark

Pre-trainingÇok büyük veriden geniş, genel öğrenme
Fine-tuning (ince ayar)Küçük ve özel bir veriyle dar uyarlama

Ön eğitim, genel yeteneği sıfırdan, aylar süren ve çok pahalı bir süreçte kurar. Fine-tuning bu sonuçtan başlar ve onu bir alana, üsluba ya da göreve saatler ya da günler içinde uyarlar. GPT'deki P, pre-trained sözcüğünün baş harfidir.

Teknik katman

Hedef öz-denetimlidir: sıradaki token'ı (GPT tarzı modellerde) ya da maskelenmiş bir token'ı (BERT tarzı modellerde) tahmin etmek; dolayısıyla veri insan etiketi gerektirmez. Derlemler web metni, kitap, kod ve lisanslı kaynakları harmanlar; filtrelenir ve tekrarlardan arındırılır. Çıktı, metni sürdüren ama henüz talimat izlemeyen bir temel modeldir; sohbet davranışı sonraki talimat ayarı ve hizalama aşamalarından gelir. Maliyet veri, parametre ve hesaplamayla birlikte büyüdüğü için en ileri temel modelleri yalnızca birkaç kurum eğitir; distillation ve açık ağırlıklı yayınlar ise sonuçları daha geniş kesime ulaştırır.

Yazan Mehmet Erkek · Son güncelleme: