Sade anlatım
Bir hekim uzmanlaşmadan önce yıllarca genel eğitim alır. Ön eğitim, modelin genel eğitimidir: insanların yazdıklarının büyük bir bölümünü okur, dilin nasıl işlediğini ve dünyanın nasıl anlatıldığını öğrenir. Ortaya, sonraki aşamaların yardımsever bir asistana dönüştürdüğü yetenekli bir genel uzman çıkar.
Neden önemli
Tek bir modelin, kimsenin onu eğitmediği binlerce işte kullanılabilmesinin ve birkaç iyi finanse edilmiş laboratuvarın herkese model sağlamasının nedeni ön eğitimdir. Satın alan taraf için ekonomiyi de açıklar: pahalı kısmın bedeli bir kez ödenmiş ve tüm müşterilere paylaştırılmıştır; sizin yatırımınız uyarlamaya ve uygulamaya gider.
Örnek
Bir hastane grubu klinik notları özetleyen bir model istiyor. Bunun için milyarlarca belge toplayıp model eğitmiyor. Zaten akıcı okuyup yazan, ön eğitimli bir model alıyor ve kurum formatını öğretmek için kendi örneklerinden birkaç yüz tanesini, istem ya da fine-tuning yoluyla veriyor.
Bununla en çok karıştırılan kavram
Pre-training ve Fine-tuning (ince ayar) arasındaki fark
Ön eğitim, genel yeteneği sıfırdan, aylar süren ve çok pahalı bir süreçte kurar. Fine-tuning bu sonuçtan başlar ve onu bir alana, üsluba ya da göreve saatler ya da günler içinde uyarlar. GPT'deki P, pre-trained sözcüğünün baş harfidir.
Teknik katman
Hedef öz-denetimlidir: sıradaki token'ı (GPT tarzı modellerde) ya da maskelenmiş bir token'ı (BERT tarzı modellerde) tahmin etmek; dolayısıyla veri insan etiketi gerektirmez. Derlemler web metni, kitap, kod ve lisanslı kaynakları harmanlar; filtrelenir ve tekrarlardan arındırılır. Çıktı, metni sürdüren ama henüz talimat izlemeyen bir temel modeldir; sohbet davranışı sonraki talimat ayarı ve hizalama aşamalarından gelir. Maliyet veri, parametre ve hesaplamayla birlikte büyüdüğü için en ileri temel modelleri yalnızca birkaç kurum eğitir; distillation ve açık ağırlıklı yayınlar ise sonuçları daha geniş kesime ulaştırır.