Temeller

Transformer

Transformer · dönüştürücü mimari

Modern dil modellerinin neredeyse tamamının arkasındaki sinir ağı mimarisi; modelin girdinin her parçasını aynı anda diğer bütün parçalara göre tartmasını sağlayan dikkat mekanizması üzerine kuruludur.

TRANSFORMER'IN İÇİ · soldan sağaToken'largirdi dizisiEmbeddingtoken → vektörN katmandikkat + ileri beslemeOlasılıklarsıradaki tokenDikkat sayesinde her token ötekilerin hepsine aynı anda bakar; büyük ölçekli eğitimi bu paralellik mümkün kıldı.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/transformer

Sade anlatım

Eski dil modelleri bir cümleyi sözcük sözcük okur ve sona vardıklarında başını çoğu zaman yitirirdi. Transformer metnin tamamına aynı anda bakar ve her sözcük için, onu anlamada hangi diğer sözcüklerin önemli olduğunu çıkarır. “Banka faizleri artırdı, çünkü o enflasyon bekliyordu” cümlesinde “o” ile “banka”yı birbirine bağlar. GPT'deki T, transformer'ın baş harfidir.

Neden önemli

Bugünkü yapay zeka dalgasının üzerine kurulduğu buluştur. Bütün konumları paralel işlediği için kendisinden önceki her şeyden çok daha fazla veriyle, GPU'lar kullanılarak eğitilebildi ve büyütüldükçe gelişmeyi sürdürdü. 2017'den bu yana ilerlemenin büyük ölçüde daha büyük modellerden, daha çok veriden ve daha çok hesaplama gücünden gelmesinin nedeni budur. Bugünün kısıtlarını da o belirler: bağlam penceresi de uzun girdilerin maliyeti de dikkatin çalışma biçiminden doğar.

Örnek

Şu cümleyi alın: “Kupa valize sığmadı, çünkü çok büyüktü.” Büyük olan neydi? Okur bunun kupa olduğunu bilir. “Büyüktü” yerine “küçüktü” yazın; bu kez söz konusu olan valizdir. Eski modeller bu tür cümlelerde sık sık yanılırdı. Transformer'ın dikkat mekanizması her iki durumda da gizli özneyi doğru ada bağlar, çünkü her sözcüğü diğerlerinin hepsine göre tartar.

Bununla en çok karıştırılan kavram

Transformer ve Yinelemeli sinir ağı (RNN) arasındaki fark

TransformerDizinin tamamına aynı anda, paralel bakar
Yinelemeli sinir ağı (RNN)Adım adım okur, bir belleği ileri taşır

LSTM'leri de içeren yinelemeli ağlar, 2017'den önce dil alanında standarttı. Metni sırayla işlerlerdi; bu da eğitimi yavaşlatır, uzun mesafeli bağlantıları zayıflatırdı. Transformer bu adım adım darboğazı kaldırdı; internet ölçeğindeki metinle eğitimi uygulanabilir kılan da bu tek değişiklik oldu.

Köken: 2017'de Google'dan Ashish Vaswani ve arkadaşları tarafından “Attention Is All You Need” makalesiyle tanıtıldı.

Teknik katman

Girdi metni token'lara, token'lar embedding vektörlerine dönüşür; sözcük sırası bilinsin diye konum bilgisi eklenir. Vektörler birbirinin aynısı katmanlardan oluşan bir yığından geçer; her katmanda çok başlı self-attention ve ardından bir ileri beslemeli ağ, bunlarla birlikte artık (residual) bağlantılar ve normalizasyon bulunur. Son katman, olası her sıradaki token için bir olasılık verir. Türleri: anlama işleri için yalnızca encoder'lı modeller (BERT), üretim için yalnızca decoder'lı modeller (GPT çizgisi ve bugünkü LLM'lerin çoğu) ve çeviri gibi işler için encoder-decoder modeller (özgün tasarım ve T5). Dikkatin maliyeti dizi uzunluğunun karesiyle artar; bağlam pencerelerini sınırlayan ve pek çok verimlilik tekniğine yol açan şey budur. Mimari bugün görüntü, ses, video ve protein yapısı modellerinin de temelidir.

Yazan Mehmet Erkek · Son güncelleme: