Sade anlatım
“Banka faizleri artırdı, çünkü enflasyon bekliyordu” cümlesini okurken kimin beklediğini diğer kelimelere bakarak çözersiniz. Dikkat mekanizması modele aynı yeteneği verir. Her token için diğer bütün token'lardan ne kadar yararlanacağını hesaplar; böylece her kelimenin anlamı, ilgili kelimeler birbirinden ne kadar uzak olursa olsun, çevresinden kurulur.
Neden önemli
Dikkat, modern yapay zekayı mümkün kılan fikirdir. Modelin bir sözleşmenin kırkıncı sayfasındaki bir maddeyi ikinci sayfadaki bir tanımla ilişkilendirebilmesini o sağlar. Pratik bir sınırı da açıklar: dikkat bağlamdaki her şeye dağıtılır; bağlam büyüdükçe tek bir ayrıntıya düşen pay küçülür.
Örnek
“Ayşe raporu Elif'e verdi, çünkü o istemişti” cümlesinde modelin “o”nun kim olduğuna karar vermesi gerekir. Dikkat, “istemişti” ipucu üzerinden “o”yu güçlü biçimde “Elif”e bağlar. Cümlenin sonunu “çünkü o bitirmişti” yapın; en güçlü bağ “Ayşe”ye kayar.
Bununla en çok karıştırılan kavram
Attention ve Context Window (bağlam penceresi) arasındaki fark
Bağlam penceresi kapasitedir: aynı anda bulunabilecek token sayısı. Dikkat ise onlara uygulanan işlemdir: modelin bu token'lar arasında hesapladığı ilişkiler. Büyük bir pencere bilginin orada bulunabilmesini garanti eder; modelin ona dikkat edeceğini garanti etmez.
Köken: Dikkat, transformer mimarisini tanıtan 2017 tarihli “Attention Is All You Need” makalesiyle dil modellerinin temeli haline geldi.
Teknik katman
Self-attention'da her token bir sorgu, bir anahtar ve bir değer vektörü üretir. Token'ın sorgusu tüm anahtarlarla karşılaştırılarak dikkat ağırlıkları elde edilir; yeni temsili, değerlerin bu ağırlıklarla toplamıdır. Çok sayıda dikkat başlığı paralel çalışır, her biri farklı ilişkileri (sözdizimi, gönderim, konum) yakalar; katmanlar onlarca kez üst üste dizilir. Maliyet kabaca dizi uzunluğunun karesiyle artar; uzun bağlamların pahalı olmasının bir nedeni budur. Dikkat ağırlıkları incelenebilir, ama modelin bir çıktıyı neden ürettiğine dair güvenilir bir açıklama değildir.