Model nasıl çalışır

Next-token Prediction

Sonraki token tahmini

Dil modelinin özündeki tek işlem: o ana kadarki metne bakarak, sıradaki her olası token'ın ne kadar olası olduğunu tahmin etmek.

İSTEMTürkiye'nin başkenti …SIRADAKİ TOKEN İÇİN OLASILIKLAR · temsiliAnkara%91İstanbul%5olan%2neresi%1Bir token seçilir, metne eklenir ve tahmin baştan yapılır: yanıt böyle, token token oluşur.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/next-token-prediction

Sade anlatım

Telefonunuzun klavyesi sıradaki kelimeyi önerir. Dil modeli aynı işi çok daha büyük bir ustalıkla yapar: o ana kadarki her şeyi okur ve sırada gelebilecek her token'a bir olasılık verir. Birini seçer, ekler ve tekrarlar. Bir deneme, bir sözleşme özeti ve bir kod bloğu aynı yolla, parça parça üretilir.

Neden önemli

Bu tek gerçek, yapay zekada insanları şaşırtan şeylerin çoğunu açıklar. Model akla yatkın olanı üretir; bu genellikle doğru olanla örtüşür, bazen örtüşmez. Halüsinasyonlar buradan çıkar. İfadenin ve bağlamın neden bu kadar önemli olduğunu da açıklar: sırada neyin olası olduğunu onlar değiştirir.

Örnek

“Sözleşme, otuz gün önceden yazılı” ifadesinden sonra model “bildirimle” token'ına yüzde doksanın üzerinde olasılık verir ve devam eder. “Üçüncü çeyrek gelirimiz” ifadesinden sonra ise, rakam bağlamda yoksa hiçbir token belirgin biçimde öne çıkmaz; model yalnızca doğru gibi görünen bir sayı üretebilir.

Bununla en çok karıştırılan kavram

Next-token Prediction ve Autocomplete (otomatik tamamlama) arasındaki fark

Next-token PredictionDevasa eğitimden gelen bir kavrayışla tahmin eder
Autocomplete (otomatik tamamlama)Son yazılanlardan ve basit istatistikten öneri çıkarır

Mekanizma ana hatlarıyla aynıdır; “süslü otomatik tamamlama” benzetmesi bu yüzden yaygındır. Ama sonucu küçümser: bir ispatın, bir hukuki argümanın ya da bir programın sıradaki token'ını iyi tahmin etmek için modelin bunların arkasındaki mantığı temsil etmesi gerekir. Tahmin basittir; ağın tahmin edebilmek için öğrendiği şey basit değildir.

Teknik katman

Ağ, sözlükteki her token için bir skor (logit) üretir; softmax skorları olasılığa çevirir; bir çözümleme kuralı (greedy, sıcaklıkla örnekleme, top-p ya da top-k) birini seçer. Üretim özbağlanımlıdır: her yeni token bir sonraki adımın girdisine katılır, erken yapılan bir hata ileriye taşınabilir. Eğitim, tahmin edilen dağılım ile gerçek sıradaki token arasındaki çapraz entropiyi en aza indirir. Akıl yürüten modeller son yanıttan önce bir ara metin üretme aşaması ekler, ama alttaki işlem yine sonraki token tahminidir.

Yazan Mehmet Erkek · Son güncelleme: