Sade anlatım
Telefonunuzun klavyesi sıradaki kelimeyi önerir. Dil modeli aynı işi çok daha büyük bir ustalıkla yapar: o ana kadarki her şeyi okur ve sırada gelebilecek her token'a bir olasılık verir. Birini seçer, ekler ve tekrarlar. Bir deneme, bir sözleşme özeti ve bir kod bloğu aynı yolla, parça parça üretilir.
Neden önemli
Bu tek gerçek, yapay zekada insanları şaşırtan şeylerin çoğunu açıklar. Model akla yatkın olanı üretir; bu genellikle doğru olanla örtüşür, bazen örtüşmez. Halüsinasyonlar buradan çıkar. İfadenin ve bağlamın neden bu kadar önemli olduğunu da açıklar: sırada neyin olası olduğunu onlar değiştirir.
Örnek
“Sözleşme, otuz gün önceden yazılı” ifadesinden sonra model “bildirimle” token'ına yüzde doksanın üzerinde olasılık verir ve devam eder. “Üçüncü çeyrek gelirimiz” ifadesinden sonra ise, rakam bağlamda yoksa hiçbir token belirgin biçimde öne çıkmaz; model yalnızca doğru gibi görünen bir sayı üretebilir.
Bununla en çok karıştırılan kavram
Next-token Prediction ve Autocomplete (otomatik tamamlama) arasındaki fark
Mekanizma ana hatlarıyla aynıdır; “süslü otomatik tamamlama” benzetmesi bu yüzden yaygındır. Ama sonucu küçümser: bir ispatın, bir hukuki argümanın ya da bir programın sıradaki token'ını iyi tahmin etmek için modelin bunların arkasındaki mantığı temsil etmesi gerekir. Tahmin basittir; ağın tahmin edebilmek için öğrendiği şey basit değildir.
Teknik katman
Ağ, sözlükteki her token için bir skor (logit) üretir; softmax skorları olasılığa çevirir; bir çözümleme kuralı (greedy, sıcaklıkla örnekleme, top-p ya da top-k) birini seçer. Üretim özbağlanımlıdır: her yeni token bir sonraki adımın girdisine katılır, erken yapılan bir hata ileriye taşınabilir. Eğitim, tahmin edilen dağılım ile gerçek sıradaki token arasındaki çapraz entropiyi en aza indirir. Akıl yürüten modeller son yanıttan önce bir ara metin üretme aşaması ekler, ama alttaki işlem yine sonraki token tahminidir.