Sade anlatım
Modeller harf ya da kelime görmez, token görür. Metin, sabit bir sözlükteki parçalara bölünür ve her parça bir sayıya çevrilir. Lego gibi düşünün: sık kullanılan bir kelime tek parçadır, nadir ya da uzun bir kelime birkaç parçadan kurulur.
Neden önemli
Token, yapay zekanın para birimidir. Giren ve çıkan token başına ödeme yaparsınız, modelin bir seferde göz önünde tutabildiği metin miktarı (bağlam penceresi) token ile ölçülür, yanıt süresi de üretilen token sayısıyla uzar. Bir yapay zeka ürününü bütçelemek büyük ölçüde token hesabıdır.
Örnek
İngilizcede bir token kabaca dört karakter, yani bir kelimenin dörtte üçü kadardır; 1.000 token yaklaşık 750 kelime eder. Türkçe, eklerle uzayan kelimeleri yüzünden aynı anlam için genellikle daha fazla token harcar; yani aynı belgeyi işlemek daha pahalıya gelir.
Bununla en çok karıştırılan kavram
Token ve Embedding arasındaki fark
Token metnin parçasıdır ve bir kimlik numarasıyla temsil edilir. Embedding ise o parçanın ya da bütün bir metnin anlamını taşıyan sayı dizisidir. Token “hangi parça” sorusunu, embedding “ne anlama geliyor” sorusunu yanıtlar. Faturayı token belirler, anlamsal aramayı embedding çalıştırır.
Teknik katman
Çoğu LLM, kabaca 50 bin–200 bin girdili sözlüklerle çalışan alt-kelime tokenizer'ları (BPE, WordPiece, SentencePiece) kullanır. Her token kimliği bir embedding vektörüne karşılık gelir; model bir sonraki token için olasılık dağılımı üretir. Token sayısı modelden modele değişir, aynı metin her yerde aynı sayıda token etmez. Çıktı token'ları genellikle girdi token'larından birkaç kat pahalıdır, önbelleğe alınmış girdi ise daha ucuzdur. Görsel ve ses de token'a çevrilir.