Sade anlatım
Model cümlenizi okuyabilmeden önce bir tokenizer onu sabit bir sözlükteki parçalara böler ve her parçanın yerine numarasını koyar. Model yalnızca bu sayıları görür. Yanıt verirken süreç tersine işler: sayılar çıkar, metin yeniden birleştirilir.
Neden önemli
Metninizin kaç token edeceğini, dolayısıyla ne kadara mal olacağını ve bağlam penceresine ne kadarının sığacağını tokenization belirler. Bazı tuhaf model davranışlarını da açıklar: modellerin yazım, harf sayma ve uzun sayılarda tökezlemesinin bir nedeni, tek tek karakterleri hiç görmemeleridir.
Örnek
Aynı paragraf farklı sağlayıcıların iki modeline gönderiliyor. Biri 412, diğeri 455 token sayıyor; çünkü her biri kendi tokenizer'ını kullanıyor. İlk sağlayıcının sayacıyla hesaplanan bütçe, ikincisi için yaklaşık yüzde on eksik kalıyor.
Bununla en çok karıştırılan kavram
Tokenization ve Embedding arasındaki fark
Tokenization, içinde anlama olmayan bir sözlük aramasıdır: metin girer, kimlik numaraları çıkar. Embedding bir sonraki adımdır; her kimlik, modelin öğrendiği bir vektöre eşlenir. Parçaların nerede olduğuna tokenizer, ne anlama geldiğine embedding karar verir.
Teknik katman
Güncel tokenizer'lar alt-kelime yöntemleridir; başlıcası byte-pair encoding ve türevleridir. Bir metin derlemi üzerinde, en sık yan yana gelen çiftler tekrar tekrar birleştirilerek, sözlük hedef boyuta ulaşana kadar eğitilirler. Sık kelimeler tek token olur; nadir kelimeler, özel adlar ve İngilizce dışı metin daha fazla parçaya bölünür. Türkçe gibi eklemeli dillerin kelime başına daha çok token harcaması bundandır. Boşluklar, büyük-küçük harf ve noktalama bölünmeyi etkiler. Tokenizer modeline bağlıdır: biriyle token'lanan metin başka bir modele verilemez. Sayımı her zaman sağlayıcının kendi token sayacıyla yapın.