Model nasıl çalışır

Tokenization

Token'lara ayırma

Metni modelin üzerinde çalıştığı token dizisine, modelin ürettiği token'ları da yeniden metne çeviren adım.

Metin“kolaylaştı”Tokenizersözlükte arar, bölerToken ID'leri6606 · 2845 · 1171Modelsayılarla çalışırçıktıda yol tersine işler: ID'ler yeniden metne çevrilirToken ID'leri temsilidir; belirli bir modele ait değildir.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/tokenization

Sade anlatım

Model cümlenizi okuyabilmeden önce bir tokenizer onu sabit bir sözlükteki parçalara böler ve her parçanın yerine numarasını koyar. Model yalnızca bu sayıları görür. Yanıt verirken süreç tersine işler: sayılar çıkar, metin yeniden birleştirilir.

Neden önemli

Metninizin kaç token edeceğini, dolayısıyla ne kadara mal olacağını ve bağlam penceresine ne kadarının sığacağını tokenization belirler. Bazı tuhaf model davranışlarını da açıklar: modellerin yazım, harf sayma ve uzun sayılarda tökezlemesinin bir nedeni, tek tek karakterleri hiç görmemeleridir.

Örnek

Aynı paragraf farklı sağlayıcıların iki modeline gönderiliyor. Biri 412, diğeri 455 token sayıyor; çünkü her biri kendi tokenizer'ını kullanıyor. İlk sağlayıcının sayacıyla hesaplanan bütçe, ikincisi için yaklaşık yüzde on eksik kalıyor.

Bununla en çok karıştırılan kavram

Tokenization ve Embedding arasındaki fark

TokenizationMetni parçalara böler ve numaralandırır
EmbeddingHer parçayı anlam taşıyan bir vektöre çevirir

Tokenization, içinde anlama olmayan bir sözlük aramasıdır: metin girer, kimlik numaraları çıkar. Embedding bir sonraki adımdır; her kimlik, modelin öğrendiği bir vektöre eşlenir. Parçaların nerede olduğuna tokenizer, ne anlama geldiğine embedding karar verir.

Teknik katman

Güncel tokenizer'lar alt-kelime yöntemleridir; başlıcası byte-pair encoding ve türevleridir. Bir metin derlemi üzerinde, en sık yan yana gelen çiftler tekrar tekrar birleştirilerek, sözlük hedef boyuta ulaşana kadar eğitilirler. Sık kelimeler tek token olur; nadir kelimeler, özel adlar ve İngilizce dışı metin daha fazla parçaya bölünür. Türkçe gibi eklemeli dillerin kelime başına daha çok token harcaması bundandır. Boşluklar, büyük-küçük harf ve noktalama bölünmeyi etkiler. Tokenizer modeline bağlıdır: biriyle token'lanan metin başka bir modele verilemez. Sayımı her zaman sağlayıcının kendi token sayacıyla yapın.

Yazan Mehmet Erkek · Son güncelleme: