Sade anlatım
Her cümleyi, mesafenin anlam farkını gösterdiği dev bir haritaya yerleştirdiğinizi düşünün. “Şifremi nasıl sıfırlarım?” ile “Giriş bilgilerimi unuttum” ortak tek kelimeleri olmadığı halde yan yana düşer; “üç aylık vergi beyannamesi” ise uzağa. Embedding, bir metnin bu haritadaki koordinatlarıdır. Bilgisayarlar anlamları karşılaştıramaz, ama koordinatları karşılaştırabilir.
Neden önemli
Anlama göre aramayı mümkün kılan şey embedding'lerdir ve pratikteki yapay zeka sistemlerinin çoğunun arkasında onlar vardır: RAG için ilgili pasajları bulmak, destek taleplerini bilinen sorunlarla eşleştirmek, benzer ürünleri önermek, tekrarları yakalamak. Bir şirketin yapay zeka asistanı belgelerini “biliyorsa”, onları neredeyse her zaman embedding'ler sayesinde buluyordur.
Örnek
Bir destek ekibi geçmişteki 20.000 talebin embedding'ini çıkarıyor. “Uygulama birkaç dakikada bir oturumumu kapatıyor” diyen yeni bir talep geldiğinde sistem bir saniyeden kısa sürede en yakın beş talebi buluyor; aralarında “oturum çok çabuk sona eriyor” başlıklı olan da var. Onu çözen düzeltme temsilciye gösteriliyor.
Bununla en çok karıştırılan kavram
Embedding ve Token arasındaki fark
Token, anlam taşımayan bir numarayla tanımlanan metin birimidir. Embedding ise konumu anlamı kodlayan, yüzlerce ya da binlerce sayıdan oluşan bir vektördür. Token'lar faturalama için sayılır; embedding'ler benzerlik için karşılaştırılır.
Teknik katman
Embedding modelleri metni sabit uzunlukta bir vektöre çevirir; yaygın boyutlar 384 ile 3.072 arasındadır. Benzerlik kosinüs benzerliği ya da iç çarpımla ölçülür; vektör veritabanları milyonlarca vektörde hızlı arama için yaklaşık en yakın komşu dizinleri kullanır. Pratik noktalar: belgeler embedding'den önce parçalara bölünür; sorgular ve belgeler aynı modelle işlenmelidir; modeli değiştirmek her şeyi yeniden işlemek demektir; kalite dile ve alana göre değişir, kendi verinizde test edin. Görsel ve ses için de embedding vardır; çok kipli modeller farklı ortamları tek bir ortak uzaya yerleştirir. Bir LLM'in ilk katmanı da token kimliklerini vektörlere eşleyen bir embedding tablosudur.