Bilgi ve erişim

Vector Database

Vektör veritabanı

Embedding'leri saklamak ve anlamı bir sorguya en yakın olan kayıtları çok hızlı bulmak için tasarlanmış veritabanı.

Sorgu: “parayı nasıl geri alırım?” → [0.11, −0.52, …]VEKTÖRMETİNBENZERLİK[0.12, −0.48, …]“İade politikası: 30 gün içinde…”0,93[0.09, −0.55, …]“Geri ödeme 5 iş gününde yapılır.”0,89[0.71, 0.20, …]“Kargo ücretleri ve teslimat süreleri”0,31[−0.33, 0.64, …]“Kurumsal üyelik koşulları”0,12Ortak kelime gerekmez; yakınlık anlamdan gelir.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/vector-database

Sade anlatım

Olağan bir veritabanı “şehri İzmir olan satırları bul” sorusunu yanıtlar. Vektör veritabanı ise “bu soruya anlamca benzeyen pasajları bul” sorusunu. Her metin parçasını bir anlam uzayında nokta olarak saklar ve yeni bir nokta verildiğinde en yakın komşularını döndürür.

Neden önemli

RAG ve anlamsal arama sistemlerinin çoğunun arkasındaki depolama katmanıdır. Karar vericiler için pratik nokta şudur: yeni bir ürün satın almak için nadiren gerekçe olur. Birçok şirketin zaten kullandığı veritabanları (PostgreSQL, Elasticsearch ve büyük bulut veritabanları) artık vektör araması sunuyor. Özel bir ürün, çok büyük ölçekte ya da gecikmenin kritik olduğu durumlarda yerini hak eder.

Örnek

Bir perakendeci 2 milyon ürünün açıklamasının embedding'ini çıkarıyor. Bir müşteri “akşam sahilde küçük çocuğun giyeceği sıcak tutan bir şey” yazıyor. Hiçbir ürün bu kelimeleri içermiyor; yine de vektör veritabanı kırk milisaniyede kapüşonlu havlu pançolar ve polar astarlı bornozlar döndürüyor.

Bununla en çok karıştırılan kavram

Vector Database ve Relational database (ilişkisel veritabanı) arasındaki fark

Vector DatabaseAnlamca benzer olanı bulur
Relational database (ilişkisel veritabanı)Birebir eşleşeni bulur

İlişkisel veritabanı kesindir: bir satır koşulu ya sağlar ya sağlamaz. Vektör veritabanı yaklaşıktır: her şeyi yakınlığa göre sıralar ve en yakınları döndürür. Gerçek uygulamalar ikisine de ihtiyaç duyar: kesin filtreler (bu müşteri, bu tarih aralığı) ve benzerlik. Vektör aramasının giderek olağan veritabanlarının bir özelliği haline gelmesi bundandır.

Teknik katman

Her kayıt bir vektör, özgün metin ya da ona bir referans ve filtreleme için üst veri tutar. Arama, HNSW ya da IVF gibi yaklaşık en yakın komşu dizinlerini kullanır; bunlar az bir recall kaybı karşılığında büyük hız kazandırır. Mesafe ölçüsü kosinüs, iç çarpım ya da Öklid'dir. Mühendislik konuları: filtreli arama (üst veri koşullarını benzerlikle birleştirmek), dizin kurma süresi ve bellek, güncelleme ve silme, çok kiracılılık ve erişim kontrolü, embedding modeli değiştiğinde yeniden embedding. Seçenekler arasında PostgreSQL için pgvector, vektör desteği olan arama motorları ve Pinecone, Qdrant, Weaviate, Milvus gibi özel sistemler bulunur.

Yazan Mehmet Erkek · Son güncelleme: