Sade anlatım
Tek bir soruyu yanıtlaması için birine 200 sayfalık kılavuzu vermezsiniz; doğru sayfayı verirsiniz. Chunking, kılavuzu önceden sayfalara ayırmaktır. Çok kaba keserseniz her parça beş konuyu kapsar ve hiçbirine iyi eşleşmez. Çok ince keserseniz parça, hangi sınırdan söz ettiğini söylemeden “sınır 30 gündür” der.
Neden önemli
Chunking gösterişsiz bir iştir ve RAG kalitesinin büyük bir bölümünü belirler. Kötü kesilmiş bir belge, model ya da veritabanı ne kadar iyi olursa olsun iyi getirilemez. Belgelerin gerçek hali de burada kendini gösterir: ikiye bölünmüş tablolar, bölümünden ayrılmış başlıklar, niteledikleri iddiadan kopmuş dipnotlar.
Örnek
Bir bankanın RAG pilotu ücret tarifeleri hakkında yanlış yanıtlar veriyor. Neden: PDF'teki ücret tabloları her 500 karakterde bir kesilmiş, her sayı satırı sütun başlıklarından ayrılmış. Bölüm bazında yeniden parçalamak ve her tabloyu başlığıyla birlikte bütün tutmak, modele dokunmadan hataların çoğunu gideriyor.
Bununla en çok karıştırılan kavram
Chunking ve Tokenization arasındaki fark
İkisi de metni keser, ama çok farklı ölçeklerde ve farklı amaçlarla. Tokenization, modelin metni işleyebilmesi için onu kelime parçalarına ayırır. Chunking ise aramanın ilgili kısmı bulabilmesi için belgeleri birkaç yüz token'lık pasajlara ayırır. Bir chunk çok sayıda token'dan oluşur.
Teknik katman
Stratejiler: örtüşmeli sabit boyut (basittir, yapıyı görmez); paragraf ve cümle sınırlarında özyinelemeli bölme; başlık, bölüm, tablo ve kod bloklarına göre yapıya duyarlı bölme; konunun değiştiği yerde anlamsal bölme; ve embedding'den önce her parçaya çevresindeki belgenin özetini ekleyen geç ya da bağlamsal yaklaşımlar. Tipik boyutlar 200 ile 1.000 token arasında, yüzde 10-20 örtüşmeyle seyreder. Her parçayla birlikte üst veriyi saklayın: kaynak, bölüm başlığı, tarih, erişim yetkisi. Parent-child düzeninde küçük parçalar üzerinden getirme yapılır, modele ise çevresindeki daha büyük bölüm verilir. En iyi ayar belgelere bağlıdır; seçenekleri gerçek sorularla test edin.