Sade anlatım
Klasik RAG, soruya en çok benzeyen pasajları bulur. Bu, “bu sözleşmede ihbar süresi ne?” sorusunda işe yarar; “bu 5.000 şikâyetteki ana temalar neler?” sorusunda ise yaramaz, çünkü bu yanıt tek bir pasajda durmaz. GraphRAG her şeyi önceden okur, kimden ve neden söz edildiğini ve bunların nasıl bağlandığını not eder, ilişkili olanları kümeler ve her küme için bir özet yazar. Geniş sorular sonra bu özetlerden yanıtlanır.
Neden önemli
Sorularınız resmin bütünüyle ya da bağlantı zincirleriyle ilgiliyse önem kazanır: soruşturmalar, denetimler, araştırma taramaları, pazar istihbaratı. Aynı zamanda pahalıdır: grafı kurmak, her belgenin her parçası üzerinde bir dil modeli çalıştırmak demektir ve grafın güncel tutulması gerekir. Yanıtı bir iki pasajda duran sorular için klasik RAG daha ucuzdur ve aynı ölçüde iyidir. Oradan başlayın; grafı ancak geniş sorular sürekli başarısız oluyorsa ekleyin.
Örnek
Bir denetim ekibi 3.000 iç denetim raporunu yüklüyor. “Şubeler arasında hangi kontrol zayıflıkları tekrar ediyor?” diye sorulduğunda klasik RAG beş rapordan beş pasaj ve bu beşinin özetini döndürüyor. GraphRAG ise tekrar eden altı temayı, her birinin kaç raporda geçtiğini ve raporların bağlantılarını veriyor, çünkü koleksiyonun tamamını önceden kümeleyip özetlemişti.
Bununla en çok karıştırılan kavram
GraphRAG ve Klasik RAG arasındaki fark
İkisi de modele soru anında dışarıdan bilgi verir. Klasik RAG koleksiyonu birbirinden ayrı pasajlar yığını olarak görür; GraphRAG ise önce içeriğin birbiriyle nasıl ilişkili olduğunu çıkarır. İlki belirli bir bilgiyi bulmak için varsayılan yöntemdir. İkincisi ek maliyetini çok adımlı sorularda ve koleksiyonun bütününe dair sorularda çıkarır.
Köken: Terim, yaklaşımı 2024'te yayımlayan ve açık kaynak olarak sunan Microsoft Research'ten gelir.
Teknik katman
Microsoft Research'ün yayımladığı yaklaşımda dizinleme dört aşamadır: belgeleri parçalara böl; bir dil modeline her parçadan varlıkları, ilişkileri ve iddiaları çıkart; bunları bir grafta birleştir; topluluk tespiti (Leiden algoritması) ile kümelerden bir hiyerarşi oluştur ve her küme için bir özet yaz. Sorgulamanın iki ana modu vardır: geniş soruları topluluk özetleri üzerinde map-reduce ile yanıtlayan global arama ve sorudaki varlıklardan başlayıp komşularını ve kaynak metni toplayan yerel arama. Sonraki türler maliyeti düşürür; örneğin LazyGraphRAG özetlemeyi sorgu anına erteler. Ad, bir bilgi grafı üzerinde çalışan her tür RAG için gevşek biçimde de kullanılır. Dizinleme maliyetine, artımlı güncellemelere ve varlık eşleştirmenin kalitesine dikkat edin.