Sade anlatım
Boyutu sabit bir masa düşünün. Modelin üzerinde çalıştığı her şey aynı anda o masada durmak zorundadır: talimatlarınız, o ana kadarki konuşma, belgeler ve yazmakta olduğu sayfa. Masa dolunca, yeni bir şey koymak için bir şeyi kaldırmak gerekir. Masada olmayan, model için yoktur.
Neden önemli
Modelin tek seferde ne yapabileceğini pencere belirler: sözleşmenin tamamını mı okur, yalnızca bir bölümünü mü; uzun bir çalışma oturumunu sürdürür mü, ipin ucunu kaçırır mı. Büyük pencere işe yarar, ama üç çekinceyle: penceredeki her token her istekte faturalanır, yanıtlar yavaşlar ve pencere doldukça doğruluk düşme eğilimi gösterir.
Örnek
300 sayfalık bir ihale dosyası kabaca 150.000 token eder. 200.000 token'lık bir pencereye bütün olarak sığar, soru ve yanıtlara da yer kalır. 32.000 token'lık bir pencerede ise önce bölünmesi, içinde arama yapılması ya da özetlenmesi gerekir; uygulamanın tasarımı da buna göre değişir.
Bununla en çok karıştırılan kavram
Context Window ve Memory (bellek) arasındaki fark
Bağlam penceresi, konuşma bitince boşalan çalışma alanıdır. Bellek ise oturumlar arasında kalıcı olan ayrı bir depodur: bir dosya ya da veritabanı. Model bir şeyi ancak uygulama onu o depodan alıp yeniden pencereye koyduğunda “hatırlar”.
Teknik katman
Sınır girdi ve çıktıyı birlikte kapsar; sağlayıcılar çıktıya genellikle ayrı bir üst sınır koyar. Modeller durumsuzdur: uygulama her turda konuşmanın tamamını yeniden gönderir; yani uzun sohbetler, prompt caching devrede değilse her seferinde yeniden faturalanır. Pencere boyutları küçük modellerde birkaç bin token'dan büyük modellerde yüz binlere, hatta bir milyona uzanır. Kalite sınıra varmadan düşmeye başlar: modeller uzun bağlamların ortasındaki bilgiye daha az güvenilir biçimde dikkat eder (“lost in the middle”) ve bağlam büyüdükçe genel kalite geriler (context rot). Bütçe içinde kalma teknikleri: toplu yükleme yerine retrieval, compaction, kendi penceresi olan alt ajanlar ve dış bellek.