Sade anlatım
Arama motorları onlarca yıldır web sayfalarını okumak için robotlar gönderiyor. Yapay zeka şirketleri de artık kendi robotlarını üç ayrı iş için gönderiyor: gelecekteki modelleri eğitmek üzere metin toplamak, sayfaları yapay zeka aramasında kaynak olarak gösterilebilsin diye dizinlemek ve bir kullanıcı sorduğu anda tek bir sayfayı getirmek. Her robot kendini GPTBot ya da ClaudeBot gibi bir adla tanıtır.
Neden önemli
Sitenizi bunlardan hangisinin okuyabileceğine siz karar verirsiniz ve bu kararın iki yönde de sonucu vardır. Hepsini engellerseniz yapay zeka yanıtlarından kaybolursunuz. Hepsine izin verirseniz içeriğiniz karşılığında bir şey almadan eğitimde kullanılabilir. Üç iş için ayrı robotlar kullanıldığından seçim yapabilirsiniz: birçok yayıncı eğitimi engelliyor, aramaya izin veriyor. Mevcut ayarlarınızı kontrol edin; bazı barındırma ve güvenlik hizmetleri yapay zeka robotlarını varsayılan olarak engelliyor.
Örnek
Bir yazılım şirketi Google'da iyi sıralanıyor ama ChatGPT tarafından hiç kaynak gösterilmiyor. Nedeni, 2023'te eğitim kaygılarının yükseldiği dönemde yazılmış ve arama robotu dahil bütün yapay zeka robotlarını engelleyen bir robots.txt dosyası. Şirket eğitim robotunu engelli tutuyor, arama ve kullanıcı isteği robotlarına izin veriyor. Birkaç hafta sonra sayfaları kaynak olarak görünmeye başlıyor.
Bununla en çok karıştırılan kavram
AI Crawler ve Arama motoru tarayıcısı arasındaki fark
Teknoloji aynıdır; alışveriş farklıdır. Arama tarayıcısı içeriğinizi alır ve size ziyaretçi gönderirdi. Yapay zeka tarayıcısı içeriğinizi alıp ziyaret gerektirmeyen bir yanıt döndürebilir. Site sahiplerinin yapay zeka tarayıcılarına daha eleştirel bakmasının ve erişimin artık amaca göre ayarlanmasının nedeni budur.
Teknik katman
Şirketler her amaç için ayrı user agent yayımlar. OpenAI: GPTBot (eğitim), OAI-SearchBot (arama dizini), ChatGPT-User (kullanıcının başlattığı istekler). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot ve Perplexity-User. Google, Arama için de yapay zeka özellikleri için de sayfaları Googlebot ile okur; Google-Extended ayrı bir tarayıcı değil, Gemini için kullanımı denetleyen bir robots.txt belirtecidir. Diğerleri arasında Applebot-Extended, CCBot (Common Crawl) ve Meta-ExternalAgent vardır. Denetim araçları: gönüllü bir standart olan robots.txt; güvenlik duvarı ya da CDN kuralları; user agent metni taklit edilebildiği için yayımlanan IP aralıklarıyla doğrulama. Kullanıcının başlattığı isteklere ilişkin politikalar şirketten şirkete değişir. Birçok yapay zeka tarayıcısı JavaScript çalıştırmaz; bu yüzden yalnızca betikler yüklendikten sonra görünen içerik onlar için görünmez olabilir. Adlar ve kurallar değişir: her şirketin kendi belgelerine bakın.