Sade anlatım
Bir uydu görüntüsü, bir tarlaya buğday ekildiğini düşündürüyor. Emin olmak için biri tarlaya gidip bakar. O kişinin gördüğü şey ground truth'tur; görüntü analizi de ona göre değerlendirilir. Yapay zekada fikir aynıdır: her test girdisi için güvenilir bir yoldan doğrulanmış bir yanıt vardır ve modelin yanıtı onunla karşılaştırılarak doğru ya da yanlış sayılır.
Neden önemli
Her doğruluk rakamı ground truth ile yapılan bir karşılaştırmadır; dolayısıyla rakam, arkasındaki referanstan daha iyi olamaz. Bildirilen her puan için sorulacak ilk soru, neyin doğru olduğuna kimin, nasıl karar verdiğidir. Güvenilir ground truth çoğu zaman bir yapay zeka projesinin en pahalı kısmıdır; uzman, ölçüm ya da gerçek sonuçların beklenmesini gerektirir. Özet ya da tavsiye gibi birçok işte tek bir doğru yanıt yoktur; referans, insanların üzerinde anlaştığı bir ölçütler kümesine dönüşür ve onların görüş ayrılıklarını da taşır.
Örnek
Bir hastane, röntgenlerde kırıkları işaretleyen bir modeli 1.000 görüntüyle test ediyor. Her görüntünün ground truth'u, birbirinden bağımsız okuyan iki radyoloğun üzerinde anlaştığı bulgudur. İkisi 64 görüntüde ayrışıyor; bunlara üçüncü, kıdemli bir radyolog karar veriyor. Model 930 görüntüde ground truth ile örtüşüyor: doğruluk %93. Tartışmalı 64 görüntü, referansın kendisini de insanların kurduğunu hatırlatıyor.
Bununla en çok karıştırılan kavram
Ground Truth ve Golden dataset (altın veri seti) arasındaki fark
Ground truth, doğrulanmış yanıt fikridir; golden dataset ise her biri böyle bir yanıt taşıyan test vakalarından oluşan bir settir. İlki içerik, ikincisi onu taşıyan kaptır. Terimler değerlendirmenin dışında ayrışır: eğitim verisindeki etiketlere de, bir tahminin sonradan karşılaştırıldığı gerçek sonuca da ground truth denir.
Köken: Terim uzaktan algılamadan gelir; orada yerde toplanan gözlemler, hava ve uydu görüntülerinin gösterdiği sanılan şeyi doğrulamak için kullanılır.
Teknik katman
Denetimli öğrenmede ground truth, her eğitim ve test örneğine iliştirilen etikettir; değerlendirmede ise her çıktının karşılaştırıldığı referanstır. En güçlüden en zayıfa kaynaklar: doğrudan ölçüm ya da sistem kayıtları, sonradan gerçekleşen sonuçlar, birkaç uzmanın uzlaşısı, tek bir etiketleyici ve bir modelin ürettiği etiketler (çoğu zaman silver label denir). Kalite kontrolleri: yazılı etiketleme yönergeleri, öğe başına birkaç etiketleyici, etiketleyiciler arası uyum istatistikleri, ayrışmaların bir hakemle karara bağlanması ve örneklem denetimleri. Bilinen sorunlar: herhangi bir modelin ulaşabileceği puanı sınırlayan ve yaygın kullanılan benchmark veri setlerinde de saptanmış olan etiket gürültüsü; yetkin uzmanların ayrıştığı belirsiz durumlar; dünya etiketlemeden sonra değiştiğinde ortaya çıkan eskime. Üretken işlerde çoğu zaman birden çok kabul edilebilir yanıt vardır; bu yüzden referanslar zorunlu olgular, rubrikler ya da birkaç örnek yanıt biçimini alır. Sonuca dayalı ground truth geç ve yalnızca bazı vakalar için gelebilir: bir kredi kuruluşu, kredinin geri ödenip ödenmediğini yalnızca verdiği krediler için öğrenir.