Sade anlatım
Bir şarap üreticisi şekeri ve asidi laboratuvarda ölçebilir; yine de tadımcı çalıştırır, çünkü şarabın iyi olup olmadığı bir insan yargısıdır. Yapay zeka çıktısı da böyledir. Yazılım bir yanıtın biçimini kontrol edebilir; yanıtın doğru, yararlı ve yerinde bir üslupla yazılmış olup olmadığına ise onu okuyan insanlar karar verir. İnsan değerlendirmesi bu okumayı sabit ölçütlerle ve birkaç okuyucuyla düzene sokar; böylece sonuç sayılabilir ve karşılaştırılabilir.
Neden önemli
İnsan yargısı, değerlendirmedeki her şeyin referansıdır: otomatik ölçütlere ve hakem modellere, insanlarla uyuştukları ölçüde güvenilir. Bir ürün yayına alınırken, risk yüksekken, kalite uzmanlık ya da zevk meselesiyken ve otomatik puan ile kullanıcı şikâyetleri farklı yönleri gösterdiğinde vazgeçilmezdir. Aynı zamanda yavaş ve pahalıdır; insanlar birbiriyle ayrışır, yorulur ve zamanla ölçütlerinden kayar. Pratik çözüm, insan dikkatini en çok fark yarattığı yere harcamak ve onu daha ucuz yöntemleri kalibre etmek için kullanmaktır.
Örnek
Bir banka, yatırım bilgilendirme asistanını yayına hazırlıyor. Üç uyum uzmanının her biri aynı 200 yanıtı kabul edilebilir ya da kabul edilemez olarak puanlıyor. 122 yanıtta oybirliği var. Rubrik sınırdaki durumların örnekleriyle yeniden yazıldıktan sonra, 200 yeni yanıtla yapılan ikinci turda oybirliği 176'ya çıkıyor. Çalışma yaklaşık 30 saatlik uzman zamanı alıyor ve bir hakem modeli kalibre etmekte kullanılan etiketleri sağlıyor.
Bununla en çok karıştırılan kavram
Human Evaluation ve Human-in-the-Loop (HITL) arasındaki fark
İkisi de yapay zeka çıktısının karşısına bir insan koyar; amaçları farklıdır. İnsan değerlendirmesi ölçümdür: insanlar bir örneklemi, genellikle yayından önce ya da belirli aralıklarla puanlar ve sonuç geliştirmeye yön verir. Human-in-the-loop ise kontroldür: bir kişi canlı işleyişte belirli bir eylemi gerçekleşmeden önce onaylar. Bir sistem insan değerlendirmesinden geçmiş olsa da riskli eylemlerde döngüde bir insana ihtiyaç duyabilir.
Teknik katman
Üç değerlendirici grubu vardır: konu uzmanları (az sayıda ve pahalı; doğruluğun bilgi gerektirdiği yerde şart), yönergelerle çalışan eğitimli etiketleyiciler (daha büyük hacimler, tutarlı ölçütler) ve son kullanıcılar (beğeni ya da beğenmeme, düzeltmeler, A/B testleri; bol ve gürültülü). Biçimler: bir rubriğe göre mutlak puanlama, iki çıktı arasında ikili tercih, sıralama ve neyin yanlış olduğunu işaretleyen hata açıklaması. İkili karşılaştırma çoğu zaman sayısal bir ölçekten daha güvenilirdir. İyi uygulama: örnekli yazılı yönergeler, bir kalibrasyon turu, değerlendiricinin çıktıyı hangi sistemin ürettiğini görmediği kör inceleme, öğe başına birkaç değerlendirici ve rastgele örnekleme. Değerlendiriciler arası uyum, iki değerlendirici için Cohen kappa, daha fazlası için Fleiss kappa ya da Krippendorff alfa ile ölçülür; ham yüzde uyum tutarlılığı olduğundan yüksek gösterir, çünkü uyumun bir bölümü rastlantıyla oluşur. Düşük uyum çoğu zaman belirsiz ölçütlere işaret eder. Planlanacak maliyetler: işe alım ve eğitim, öğe başına süre, değerlendirici yorgunluğu ve rahatsız edici içeriğe maruz kalma. Elde edilen etiketler otomatik ölçütleri ve hakem modelleri doğrulamaya yarar.