Değerlendirme ve kalite

Human Evaluation

İnsan değerlendirmesi

Yapay zeka çıktılarının konu uzmanları, eğitimli etiketleyiciler ya da son kullanıcılar gibi insanlar tarafından, tanımlı ölçütlere göre puanlanması, karşılaştırılması ya da düzeltilmesi.

değerlendirme başına maliyetdeğerlendirme sayısıKonu uzmanlarıaz sayıda, pahalı; doğruyu tanımlarEğitimli etiketleyicileryazılı rubriği yüzlerce çıktıya uygularSon kullanıcılarbeğeni, düzeltme, A/B testi: binlerce sinyal, gürültülüUyum kontrolü: 3 uyum uzmanı, aynı 200 yanıt122'sinde oybirliği → rubrik yeniden yazıldı → sonraki 200'ün 176'sında oybirliğiDeğerlendiriciler ayrışıyorsa ölçütler çoğu zaman belirsizdir: önce rubriği düzeltin.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/human-evaluation

Sade anlatım

Bir şarap üreticisi şekeri ve asidi laboratuvarda ölçebilir; yine de tadımcı çalıştırır, çünkü şarabın iyi olup olmadığı bir insan yargısıdır. Yapay zeka çıktısı da böyledir. Yazılım bir yanıtın biçimini kontrol edebilir; yanıtın doğru, yararlı ve yerinde bir üslupla yazılmış olup olmadığına ise onu okuyan insanlar karar verir. İnsan değerlendirmesi bu okumayı sabit ölçütlerle ve birkaç okuyucuyla düzene sokar; böylece sonuç sayılabilir ve karşılaştırılabilir.

Neden önemli

İnsan yargısı, değerlendirmedeki her şeyin referansıdır: otomatik ölçütlere ve hakem modellere, insanlarla uyuştukları ölçüde güvenilir. Bir ürün yayına alınırken, risk yüksekken, kalite uzmanlık ya da zevk meselesiyken ve otomatik puan ile kullanıcı şikâyetleri farklı yönleri gösterdiğinde vazgeçilmezdir. Aynı zamanda yavaş ve pahalıdır; insanlar birbiriyle ayrışır, yorulur ve zamanla ölçütlerinden kayar. Pratik çözüm, insan dikkatini en çok fark yarattığı yere harcamak ve onu daha ucuz yöntemleri kalibre etmek için kullanmaktır.

Örnek

Bir banka, yatırım bilgilendirme asistanını yayına hazırlıyor. Üç uyum uzmanının her biri aynı 200 yanıtı kabul edilebilir ya da kabul edilemez olarak puanlıyor. 122 yanıtta oybirliği var. Rubrik sınırdaki durumların örnekleriyle yeniden yazıldıktan sonra, 200 yeni yanıtla yapılan ikinci turda oybirliği 176'ya çıkıyor. Çalışma yaklaşık 30 saatlik uzman zamanı alıyor ve bir hakem modeli kalibre etmekte kullanılan etiketleri sağlıyor.

Bununla en çok karıştırılan kavram

Human Evaluation ve Human-in-the-Loop (HITL) arasındaki fark

Human EvaluationKaliteyi ölçmek için çıktılardan bir örneklemi puanlar
Human-in-the-Loop (HITL)Her eylemi gerçekleşmeden önce onaylar ya da reddeder

İkisi de yapay zeka çıktısının karşısına bir insan koyar; amaçları farklıdır. İnsan değerlendirmesi ölçümdür: insanlar bir örneklemi, genellikle yayından önce ya da belirli aralıklarla puanlar ve sonuç geliştirmeye yön verir. Human-in-the-loop ise kontroldür: bir kişi canlı işleyişte belirli bir eylemi gerçekleşmeden önce onaylar. Bir sistem insan değerlendirmesinden geçmiş olsa da riskli eylemlerde döngüde bir insana ihtiyaç duyabilir.

Teknik katman

Üç değerlendirici grubu vardır: konu uzmanları (az sayıda ve pahalı; doğruluğun bilgi gerektirdiği yerde şart), yönergelerle çalışan eğitimli etiketleyiciler (daha büyük hacimler, tutarlı ölçütler) ve son kullanıcılar (beğeni ya da beğenmeme, düzeltmeler, A/B testleri; bol ve gürültülü). Biçimler: bir rubriğe göre mutlak puanlama, iki çıktı arasında ikili tercih, sıralama ve neyin yanlış olduğunu işaretleyen hata açıklaması. İkili karşılaştırma çoğu zaman sayısal bir ölçekten daha güvenilirdir. İyi uygulama: örnekli yazılı yönergeler, bir kalibrasyon turu, değerlendiricinin çıktıyı hangi sistemin ürettiğini görmediği kör inceleme, öğe başına birkaç değerlendirici ve rastgele örnekleme. Değerlendiriciler arası uyum, iki değerlendirici için Cohen kappa, daha fazlası için Fleiss kappa ya da Krippendorff alfa ile ölçülür; ham yüzde uyum tutarlılığı olduğundan yüksek gösterir, çünkü uyumun bir bölümü rastlantıyla oluşur. Düşük uyum çoğu zaman belirsiz ölçütlere işaret eder. Planlanacak maliyetler: işe alım ve eğitim, öğe başına süre, değerlendirici yorgunluğu ve rahatsız edici içeriğe maruz kalma. Elde edilen etiketler otomatik ölçütleri ve hakem modelleri doğrulamaya yarar.

Yazan Mehmet Erkek · Son güncelleme: