Sade anlatım
Bir kompozisyon cevap anahtarıyla puanlanamaz; birinin onu okuması gerekir. Elli bin kompozisyon olduğunda okul yardımcı okuyucular tutar ve ellerine bir puanlama anahtarı verir. LLM-as-a-judge aynısını bir modelle yapar: model soruyu, yanıtı ve puanlama anahtarını alır, kısa bir gerekçeyle birlikte kararını bildirir. Yardımcı okuyucularda olduğu gibi, asıl öğretmen onların puanlamasını örneklem üzerinden denetlemeyi sürdürür.
Neden önemli
Değerli yapay zeka çıktılarının çoğu serbest metindir; bir yanıtın doğru, eksiksiz ya da nazik olup olmadığını hiçbir birebir eşleşme kontrolü söyleyemez. Hakem model, her değişiklikte her test vakasını puanlamayı ve üretim trafiğinden her gün örnek almayı karşılanabilir kılar. Sınırı şudur: hakem de kendi hataları ve yanlılıkları olan bir modeldir. Kararları aynı vakalardaki insan kararlarıyla karşılaştırılana kadar puanları, kalitesi bilinmeyen bir görüştür; bu puanlara dayanan bir gösterge paneli de son derece kesin görünen yanlış bir tablo çizebilir.
Örnek
Bir sigorta şirketinin asistanı haftada 5.000 hasar özeti yazıyor. Hasar uzmanları bunların yaklaşık 100'ünü inceleyebiliyor. Ekip dört ölçütlü bir rubrik (puanlama anahtarı) yazıyor ve her özeti bir hakem modele puanlatıyor. Uzmanların daha önce puanladığı 300 özette hakem, vakaların %91'inde uzmanlarla aynı kararı veriyor. Ayrışmaların çoğu eksik poliçe numaralarıyla ilgili; ekip o ölçütü yeniden yazıyor ve karşılaştırmayı yineliyor.
Bununla en çok karıştırılan kavram
LLM-as-a-Judge ve Human evaluation (insan değerlendirmesi) arasındaki fark
İkisi birlikte çalışır. İnsan değerlendirmesi iyinin ne olduğunu tanımlar ve hakemin karşılaştırılacağı etiketleri üretir. Hakem de bu yargıyı hiçbir ekibin okuyamayacağı hacimlere taşır. Risk yüksekse ya da ölçütler inceyse, örneğin tıbbi tavsiyede ya da marka üslubunda, son söz insanlarda kalır ve hakem bir ön eleme görevi görür.
Köken: Terimi, Lianmin Zheng ve arkadaşlarının 2023 tarihli “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena” makalesi yaygınlaştırdı.
Teknik katman
Hakem istemi ölçütleri, değerlendirilecek malzemeyi ve varsa bir referans yanıtı içerir. Biçimler: ölçüt başına geçti ya da kaldı kararı, bir ölçek üzerinde puan ya da iki yanıtın ikili karşılaştırması. Güvenilirliği artıran tasarım kuralları: her çağrıda tek ölçüt, her düzeyi tarif edilmiş ikili ya da düşük çözünürlüklü ölçekler, karardan önce gerekçe isteme, puanlanmış yanıt örnekleri ve yapılandırılmış çıktı. Belgelenmiş yanlılıklar: ikili karşılaştırmada konum yanlılığı (sıra değiştirilerek dengelenir), uzun yanıtları tercih etme ve bazı çalışmalarda hakemin kendi çıktılarını kayırması. Kalibrasyon: insanlara bir örneklemi etiketletin, hakemle uyumu doğruluk ya da Cohen kappa ile ölçün, rubriği düzeltin; hakem model ya da istemi her değiştiğinde yineleyin. Hakemi, test edilen sistemden farklı bir model ailesinden seçmek ortak kör noktaları azaltır. Hakemler, olguları doğrulayacak bilgiye sahip olmadıkları yerde zayıftır; bu tür kontroller referans yanıt ya da retrieval gerektirir.