Sade anlatım
Çevirmen arayan bir şirket, adaya kendi belgelerinden birkaçını verir ve sonuca bakar. Eval'ler bir yapay zeka sistemi için bu iş örneğidir ve her değişiklikten sonra yinelenir: gerçek taleplerden oluşan bir set, her biri için iyi yanıtın tarifi ve bir puanlama yöntemi. Sonuç, geçen haftakiyle karşılaştırılabilen bir sayıdır; böylece “sanki daha iyi oldu” cümlesi “%86'dan %91'e çıktı” cümlesine dönüşür.
Neden önemli
Eval'ler uygulamalı yapay zekadaki en yararlı mühendislik alışkanlığıdır, çünkü diğer bütün kararlar onlara dayanır: hangi modelin alınacağı, daha ucuz bir modelin yetip yetmeyeceği, bir istem değişikliğinin işe yarayıp yaramadığı, sistemin yayına hazır olup olmadığı. Eval'i olmayan ekipler izlenimler üzerinden tartışır ve gerilemeleri müşteri şikâyetlerinden öğrenir. Bedeli gerçek emektir: işi bilen birinin vakaları yazması ve güncel tutması gerekir; bir puan da ancak arkasındaki vakalar kadar güvenilirdir.
Örnek
Bir perakendeci, destek asistanını onaylı yanıtları olan 200 gerçek müşteri sorusuyla test ediyor. Yeniden yazılan istem toplam puanı %86'dan %91'e çıkarıyor. Konu kırılımı ise iade sorularındaki puanın %94'ten %78'e düştüğünü gösteriyor. Ekip iade talimatını düzeltiyor ve yayından önce seti yeniden çalıştırıyor. Eval olmasaydı gerilemeyi müşteriler bulacaktı.
Bununla en çok karıştırılan kavram
Evals ve Benchmark (kıyaslama testi) arasındaki fark
Benchmark “genel olarak hangi model daha güçlü?” sorusunu yanıtlar. Eval ise “bu sistem bizim işimizi yeterince iyi yapıyor mu?” sorusunu. Benchmark'lar kısa bir model listesi çıkarmaya yarar. Satın alma, değiştirme ya da yayına alma kararı ise kurumun kendi vakalarından kurulan eval'lere dayanmalıdır; bu vakaları hiçbir model geliştirici görmemiştir ve hiçbir liderlik tablosu raporlamaz.
Teknik katman
Bir eval üç parçadan oluşur: girdilerden oluşan bir veri seti (çoğu zaman onaylı yanıtları içeren bir golden dataset), test edilen sistem ve puanlayıcılar. Üç tür puanlayıcı vardır: kod (birebir eşleşme, biçim ve şema kontrolleri, sayısal tolerans, üretilen kod için birim testleri), bir rubriği uygulayan model (LLM-as-a-judge) ve insanlar. Kod puanlayıcılar ucuz ve kesindir; model puanlayıcılar açık uçlu metne ölçeklenir; insan incelemesi ikisini de kalibre eder. İyi bir set gerçek kullanımı yansıtır, uç durumları ve sistemin reddetmesi gereken talepleri içerir, üretimde ya da red teaming'de bir hata bulundukça büyür. Uygulama: seti istem, model, araç ya da retrieval her değiştiğinde otomatik çalıştırın; puanları kategori bazında izleyin; çıktılar her seferinde değişebildiği için çalıştırmaları yineleyin; ajanlarda nihai sonucun yanında izlenen yolu da değerlendirin. Sabit vakalar üzerindeki çevrimdışı eval'leri, üretim trafiğinden alınan örneklerin çevrimiçi değerlendirmesi tamamlar. Açık kaynak çatılar arasında Inspect ve promptfoo vardır.