Değerlendirme ve kalite

Evals

Değerlendirmeler · eval'ler

Bir yapay zeka sisteminin kuruluş amacı olan işleri ne kadar iyi yaptığını ölçen sistematik testler; model, istem ya da veri her değiştiğinde aynı sabit vaka seti üzerinde yeniden çalıştırılır.

HER DEĞİŞİKLİKTE AYNI TEST SETİDeğişiklikistem, model, araçlarSeti çalıştır200 gerçek vakaPuanlaher yanıt notlanırKarşılaştır%91, önceki sürüm %86gerileme varsa düzelt, seti yeniden çalıştırPUANLAMA · ÜÇ TÜR PUANLAYICIKodbirebir eşleşme, biçim, testlerModelrubrikle puanlar: LLM-as-a-judgeİnsanuzmanlar bir örneklemi incelerToplam %86'dan %91'e çıktı, iade soruları %94'ten %78'e düştü: bunu konu kırılımı gösterir.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/evals

Sade anlatım

Çevirmen arayan bir şirket, adaya kendi belgelerinden birkaçını verir ve sonuca bakar. Eval'ler bir yapay zeka sistemi için bu iş örneğidir ve her değişiklikten sonra yinelenir: gerçek taleplerden oluşan bir set, her biri için iyi yanıtın tarifi ve bir puanlama yöntemi. Sonuç, geçen haftakiyle karşılaştırılabilen bir sayıdır; böylece “sanki daha iyi oldu” cümlesi “%86'dan %91'e çıktı” cümlesine dönüşür.

Neden önemli

Eval'ler uygulamalı yapay zekadaki en yararlı mühendislik alışkanlığıdır, çünkü diğer bütün kararlar onlara dayanır: hangi modelin alınacağı, daha ucuz bir modelin yetip yetmeyeceği, bir istem değişikliğinin işe yarayıp yaramadığı, sistemin yayına hazır olup olmadığı. Eval'i olmayan ekipler izlenimler üzerinden tartışır ve gerilemeleri müşteri şikâyetlerinden öğrenir. Bedeli gerçek emektir: işi bilen birinin vakaları yazması ve güncel tutması gerekir; bir puan da ancak arkasındaki vakalar kadar güvenilirdir.

Örnek

Bir perakendeci, destek asistanını onaylı yanıtları olan 200 gerçek müşteri sorusuyla test ediyor. Yeniden yazılan istem toplam puanı %86'dan %91'e çıkarıyor. Konu kırılımı ise iade sorularındaki puanın %94'ten %78'e düştüğünü gösteriyor. Ekip iade talimatını düzeltiyor ve yayından önce seti yeniden çalıştırıyor. Eval olmasaydı gerilemeyi müşteriler bulacaktı.

Bununla en çok karıştırılan kavram

Evals ve Benchmark (kıyaslama testi) arasındaki fark

EvalsKendi işleriniz ve veriniz; vakaları siz yazarsınız
Benchmark (kıyaslama testi)Herkes için aynı olan, kamuya açık standart test

Benchmark “genel olarak hangi model daha güçlü?” sorusunu yanıtlar. Eval ise “bu sistem bizim işimizi yeterince iyi yapıyor mu?” sorusunu. Benchmark'lar kısa bir model listesi çıkarmaya yarar. Satın alma, değiştirme ya da yayına alma kararı ise kurumun kendi vakalarından kurulan eval'lere dayanmalıdır; bu vakaları hiçbir model geliştirici görmemiştir ve hiçbir liderlik tablosu raporlamaz.

Teknik katman

Bir eval üç parçadan oluşur: girdilerden oluşan bir veri seti (çoğu zaman onaylı yanıtları içeren bir golden dataset), test edilen sistem ve puanlayıcılar. Üç tür puanlayıcı vardır: kod (birebir eşleşme, biçim ve şema kontrolleri, sayısal tolerans, üretilen kod için birim testleri), bir rubriği uygulayan model (LLM-as-a-judge) ve insanlar. Kod puanlayıcılar ucuz ve kesindir; model puanlayıcılar açık uçlu metne ölçeklenir; insan incelemesi ikisini de kalibre eder. İyi bir set gerçek kullanımı yansıtır, uç durumları ve sistemin reddetmesi gereken talepleri içerir, üretimde ya da red teaming'de bir hata bulundukça büyür. Uygulama: seti istem, model, araç ya da retrieval her değiştiğinde otomatik çalıştırın; puanları kategori bazında izleyin; çıktılar her seferinde değişebildiği için çalıştırmaları yineleyin; ajanlarda nihai sonucun yanında izlenen yolu da değerlendirin. Sabit vakalar üzerindeki çevrimdışı eval'leri, üretim trafiğinden alınan örneklerin çevrimiçi değerlendirmesi tamamlar. Açık kaynak çatılar arasında Inspect ve promptfoo vardır.

Yazan Mehmet Erkek · Son güncelleme: