Değerlendirme ve kalite

Benchmark

Kıyaslama testi

Yapay zeka modellerini birbiriyle karşılaştırmak için kullanılan, görevleri ve puanlama yöntemi sabit olan, kamuya açık standart test.

puanzaman →temsili eğrilertam puanBenchmark A: doygunBenchmark B: yeni, daha zorAYNI İKİ MODELLiderlik tablosundaA, B'nin üç sıra üstündeKendi 150 belgesindeB %94 · A %88karar buna dayanırDoygun bir benchmark liderleri ayırt edemez; liderlik tablosu da sizin belgelerinizi hiç içermedi.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/benchmark

Sade anlatım

Benchmark, yapay zeka modelleri için standart bir sınavdır. Her model aynı soruları aynı kurallarla yanıtlar; böylece puanlar, çoğunlukla leaderboard (liderlik tablosu) denen bir sıralamada yan yana konabilir. Okul notları gibi, sonuç genel yetenek hakkında bir şeyler söyler; adayın belirli bir işte nasıl çalışacağı hakkında ise pek az şey söyler.

Neden önemli

Benchmark puanları tedarikçi duyurularını ve satın alma sunumlarını doldurur; bir yöneticinin bu puanların ne kadar yük taşıyabileceğini bilmesi gerekir. Uzun bir model listesini kısaltmak için yararlıdırlar. İki biçimde eskirler. Doygunluk: en iyi modellerin hepsi tam puana yaklaştığında test onları ayırt edemez. Sızıntı (contamination): herkese açık sorular eğitim verisine karışır ve model daha önce gördüğü sorularda yüksek puan alır. Bu yüzden liderlik tablosundaki sıra, belirli bir iş görevi hakkında pek az şey söyler; bunu kurumun kendi vakalarıyla yapılan bir test gösterir.

Örnek

Bir lojistik şirketi, gümrük belgelerini okutmak için iki model arasında seçim yapacak. A modeli tanınmış bir liderlik tablosunda B modelinin üç sıra üstünde. Şirketin kendi 150 belgelik setinde ise B alanları vakaların %94'ünde, A %88'inde doğru çıkarıyor; B'nin maliyeti de A'nın üçte biri. Şirket B'yi seçiyor.

Bununla en çok karıştırılan kavram

Benchmark ve Evals (değerlendirmeler) arasındaki fark

BenchmarkKamuya açık ve genel; her model ve alıcı için aynı
Evals (değerlendirmeler)Özel; tek bir sistem ve onun işleri için yazılır

İkisini ayıran, soruları kimin hazırladığıdır. Benchmark sorularını araştırmacılar herkes için yazar ve sorular yıllarca sabit kalır. Eval vakalarını ise bir ekip kendi sistemi için yazar ve vakalar ürünle birlikte değişir. Bir model bir benchmark'ta birinci olup bir eval'de başarısız olabilir, çünkü benchmark o şirketin belgelerini, müşterilerini ya da kurallarını hiç içermemiştir.

Köken: Sözcük haritacılıktan gelir; bench mark, yüksekliği bilinen ve diğer yüksekliklerin kendisine göre ölçüldüğü, taşa işlenmiş sabit noktadır.

Teknik katman

Bir benchmark bir veri seti, bir ölçüt ve modellerin nasıl çalıştırılacağını belirleyen bir protokolden oluşur; sonuçlar liderlik tablolarında yayımlanır. Bilinen örnekler: 57 konuda çoktan seçmeli sorulardan oluşan ve önde gelen modellerin artık %90'ın üzerinde puan aldığı MMLU; modelin düzeltmesi gereken 500 gerçek yazılım sorunundan oluşan SWE-bench Verified; soyut görsel bulmacalardan oluşan ARC-AGI; doygunluğa direnmesi için uzman düzeyinde sorularla hazırlanan Humanity's Last Exam; modelleri kullanıcıların anonim ikili karşılaştırma oylarıyla sıralayan Arena (eski adıyla LMArena). Bilinen sorunlar: doygunluk; test sorularının eğitim verisine sızması; tekrarlanan ayarlarla teste aşırı uyum, yani Goodhart yasasının bir örneği; bildirilen puanları karşılaştırmayı zorlaştıran istem, araç ve deneme sayısı farkları; soruların kendisindeki hatalar. OpenAI, Şubat 2026'da sızıntıyı ve hatalı test vakalarını gerekçe göstererek SWE-bench Verified sonuçlarını raporlamayı bıraktı. Karşı önlemler arasında gizli tutulan test setleri, düzenli yenilenen sorular ve bağımsız yeniden çalıştırmalar vardır.

Yazan Mehmet Erkek · Son güncelleme: