Sade anlatım
Benchmark, yapay zeka modelleri için standart bir sınavdır. Her model aynı soruları aynı kurallarla yanıtlar; böylece puanlar, çoğunlukla leaderboard (liderlik tablosu) denen bir sıralamada yan yana konabilir. Okul notları gibi, sonuç genel yetenek hakkında bir şeyler söyler; adayın belirli bir işte nasıl çalışacağı hakkında ise pek az şey söyler.
Neden önemli
Benchmark puanları tedarikçi duyurularını ve satın alma sunumlarını doldurur; bir yöneticinin bu puanların ne kadar yük taşıyabileceğini bilmesi gerekir. Uzun bir model listesini kısaltmak için yararlıdırlar. İki biçimde eskirler. Doygunluk: en iyi modellerin hepsi tam puana yaklaştığında test onları ayırt edemez. Sızıntı (contamination): herkese açık sorular eğitim verisine karışır ve model daha önce gördüğü sorularda yüksek puan alır. Bu yüzden liderlik tablosundaki sıra, belirli bir iş görevi hakkında pek az şey söyler; bunu kurumun kendi vakalarıyla yapılan bir test gösterir.
Örnek
Bir lojistik şirketi, gümrük belgelerini okutmak için iki model arasında seçim yapacak. A modeli tanınmış bir liderlik tablosunda B modelinin üç sıra üstünde. Şirketin kendi 150 belgelik setinde ise B alanları vakaların %94'ünde, A %88'inde doğru çıkarıyor; B'nin maliyeti de A'nın üçte biri. Şirket B'yi seçiyor.
Bununla en çok karıştırılan kavram
Benchmark ve Evals (değerlendirmeler) arasındaki fark
İkisini ayıran, soruları kimin hazırladığıdır. Benchmark sorularını araştırmacılar herkes için yazar ve sorular yıllarca sabit kalır. Eval vakalarını ise bir ekip kendi sistemi için yazar ve vakalar ürünle birlikte değişir. Bir model bir benchmark'ta birinci olup bir eval'de başarısız olabilir, çünkü benchmark o şirketin belgelerini, müşterilerini ya da kurallarını hiç içermemiştir.
Köken: Sözcük haritacılıktan gelir; bench mark, yüksekliği bilinen ve diğer yüksekliklerin kendisine göre ölçüldüğü, taşa işlenmiş sabit noktadır.
Teknik katman
Bir benchmark bir veri seti, bir ölçüt ve modellerin nasıl çalıştırılacağını belirleyen bir protokolden oluşur; sonuçlar liderlik tablolarında yayımlanır. Bilinen örnekler: 57 konuda çoktan seçmeli sorulardan oluşan ve önde gelen modellerin artık %90'ın üzerinde puan aldığı MMLU; modelin düzeltmesi gereken 500 gerçek yazılım sorunundan oluşan SWE-bench Verified; soyut görsel bulmacalardan oluşan ARC-AGI; doygunluğa direnmesi için uzman düzeyinde sorularla hazırlanan Humanity's Last Exam; modelleri kullanıcıların anonim ikili karşılaştırma oylarıyla sıralayan Arena (eski adıyla LMArena). Bilinen sorunlar: doygunluk; test sorularının eğitim verisine sızması; tekrarlanan ayarlarla teste aşırı uyum, yani Goodhart yasasının bir örneği; bildirilen puanları karşılaştırmayı zorlaştıran istem, araç ve deneme sayısı farkları; soruların kendisindeki hatalar. OpenAI, Şubat 2026'da sızıntıyı ve hatalı test vakalarını gerekçe göstererek SWE-bench Verified sonuçlarını raporlamayı bıraktı. Karşı önlemler arasında gizli tutulan test setleri, düzenli yenilenen sorular ve bağımsız yeniden çalıştırmalar vardır.