Güvenlik

Red Teaming

Kırmızı takım testi

Kendi yapay zeka sisteminize, bir saldırganın yapacağı gibi bilerek saldırıp açıklarını başkasından önce bulmak.

1 · Saldırkötü niyetli kullanıcı gibi dene2 · Bulişe yarayan saldırıyı kaydet3 · Düzeltistem, bariyer, yetki4 · Yeniden test etdüzeltme tuttu mu?DÖNGÜher sürümde tekrarlaAmaç sistemi kırmak değil, saldırgandan önce kırılacağı yeri bulmaktır.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/red-teaming

Sade anlatım

Bankalar kendi kasalarına girmeyi denemeleri için insan tutar. Red teaming aynısını bir yapay zeka sistemi için yapar: bir ekip saldırgan rolüne girer, modele veri sızdırtmayı, kurallarını çiğnetmeyi ya da zararlı eylemler yaptırmayı dener ve işe yarayan her şeyi düzeltilmek üzere kayda geçirir.

Neden önemli

Olağan test, sistemin yapması gerekeni yapıp yapmadığına bakar. Red teaming ise sisteme neler yaptırılabileceğine bakar; pahalı olaylar da oradan çıkar. Düzenleyiciler ve kurumsal müşteriler bunun kanıtını giderek daha çok bekliyor; guardrail'lerinizin baskı altında ne kadar dayandığını öğrenmenin tek dürüst yolu da budur.

Örnek

Bir müşteri hizmetleri ajanını yayına almadan önce bir ekip bir haftasını ona ayırıyor: test e-postalarına talimat gizliyor, başka müşterilerin siparişlerini soruyor, politika dışı iadeler için dil döküyor. İşe yarayan on bir saldırı buluyor, dokuzunu düzeltiyor, kalan iki durum için insan onayı ekliyor.

Bununla en çok karıştırılan kavram

Red Teaming ve Evals arasındaki fark

Red TeamingBilinmeyen açıkları arar
EvalsBilinen davranışı ölçer

Eval, performansı sabit bir vaka setine karşı ölçer: sistem bunları hâlâ doğru yapıyor mu? Red teaming açık uçlu ve saldırgandır: kimsenin listelemediği neyi yaptırabiliriz? Red teaming bulguları genellikle yeni eval vakalarına dönüşür; böylece aynı açık fark edilmeden yeniden açılamaz.

Teknik katman

Kapsam modeli (jailbreak, zararlı içerik, yanlılık), uygulamayı (prompt injection, veri sızdırma, araçlar üzerinden yetki yükseltme) ve çevresindeki süreci içerir. Yöntemler, uzmanların elle yaptığı denemeleri otomatik saldırı üretimiyle birleştirir; otomatik üretimde bir model başka bir modele karşı saldırı üretir ve çeşitlendirir. İyi uygulama: yazılı bir tehdit modeli, etkiye göre tanımlanmış başarı ölçütleri, sürümler boyunca izlenen saldırı başarı oranı ve her model, istem ya da araç değişikliğinden sonra yeniden test. Başvuru çerçeveleri arasında OWASP'ın LLM uygulamaları için ilk 10 listesi, MITRE ATLAS ve NIST AI Risk Management Framework bulunur.

Yazan Mehmet Erkek · Son güncelleme: