Güvenlik

Adversarial Attack

Çekişmeli saldırı · düşmanca saldırı

Bir yapay zeka modelini, bu amaçla hazırlanmış girdiyle bilerek yanıltma girişimi; çoğu zaman insanın fark edemeyeceği kadar küçük bir değişiklik modeli kendinden emin bir yanlış yanıta götürür.

İlan fotoğrafımodel: “sahte çanta”+Silik bir deseninsan gözü fark etmez=Aynı fotoğrafmodel: “orijinal”SAHTE İLAN YAKALAMA ORANI · temsiliönce%94iki ay sonra%61Modele sızan olmadı: model, yargısının en kırılgan olduğu noktadan yanıltıldı.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/adversarial-attack

Sade anlatım

Bir dur levhasına birkaç küçük çıkartma yapıştırın. Bütün sürücüler hâlâ bir dur levhası görür; bir görü modeli ise hız sınırı okuyabilir. Çıkartmalar, modelin yargısının en kırılgan olduğu yerlere yerleştirilmiştir. Çekişmeli saldırı bu zayıf noktaları arar ve insana sıradan görünen, makineye ise başka bir şey ifade eden bir girdi kurar. Modelin içine giren olmamıştır. Ona, hiç hazırlanmadığı bir şey gösterilmiştir.

Neden önemli

Bir modelin test doğruluğu, dürüst girdilerdeki davranışını anlatır. Birinin onu kandırmaktan kazanç sağladığı her yerde (dolandırıcılık tespiti, içerik denetimi, kimlik doğrulama, spam süzme, zararlı yazılım taraması) girdiler modele karşı biçimlendirilir ve saldırı altındaki doğruluk, bildirilen rakamın çok altına düşebilir. Tedarikçilerden ortalama doğruluğun yanında çekişmeli test sonuçlarını da isteyin. Hiçbir model tümüyle dayanıklı değildir ve dayanıklılığı artırmak genellikle normal girdilerdeki doğruluktan bir miktar götürür; bu yüzden tek bir yanlış kararın yol açabileceği zararı modelin çevresindeki sistem sınırlamalıdır.

Örnek

Bir pazaryeri, sahte çanta ilanlarını bir görüntü modeliyle engelliyor; model bunların %94'ünü yakalıyor. Sahte ürün satıcıları, fotoğrafın üzerine bindirilen ve alıcıların göremediği silik bir desenin, modele aynı çantayı “orijinal” diye etiketlettiğini keşfediyor. İki ay içinde yeni ilanlardaki yakalama oranı %61'e düşüyor. Ekip modeli manipüle edilmiş fotoğraflarla yeniden eğitiyor, satıcı geçmişi kontrolü ekliyor ve sınırda kalan ilanları inceleme ekibine yönlendiriyor.

Bununla en çok karıştırılan kavram

Adversarial Attack ve Jailbreak arasındaki fark

Adversarial AttackÖzel hazırlanmış girdi, modelin gördüğünü yanlış yargılatır
JailbreakÖzel kurgulanmış konuşma, modele kurallarını bıraktırır

Geniş anlamda jailbreak, dil modelinin güvenlik kurallarını hedefleyen bir çekişmeli saldırı türüdür. Gündelik kullanımda ise terim daha eski bir sorunu anlatır: özel hazırlanmış girdilerle kandırılan sınıflandırıcılar ve tespit modelleri; ortada bir konuşma yoktur. Fark test açısından önemlidir. Bir dolandırıcılık modelinin, manipüle edilmiş girdilerle dayanıklılık testinden geçmesi gerekir; bir sohbet botunun ise konuşmalarının red teaming'den.

Köken: Çekişmeli örnekleri 2013'te Christian Szegedy ve arkadaşları tanımladı; bir görüntüdeki fark edilemeyen değişikliklerin bir sinir ağının yanıtını değiştirebildiğini gösterdiler.

Teknik katman

NIST'in çekişmeli makine öğrenmesi raporunda kullanılan standart sınıflandırma, saldırıları aşamaya ve amaca göre ayırır. Atlatma (evasion): girdiyi kullanım anında manipüle etmek (çekişmeli örnekler). Zehirleme: eğitim verisini manipüle etmek. Mahremiyet saldırıları: eğitim verisini çıkarmak ya da bir kaydın o veride bulunup bulunmadığını anlamak. Model çıkarma: modeli sorgulayarak kopyalamak. Saldırgan ağırlıkları bilip gradyanları izleyebiliyorsa saldırı beyaz kutu (FGSM ve PGD'de olduğu gibi), yalnızca çıktıları görebiliyorsa kara kutudur; bir modele karşı üretilen örnekler çoğu zaman başka bir modelde de işe yarar. Fiziksel türleri vardır: basılı yamalar, değiştirilmiş levhalar, desenli gözlükler. Dil modellerindeki karşılıkları, otomatik üretilen düşmanca son ekler ve manipüle edilmiş belgelerdir. Savunmalar: saldırıya uğramış örneklerle çekişmeli eğitim, girdi ön işleme, model toplulukları, olağan dışı girdilerin tespiti, sorgu sınırları ve kararın önemli olduğu yerde insan incelemesi. Dayanıklılık, tanımlı bir saldırı bütçesi altındaki doğruluk olarak ölçülür ve düz doğruluğa kıyasla çok daha seyrek raporlanır.

Yazan Mehmet Erkek · Son güncelleme: