Güvenlik

AI Safety

Yapay zeka güvenliği · yapay zeka emniyeti

Yapay zeka sistemlerinin zarar vermesini önlemeyi amaçlayan alan; zarar insanların kötüye kullanımından, sistemin kendi hatalarından ya da toplum üzerindeki geniş etkilerden doğabilir.

AI safetyzararı önlemek, nedeni ne olursa olsunKötüye kullanımdolandırıcılık, siber saldırıArızayanlış çıktı, kontrol kaybıSistemik etkilerişgücü, bağımlılık, yoğunlaşmaKurum için çalışma listesi: risk değerlendirmesi, evals, guardrail'ler, insan gözetimi, olay kaydı.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/ai-safety

Sade anlatım

Havacılığı güvenli kılan, motorun çevresindeki her şeydir: tasarım kuralları, test uçuşları, kontrol listeleri, olay raporları, denetçiler. Yapay zeka güvenliği aynı fikrin yapay zeka sistemlerine uygulanmasıdır: sistem hata yaptığında, biri onu kötüye kullanmaya çalıştığında ya da yapımcılarının beklediğinden daha yetenekli çıktığında ciddi bir zarar doğmasın diye yapılan araştırma, test ve kuralların bütünü. Modelin kendisini iyi davranacak biçimde eğitmek, yani hizalama, bu işin bir parçasıdır.

Neden önemli

Bir şirketi iki düzey ilgilendirir. Model düzeyinde güvenlik bir seçim ölçütüdür: geliştiriciler yayın öncesi testlerde, yayımladıkları bilgide ve olaylara verdikleri yanıtta birbirinden ayrılır. Kendi uygulamanız düzeyinde ise güvenlik sizin işinizdir: özensiz kurulmuş bir sistemin içindeki güvenli model yine zarar verir. Düzenleyiciler de aynı yöne gitti; AB Yapay Zeka Yasası hem sağlayıcılara hem de sistemi kullanan kurumlara yükümlülük getiriyor. Güvenlik çalışması zamana, bazen de yeteneğe mal olur, çünkü önlemler meşru isteklerin bir kısmını da engeller. Öteki seçenek, hataları canlı ortamda bulmaktır.

Örnek

Bir sigorta şirketi, müşterilerin sağlık teminatı sorularını yanıtlayacak bir asistan planlıyor. Yayın öncesi güvenlik incelemesi üç soru soruyor: yanıldığında ne olur, onu kim kötüye kullanabilir ve hatalar nasıl fark edilir? 300 test konuşmasının kontrolü, 9'unda asistanın tıbbi tavsiye verdiğini ortaya çıkarıyor. Ekip kapsamı daraltıyor, belirtilerle ilgili soruları hemşire hattına yönlendiriyor, her reddi kayda alıyor ve olaylar için bir sorumlu atıyor. Yayın üç hafta erteleniyor.

Bununla en çok karıştırılan kavram

AI Safety ve AI security (yapay zeka sistemlerinin siber güvenliği) arasındaki fark

AI SafetyYapay zeka sisteminin zarar vermesini önler
AI security (yapay zeka sistemlerinin siber güvenliği)Saldırganların sisteme zarar vermesini ya da onu ele geçirmesini önler

Safety, sistemden dışarı çıkan zararla ilgilidir: yanlış tavsiye, tehlikeli içerik, kimsenin amaçlamadığı eylemler. Security ise sisteme yönelen saldırılarla ilgilidir: prompt injection, veri hırsızlığı, çalınan model ağırlıkları. Türkçede ikisi de “güvenlik” diye çevrildiği için karıştırmak daha da kolaydır; safety için “emniyet” de denir. İki alan örtüşür, çünkü saldırıya açık bir sistem emniyetli olamaz ve jailbreak ikisine birden girer. Yine de çoğunlukla farklı ekipler, farklı yöntemlerle yürütür; bir projenin iki incelemeye de ihtiyacı vardır.

Teknik katman

Riskler, International AI Safety Report'ta olduğu gibi çoğunlukla üç gruba ayrılır: kötü niyetli kullanım (dolandırıcılık, siber saldırılar, silah geliştirmeye yardım), işlev bozuklukları (güvenilmez ya da yanlı çıktı, otonom sistemler üzerinde kontrolün yitirilmesi) ve sistemik etkiler (işgücü piyasaları, güç yoğunlaşması, bağımlılık). Teknik çalışma hizalamayı, dayanıklılığı, yorumlanabilirliği, tehlikeli yetenek değerlendirmelerini ve yayın sonrası izlemeyi içerir. Frontier model geliştiricileri, önlemleri yetenek eşiklerine bağlayan güvenlik çerçeveleri yayımlar (Anthropic'in Responsible Scaling Policy'si, OpenAI'ın Preparedness Framework'ü, Google DeepMind'ın Frontier Safety Framework'ü) ve test sonuçlarını model ya da sistem kartlarında bildirir. Hükümetler ileri modelleri test eden enstitüler kurdu; Birleşik Krallık 2025'te AI Safety Institute'un adını AI Security Institute olarak değiştirdi, bu da iki sözcüğün politika dilinde nasıl iç içe geçtiğini gösterir. Yapay zekayı devreye alan bir kurum için çalışma listesi daha kısadır: her kullanım senaryosu için risk değerlendirmesi, yayın öncesi eval'ler ve red teaming, guardrail'ler, sonucu ağır eylemlerde insan gözetimi, olay kaydı ve adı belli bir sorumlu. NIST AI Risk Management Framework ve ISO/IEC 42001 bu çalışmaya bir yapı kazandırır.

Yazan Mehmet Erkek · Son güncelleme: