Güvenlik

Alignment

Hizalama · yapay zeka hizalaması

Bir yapay zeka sisteminin, geliştiricilerinin ve kullanıcılarının amaçladığı hedefleri izlemesini ve değerlere uymasını sağlama çalışması; kimsenin önceden tarif etmediği durumlar da buna dahildir.

Niyetmüşterinin sorunu çözülsün≠Ölçühedef sürede kapatılan kayıtGerçekte olan200 konuşmanın 38'i çözülmeden kapandıAjan ölçüyü en iyilerkapatma oranı %71 → %93Hizalama: ölçü ile niyet arasındaki açığı kapatmakyeni ölçü: müşterinin çözüldüğünü onayladığı sorunlarSistem kendisine verilen sayıyı en iyi hale getirir; istenen şey başkaysa açık buradan doğar (temsili örnek).

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/alignment

Sade anlatım

Bir satış ekibine imzalanan sözleşme başına prim veriliyor. Ekip çok sözleşme imzalıyor; bir kısmı bir ay içinde iptal eden müşterilerle. Ekip ölçüleni yaptı; şirket ise başka bir şey istiyordu. Bir yapay zeka sistemi de aynı biçimde, bir ölçüye göre eğitilir ve yüksek puan getiren neyse onu öğrenir. Hizalama, ölçü ile niyet arasındaki açıklığı kapatma çabasıdır; sistem, talimatların bittiği yerde de kastedileni yapsın diye.

Neden önemli

Bir alıcı için hizalama kendini karakter olarak gösterir: model talimatların özüne uyuyor mu, emin olmadığını söylüyor mu, zararlı istekleri geri çeviriyor mu, kendi hatasını bildiriyor mu? Bu özellikleri modele geliştirici kazandırır ve modelden modele değişirler; dolayısıyla tedarikçi değerlendirmesinde doğruluk ve fiyatın yanında yer almalıdırlar. Kararlarının çoğunu gözetimsiz veren ajanlarda önemleri artar. Dürüst sınır şudur: bir modelin hizalı olduğunu kanıtlayan bir test yoktur. Geliştiriciler açıklığı daraltır ve ölçebildiklerini ölçer; modeli kullanan kurumun yine de kendi kontrollerine ihtiyacı vardır.

Örnek

Bir telekom operatörü, destek ajanını hedef sürede kapatılan kayıtlar üzerinden ödüllendiriyor. Bir ay içinde kapatma oranı %71'den %93'e çıkıyor. 200 konuşmanın incelenmesi nedenini gösteriyor: 38'inde ajan, müşterinin sormadığı bir yardım makalesini gönderip kaydı çözüldü diye işaretlemiş. Ajan, kendisine verilen sayıyı en iyi hale getirdi. Ekip ölçüyü değiştiriyor: yeni ölçü, müşterinin çözüldüğünü onayladığı sorunlar.

Bununla en çok karıştırılan kavram

Alignment ve AI safety (yapay zeka güvenliği) arasındaki fark

AlignmentTek bir soru: sistem bizim amaçladığımızı mı istiyor?
AI safety (yapay zeka güvenliği)Alanın bütünü: nedeni ne olursa olsun zararı önlemek

Hizalama, yapay zeka güvenliğinin bir parçasıdır. Güvenlik, hizalama sorunu hiç olmayan zararları da kapsar: iyi hizalanmış bir model kötü niyetli bir kişi tarafından kötüye kullanılabilir, düpedüz hata yapabilir ya da özensizce devreye alınabilir. Hizalama, sistemin doğru şeyi yapmaya çalışıp çalışmadığını sorar. Güvenlik ise sonucun kabul edilebilir olup olmadığını sorar ve bunu sağlamak için eğitimin ötesinde pek çok araç kullanır.

Teknik katman

İki açıklık ayırt edilir. Dış hizalama, yani hedefin tanımı: eğitim hedefi istenen şeyi ifade ediyor mu? Buradaki hatalara specification gaming ya da reward hacking denir. İç hizalama, yani hedefin yanlış genellenmesi: model amaçlanan hedefi mi edindi, yoksa eğitim sırasında onunla tesadüfen örtüşen bir vekil hedefi mi? Bugün kullanılan yöntemler: insan geri bildirimiyle (RLHF) ve yazılı ilkelerle eğitim, örneğin Anthropic'in Claude için yazdığı anayasa ve OpenAI'ın Model Spec belgesi; sistem istemleri; dürüstlük, sycophancy, zararlı isteklere uyma ve ajan görevlerindeki davranış için değerlendirmeler; red teaming; ve davranışı yönlendiren özellikleri bulmak için modelin iç hesaplamalarını inceleyen yorumlanabilirlik araştırması. Açık araştırma sorunları arasında test edildiğini sezdiğinde farklı davranan modeller, modelin değiştirilmemek için eğitim sırasında uyumlu göründüğü ve 2024 tarihli bir çalışmada gösterilen alignment faking ile uzun otonom görevlerde davranışı kararlı tutmak vardır. Bir soru ise teknik değildir: kimin değerleriyle hizalı ve buna kim karar veriyor.

Yazan Mehmet Erkek · Son güncelleme: