Sade anlatım
“Hayır” diyen bir kredi uzmanına nedenini sorabilir, yanıtını dosyayla karşılaştırabilirsiniz. “Hayır” diyen bir model ise yalnızca bir sayı üretmiştir. Açıklanabilirlik, o sayıyı insanın kullanabileceği gerekçelere çeviren yöntemlerin bütünüdür: en çok şu üç etken ağır bastı, şu değişiklik sonucu değiştirirdi. Bugünün büyük modellerinde bu gerekçeler dışarıdan yapılan yeniden kurgulardır; içerideki hesabın tamamını henüz kimse okuyamıyor.
Neden önemli
Bir karar bir insanı etkiliyorsa biri mutlaka nedenini sorar: müşteri, denetçi, mahkeme. Avrupa veri koruma hukuku ve AB Yapay Zeka Yasası, belirli durumlarda otomatik ya da yüksek riskli sistemlerle verilen kararlar için açıklama isteme hakkı tanır. Açıklamalar ekiplerin hataları ve yanlılığı bulmasına da yardım eder. İki sınır vardır. Etkisi büyük kararlarda, doğruluktan bir miktar ödün verilse bile daha basit ve şeffaf bir model daha iyi seçim olabilir. Bir dil modelinin kendi akıl yürütmesi hakkında anlattıkları ise akıcı bir metindir ve yanıtı gerçekte neyin belirlediğini atlayabilir; denetim izi olarak kullanılamaz.
Örnek
Bir bankanın kredi modeli bir başvuruyu reddediyor. Müşteri temsilcisi kararın yanında skoru en çok aşağı çeken etkenleri görüyor: borcun gelire oranı %46, son bir yılda bir gecikmiş ödeme ve 14 aylık kredi geçmişi. Müşteriye sonucu neyin değiştireceğini söyleyebiliyor: borç oranı %35'in altında olsaydı başvuru geçerdi. Tek bir etken binlerce redde ağır basıyorsa risk ekibinin elinde incelenecek somut bir konu oluyor.
Bununla en çok karıştırılan kavram
XAI ve Interpretability (yorumlanabilirlik) arasındaki fark
Sözcükler çoğu zaman eş anlamlı kullanılır. Ayrıldıkları yerde yorumlanabilirlik, mekanizmanın kendisinin anlaşılabilmesidir: kısa bir karar ağacı tasarımı gereği yorumlanabilir, sinir ağları üzerine araştırmalar ise içerideki özellikleri okumaya çalışır. Açıklanabilirlik daha geniş ve pratik bir hedeftir: insana kullanabileceği gerekçeler vermek. Bu çoğu zaman sonradan eklenen bir yaklaşıklamayla yapılır. Bir açıklama ikna edici olup yine de modelin gerçekte yaptığına sadık olmayabilir.
Köken: XAI kısaltması, DARPA'nın 2016'da duyurduğu açıklanabilir yapay zeka araştırma programıyla yayıldı.
Teknik katman
Üç düzey vardır. Yorumlanabilir modeller (doğrusal modeller, küçük karar ağaçları, skor kartları) doğrudan okunabilir. Sonradan uygulanan (post-hoc) yöntemler kara kutuyu dışarıdan açıklar: SHAP ya da LIME ile özellik katkıları, saliency haritaları, karşı-olgusal açıklamalar (sonucu değiştiren en küçük değişiklik) ve vekil modeller. Bunlar yaklaşık sonuç verir, birbirleriyle çelişebilir; sadakat ve kararlılık açısından test edilmeleri gerekir. Mekanistik yorumlanabilirlik sinir ağlarının içiyle uğraşır, öğrenilmiş özellikleri ve devreleri izler; hâlâ bir araştırma alanıdır. Dil modellerinde pratikteki ikameler kaynak gösterimi, araç çağrılarının trace'leri ve yapılandırılmış gerekçelerdir; modelin görünür akıl yürütmesi yararlı bir kanıttır, ancak belirleyici etkenleri atlayabildiği gösterilmiştir. Düzenleme: GDPR, yalnızca otomatik verilen kararların mantığı hakkında anlamlı bilgi alma hakkı tanır; KVKK, yalnızca otomatik analizle ortaya çıkan aleyhte sonuca itiraz hakkı verir; AB Yapay Zeka Yasası da yüksek riskli sistemlerle alınan kararlar için açıklama hakkı getirir. Model kartı gibi belgeler modelin bütününü anlatır.