Sade anlatım
Çok büyük bir ayar düğmesi paneli düşünün. Veri bir yandan girer, küçük hesaplama birimlerinden oluşan katmanlardan geçer ve öbür yandan bir sonuç çıkar. Her bağlantının, bir birimin bir sonrakini ne kadar etkileyeceğini belirleyen ve ağırlık denen bir düğmesi vardır. Öğrenmek, çıktılar doğru olana kadar bu düğmeleri azar azar çevirmektir. Kimse onları elle ayarlamaz; bunu eğitim süreci yapar.
Neden önemli
Her modern yapay zeka sisteminin altındaki yapı taşıdır; bir dil modeli, milyarlarca düğmesi olan bir sinir ağıdır. Bunu bilmek, yöneticilerin pratikte karşılaştığı iki şeyi açıklar. Birincisi, modelin bildikleri ağırlıklarına sayılar olarak dağılmıştır; model yanıldığında incelenecek ya da düzeltilecek bir kod satırı yoktur. İkincisi, davranışı eğitimle ya da bağlamına koyduklarınızla değişir; bir kuralı düzenleyerek değişmez.
Örnek
Bir ağ el yazısı rakamları okumayı öğreniyor. 28'e 28 piksellik bir görüntü 784 sayı olarak giriyor; iki gizli katman bunları dönüştürüyor; on çıktı her rakamın olasılığını veriyor. Başta tahminleri rastgele. 60.000 etiketli örnek görüp her küçük gruptan sonra ağırlıklarını ayarladıktan sonra, yeni el yazılarını yaklaşık %98 doğrulukla okuyor.
Bununla en çok karıştırılan kavram
Neural Network ve İnsan beyni arasındaki fark
Ad, olandan fazlasını çağrıştırır. Yapay nöronlar 1940'larda biyolojiden ödünç alınmış basitleştirilmiş bir fikirdir; gerçek nöronlar gibi çalışmazlar ve bir ağ bir çocuğun öğrendiği gibi öğrenmez. Benzetme sezgiye yardımcı olur, açıklama olarak ise yanıltır. Ad, bu sistemlerin insanlar gibi düşündüğüne kanıt değildir.
Köken: Fikir 1940'lara dayanır; Frank Rosenblatt 1958'de perceptron'u geliştirdi, backpropagation ise 1986'da çok katmanlı ağların eğitimini uygulanabilir kıldı.
Teknik katman
Her birim girdilerinin ağırlıklı toplamını hesaplar, bir sapma (bias) ekler ve ReLU gibi doğrusal olmayan bir aktivasyon fonksiyonu uygular. Birimler katmanlar halinde dizilir: girdi, gizli, çıktı. Eğitim, birçok veri grubu üzerinde dört adımı tekrarlar: ileri geçişi çalıştır; hatayı bir kayıp fonksiyonuyla ölç; her ağırlığın hataya ne kadar katkı yaptığını backpropagation ile hesapla; ağırlıkları gradient descent ile biraz kaydır. Mimariler, birimlerin nasıl bağlandığına göre ayrılır: tam bağlantılı, evrişimli, yinelemeli, transformer. Büyüklük parametre sayısıyla ölçülür: binlerden yüz milyarlara kadar. Bilinen özellikler: yeterli sayıda birimle bir ağ hemen hemen her fonksiyona yaklaşabilir, çok veri ister ve iç temsillerini yorumlamak zordur.