Sade anlatım
Eski makine öğrenmesinde neyin ölçüleceğine bir uzmanın karar vermesi gerekirdi: bir fotoğraf için belki kenarlar, renkler ve dokular. Derin öğrenme bu adımı atlar. Yeterince örnek verildiğinde ağ neye bakacağını kendisi çıkarır; ilk katmanlardaki basit örüntülerden son katmanlardaki bütün kavramlara doğru ilerler. “Derin” sözcüğü katman sayısını anlatır; anlayışın derinliği hakkında bir iddia taşımaz.
Neden önemli
Bugün yapay zeka denen şeylerin neredeyse tamamı derin öğrenmedir: dil modelleri, görsel üreticiler, konuşma tanıma, çeviri, sürücüsüz araçların algı sistemleri. Gücü yapılandırılmamış veridedir; kurumların elindeki verinin çoğu da böyledir. Bedeli veri ve hesaplama gücü iştahı ile opaklıktır: derin bir ağ bir sonuca neden vardığını kolayca açıklayamaz; kararların gerekçelendirilmesi gereken her yerde bu önem taşır.
Örnek
Bir fabrika devre kartlarını lehim hataları açısından denetliyor. Eski sistem parlaklık ve şekle dair elle ayarlanmış kurallar kullanıyor ve hataların %9'unu kaçırıyordu. 40.000 etiketli fotoğrafla eğitilen bir derin öğrenme modeli %1,5'ini kaçırıyor; ayrıca hiçbir mühendisin kural yazmadığı türden bir kılcal çatlağı da yakalıyor.
Bununla en çok karıştırılan kavram
Deep Learning ve Klasik makine öğrenmesi arasındaki fark
İkisi de örneklerden öğrenir. Klasik makine öğrenmesinde önce bir insan ham malzemeyi anlamlı ölçümlere çevirir, algoritma da bunlardan öğrenir. Derin öğrenmede ölçümleri de ağ öğrenir. Derin öğrenmenin, iyi özelliklerin elle tanımlanmasının zor olduğu görüntü, ses ve dil alanlarını ele geçirmesinin ve çok daha fazla veri ile hesaplama gücü istemesinin nedeni budur.
Köken: Dönüm noktası 2012'de, derin ağ AlexNet'in ImageNet görüntü tanıma yarışmasını büyük farkla kazanmasıyla geldi.
Teknik katman
Derin bir ağ, basit birimlerden oluşan katmanları üst üste dizer; eğitim, milyonlardan milyarlara varan sayıda ağırlığı backpropagation ve gradient descent ile, GPU'lar üzerinde ayarlar. Ana mimariler: evrişimli ağlar (görüntü), yinelemeli ağlar (diziler; bugün büyük ölçüde yerlerini bıraktılar), transformer'lar (dil ve giderek geri kalan her şey) ve difüzyon modelleri (görsel, ses ve video üretimi). 2010'lardaki atılımı mümkün kılanlar: ImageNet gibi büyük etiketli veri kümeleri, GPU ile hesaplama ve daha iyi eğitim teknikleri. Pratikteki başlıklar: transfer öğrenme (önceden eğitilmiş bir modelden başla ve uyarla), kendi kendine denetimli öğrenme (etiketsiz verinin gizlenen kısımlarını tahmin ederek öğren), overfitting'e karşı düzenlileştirme ve kara kutuyu açmaya çalışan yorumlanabilirlik araştırmaları.