Sade anlatım
Bir fotoğrafın yavaş yavaş televizyon karıncalanmasına dönüştüğünü düşünün. Difüzyon modeli bunun tersini yapmak üzere eğitilir: gürültülü bir resim verildiğinde onu biraz daha temiz hale getirmek. Bunu milyonlarca görselden öğrendikten sonra saf karıncalanmadan başlayıp birkaç düzine adımda, hiç var olmamış bir resme doğru temizleyerek ilerleyebilir. Yazdığınız istem her adımı tarif ettiğiniz şeye doğru yönlendirir.
Neden önemli
Yapay zekayla görsel ve video üretiminin çoğunun arkasındaki teknolojidir; dolayısıyla tasarım, reklam, medya ve ürün görselleştirmede yaşanan büyük değişimin de arkasındadır: taslak bir görsel artık saniyeler alıyor. İnandırıcı sahte görsellerin ve videoların arkasında da o vardır; bu da kaynağın belirlenmesini ve doğrulamayı her iletişim ve güvenlik ekibinin meselesi yapar. Eğitim verisine ve çıktının sahipliğine ilişkin hukuki sorular çözülmüş değildir.
Örnek
Bir mobilya perakendecisinin 400 koltuğunun her birini beş farklı oda düzeninde göstermesi gerekiyor. Fotoğraf çekimi aylar sürerdi. Ürün fotoğrafı ve her odanın tarifi verilen bir difüzyon modeli 2.000 sahneyi iki günde üretiyor. Bir tasarımcı bunların yaklaşık beşte birini reddediyor: yanlış oranlar, değişmiş bir kumaş deseni, beş ayaklı bir masa.
Bununla en çok karıştırılan kavram
Diffusion Model ve LLM (büyük dil modeli) arasındaki fark
İkisi de üretken yapay zekadır; mekanikleri farklıdır. Dil modeli çıktısını sırayla, parça parça kurar. Difüzyon modeli bütün tuvale gürültü olarak başlar ve hepsini birlikte inceltir. Çizgi bulanıklaşıyor: bugünkü bazı görsel üreticiler dil modellerinin içine yerleşiktir ve görseli token token üretir; birçok sistem de ikisini birleştirir.
Köken: Modern biçimi Jonathan Ho ve arkadaşlarının 2020 tarihli makalesine dayanır; buna dayanan halka açık görsel üreticiler 2022'de çıktı.
Teknik katman
Eğitim: gerçek görsellere çok sayıda küçük adımda Gauss gürültüsü ekle ve bir ağı, eklenen gürültüyü tahmin etmek üzere eğit. Üretim: rastgele gürültüden başla ve gürültüyü kaldırmak için ağı tekrar tekrar uygula. Çoğu sistem pikseller üzerinde değil, sıkıştırılmış bir latent uzayda çalışır (latent diffusion); bu, maliyeti keskin biçimde düşürür. Metin koşullaması bir metin kodlayıcıdan gelir; yönlendirme (guidance) gücü, sonucun isteme ne kadar sıkı uyacağını belirler. Gürültü giderme ağı başlangıçta bir U-Net'ti; giderek transformer oluyor. Kontroller: seed, adım sayısı, guidance ölçeği, negatif istemler, görselden görsele üretim, inpainting ve yapısal koşullama. Flow matching gibi yakın yaklaşımlar ve yalnızca birkaç adım gerektiren damıtılmış modeller üretim süresini kısaltır. Tipik zayıflıklar: görsel içindeki yazı, eller, nesne sayıları ve bir karakteri görseller arasında tutarlı tutmak; hepsi son modellerde epeyce iyileşti.