Temeller

Diffusion Model

Difüzyon modeli

Rastgele gürültüden başlayıp gürültüyü adım adım temizleyerek, isteğe uyan bir sonuç ortaya çıkana kadar ilerleyen ve böylece görsel, video ya da ses üreten üretken model.

İSTEM: “kırmızı bisiklet”Saf gürültübaşlangıçBirkaç adımkaba biçimler belirirOnlarca adımayrıntı netleşirGörselsonuçModel gürültüyü adım adım temizlemeyi öğrenmiştir; istem, her adımda temizliğin yönünü belirler.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/diffusion-model

Sade anlatım

Bir fotoğrafın yavaş yavaş televizyon karıncalanmasına dönüştüğünü düşünün. Difüzyon modeli bunun tersini yapmak üzere eğitilir: gürültülü bir resim verildiğinde onu biraz daha temiz hale getirmek. Bunu milyonlarca görselden öğrendikten sonra saf karıncalanmadan başlayıp birkaç düzine adımda, hiç var olmamış bir resme doğru temizleyerek ilerleyebilir. Yazdığınız istem her adımı tarif ettiğiniz şeye doğru yönlendirir.

Neden önemli

Yapay zekayla görsel ve video üretiminin çoğunun arkasındaki teknolojidir; dolayısıyla tasarım, reklam, medya ve ürün görselleştirmede yaşanan büyük değişimin de arkasındadır: taslak bir görsel artık saniyeler alıyor. İnandırıcı sahte görsellerin ve videoların arkasında da o vardır; bu da kaynağın belirlenmesini ve doğrulamayı her iletişim ve güvenlik ekibinin meselesi yapar. Eğitim verisine ve çıktının sahipliğine ilişkin hukuki sorular çözülmüş değildir.

Örnek

Bir mobilya perakendecisinin 400 koltuğunun her birini beş farklı oda düzeninde göstermesi gerekiyor. Fotoğraf çekimi aylar sürerdi. Ürün fotoğrafı ve her odanın tarifi verilen bir difüzyon modeli 2.000 sahneyi iki günde üretiyor. Bir tasarımcı bunların yaklaşık beşte birini reddediyor: yanlış oranlar, değişmiş bir kumaş deseni, beş ayaklı bir masa.

Bununla en çok karıştırılan kavram

Diffusion Model ve LLM (büyük dil modeli) arasındaki fark

Diffusion ModelGürültüyü temizleyerek üretir: görsel, video, ses
LLM (büyük dil modeli)Token token üretir: metin ve kod

İkisi de üretken yapay zekadır; mekanikleri farklıdır. Dil modeli çıktısını sırayla, parça parça kurar. Difüzyon modeli bütün tuvale gürültü olarak başlar ve hepsini birlikte inceltir. Çizgi bulanıklaşıyor: bugünkü bazı görsel üreticiler dil modellerinin içine yerleşiktir ve görseli token token üretir; birçok sistem de ikisini birleştirir.

Köken: Modern biçimi Jonathan Ho ve arkadaşlarının 2020 tarihli makalesine dayanır; buna dayanan halka açık görsel üreticiler 2022'de çıktı.

Teknik katman

Eğitim: gerçek görsellere çok sayıda küçük adımda Gauss gürültüsü ekle ve bir ağı, eklenen gürültüyü tahmin etmek üzere eğit. Üretim: rastgele gürültüden başla ve gürültüyü kaldırmak için ağı tekrar tekrar uygula. Çoğu sistem pikseller üzerinde değil, sıkıştırılmış bir latent uzayda çalışır (latent diffusion); bu, maliyeti keskin biçimde düşürür. Metin koşullaması bir metin kodlayıcıdan gelir; yönlendirme (guidance) gücü, sonucun isteme ne kadar sıkı uyacağını belirler. Gürültü giderme ağı başlangıçta bir U-Net'ti; giderek transformer oluyor. Kontroller: seed, adım sayısı, guidance ölçeği, negatif istemler, görselden görsele üretim, inpainting ve yapısal koşullama. Flow matching gibi yakın yaklaşımlar ve yalnızca birkaç adım gerektiren damıtılmış modeller üretim süresini kısaltır. Tipik zayıflıklar: görsel içindeki yazı, eller, nesne sayıları ve bir karakteri görseller arasında tutarlı tutmak; hepsi son modellerde epeyce iyileşti.

Yazan Mehmet Erkek · Son güncelleme: