Temeller

Multimodal AI

Çok kipli yapay zeka · çok modlu yapay zeka

Metin, görsel, ses ve video gibi birden fazla içerik türünü tek bir modelin içinde alabilen, bazen de üretebilen yapay zeka.

metingörselsesvideo ve belgelerÇok kipli modeltek ortak temsil uzayıÇıktımetin, görsel, sesAynı model bir grafiği okuyabilir, bir toplantıyı dinleyebilir ve ikisini birlikte yorumlayabilir.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/multimodal-ai

Sade anlatım

İnsanlar dünyayı yalnızca metin olarak yaşamaz; aynı anda okur, bakar ve dinleriz. Çok kipli bir model buna benzer bir şey yapar. Ona bir beyaz tahtanın fotoğrafını, bir rapordaki grafiği ya da bir toplantının kaydını gösterip gündelik dille soru sorabilirsiniz; gördükleri, duydukları ve okudukları üzerinde birlikte akıl yürütür.

Neden önemli

İş dünyasındaki bilginin çoğu temiz metin değildir. Taranmış faturalar, sunumlar, şemalar, saha denetimlerinden fotoğraflar, ekran görüntüleri ve telefon görüşmeleridir. Çok kipli modeller bu malzemeyi, her biçim için ayrı bir sistem gerekmeden kullanılabilir kılar. Ajanların ekrana bakarak yazılım kullanabilmesini sağlayan da onlardır. Doğruluk işe göre değişir: net bir grafiği okumak güvenilirdir; küçük nesneleri saymak ya da kötü bir taramadaki ince ayrıntıyı okumak o kadar değildir.

Örnek

Bir saha teknisyeni hasarlı bir elektrik panosunun fotoğrafını çekiyor ve arızanın büyük olasılıkla ne olduğunu sesli olarak soruyor. Model fotoğrafa bakıyor, etiketteki model numarasını okuyor, soruyu duyuyor ve olası nedeni, bakılacak servis kılavuzu sayfasıyla birlikte söylüyor. Üç tür girdi, tek model, tek yanıt.

Bununla en çok karıştırılan kavram

Multimodal AI ve Zincirleme bağlanmış ayrı modeller arasındaki fark

Multimodal AITek model bütün girdiler üzerinde birlikte akıl yürütür
Zincirleme bağlanmış ayrı modellerHer girdi önce metne çevrilir, sonra aktarılır

Çok kipli modellerden önce, konuşmayı işleyen bir sistem onu bir modelle yazıya döker ve metni bir başkasına aktarırdı. Bu çalışır, ama her aktarımda bilgi kaybolur: sesin tonu, sayfanın düzeni, bir öğenin görüntüdeki yeri. Doğuştan çok kipli bir model bu bilgiyi korur ve girdiler arasında ilişkilendirebilir.

Teknik katman

Her girdi türü, ortak bir temsil içinde token'lara ya da embedding'lere çevrilir: görseller küçük parçalara (patch) bölünüp kodlanır, ses kısa çerçevelere ayrılır. Modelin dikkat mekanizması sonra bunların hepsi üzerinde birlikte çalışır. Girdi ve çıktı türleri modele göre değişir: birçoğu metin, görsel, ses ve video alır ve metin üretir; bazıları görseli ya da konuşmayı da doğrudan üretir. Daha eski bir yapı taşı, görselleri ve metni tek bir embedding uzayında hizalayan CLIP'tir. Pratik noktalar: görseller ve video çok token tüketir, dolayısıyla maliyeti ve bağlamı etkiler; çözünürlük sınırları küçük yazıları ve ince ayrıntıyı etkiler; belgeleri çoğu zaman sayfa görüntüsü ve çıkarılmış metinle birlikte vermek en iyisidir. Kullanım alanları: belge anlama, görseller hakkında soru yanıtlama, sesli asistanlar, video analizi, bilgisayar kullanımı. Dikkat edilecek bir risk: görsellere ya da sese gizlenmiş talimatlar prompt injection için bir yoldur.

Yazan Mehmet Erkek · Son güncelleme: