Sade anlatım
Cep hesap makinesi tünelde de çalışır, anında yanıt verir ve ne yazdığınızı kimseye söylemez, çünkü hesap elinizin içinde yapılır. Edge AI, modeli aynı konuma getirir: model telefonun, otomobilin ya da kameranın içinde durur ve işini orada yapar. Bedeli boyuttur. Cihazda ancak onun çipine, belleğine ve piline sığacak kadar küçük bir model yaşayabilir.
Neden önemli
Model cihazın üzerinde durduğunda dört şey değişir. Yanıt, ağ üzerinden gidiş dönüş olmadığı için milisaniyeler içinde gelir. Ham veri, ister bir yüz ister bir ses ister bir üretim hattı olsun, cihazda kalır. Sistem bağlantı olmadan da çalışmayı sürdürür. İstek başına ücret de yoktur, çünkü işi parası zaten ödenmiş donanım yapar. Sınırlar kesindir: küçük modeller daha az yeteneklidir, yoğun kullanım pili tüketir ve her güncellemenin farklı yaşlardaki binlerce cihaza ulaşması gerekir. Çoğu ürün bu yüzden ikisini birleştirir: rutin iş cihazda, zor vakalar bulutta.
Örnek
Bir şişeleme tesisi dakikada 600 şişenin kapağını kusur açısından denetliyor. Her görüntüyü buluta göndermek şişe başına yaklaşık 300 milisaniye sürerdi; bu, hat için fazla yavaş, üstelik bağlantı her koptuğunda denetim dururdu. Kameranın yanındaki cihazda çalışan küçük bir görü modeli 15 milisaniyede karar veriyor. Yalnızca kusurlu diye işaretlenen %0,4'lük görüntü, kalite kayıtları ve yeniden eğitim için buluta yükleniyor.
Bununla en çok karıştırılan kavram
Edge AI ve On-premise (yerinde barındırma) arasındaki fark
İkisi de veriyi dışarıdaki bir sağlayıcıdan uzak tutar; benzerlik burada biter. On-premise, bütün kuruma hizmet veren ve büyük modelleri çalıştırabilen, GPU'lu bir sunucu odası demektir. Edge'de ise model ürünün ya da çalışanın cihazının içindedir, onun çipi ve piliyle sınırlıdır ve bütün bir cihaz filosunda güncellenmesi gerekir. Bir fabrika ikisini birlikte kullanabilir: kameralar uçta karar verir, on-premise bir sunucu günün üretimini analiz eder.
Teknik katman
Donanım: telefonlarda ve dizüstü bilgisayarlarda nöral işlem birimleri (NPU), araçlarda ve endüstriyel bilgisayarlarda GPU'lar, en küçük sensörlerde mikrodenetleyiciler. Modeller damıtma, budama ve nicemleme ile cihaza sığdırılır; dil modellerinde ağırlıklar çoğunlukla 4 bite kadar indirilir. Çalışma ortamları arasında Apple cihazlarında Core ML, LiteRT (TensorFlow Lite'ın devamı), ONNX Runtime, ExecuTorch ve llama.cpp vardır. İşletim sistemleri ve tarayıcılar artık uygulamaların çağırabildiği yerleşik modellerle geliyor: Android'de ve Chrome'da Gemini Nano, Apple Intelligence'ın cihaz üzerindeki modelleri gibi. Önemli ölçütler: bellek ayak izi, saniyedeki token ya da kare sayısı, çıkarım başına enerji ve yüklenme süresi. Yaygın mimari hibrittir: rutin ya da özel işler için cihazda küçük bir model, gerektiğinde buluttaki modele aktarma. İşletim sorunları: çipler ve işletim sistemi sürümleri arasındaki parçalanma, kademeli model güncellemeleri, kullanıcı verisi toplamadan kaliteyi izleme ve müşterinin elindeki donanımda duran model ağırlıklarını koruma. Terim, cihazların yakınına yerleştirilen yerel ağ geçitlerini ve baz istasyonlarını da kapsar.