Sade anlatım
Her bilgisayarda bulunan CPU, küçük bir uzman ekibine benzer: her biri her işi yapabilir, ama işleri birkaçar birkaçar ele alırlar. GPU ise yalnızca dört işlem bilen ve hepsi aynı anda çalışan birkaç bin memurun oturduğu bir salon gibidir. Sinir ağı neredeyse baştan sona aritmetiktir: birbirinden bağımsız milyarlarca çarpma ve toplama. Uzmanların saatlerce uğraşacağı işi memurlar salonu saniyeler içinde bitirir.
Neden önemli
Yapay zekanın fiyatını ve hızını GPU'lar belirler. Her token'ın maliyeti sonunda GPU süresine dayanır; bir kartın belleği de hangi modelleri çalıştırabileceğini belirler. Modelleri API üzerinden kullanıyorsanız bu yükü sağlayıcı taşır. Kendi sunucunuzda barındırıyorsanız GPU en büyük donanım kaleminiz olur; teslim süreleri uzundur ve her nesil birkaç yıl içinde geride kalır. Arz da yoğunlaşmıştır: yapay zeka çiplerinin çoğunu tek bir şirket, Nvidia satar; en ileri çiplerin çoğunu Tayvan'daki tek bir üretici üretir ve en güçlü çiplerin ihracatı devlet kontrolüne tabidir.
Örnek
Bir üretici, 30 milyar parametreli açık ağırlıklı bir modeli kendi veri merkezinde çalıştırmak istiyor. 16 bit hassasiyette yalnızca ağırlıklar yaklaşık 60 GB tutuyor; almayı planladığı kartın belleği ise 48 GB. İki seçeneği var: iki kart alıp modeli ikisine bölmek ya da modelin 4 bite nicemlenmiş sürümünü çalıştırmak. Bu sürüm yaklaşık 15 GB ister ve kalitede küçük bir kayıpla tek karta rahatça sığar.
Bununla en çok karıştırılan kavram
GPU ve CPU (merkezi işlemci) arasındaki fark
Her bilgisayarda bir CPU vardır; işletim sistemini, veritabanını ve uygulama kodunu o çalıştırır. Yapay zeka sunucusunda da bulunur. GPU onun yanında, çok sayıda özdeş parçaya bölünebilen aritmetiğin uzmanı olarak durur. Küçük modeller yalnızca CPU ile de çalışır, ama yavaş. Fark, sunucu boyutlandırırken önem kazanır: yapay zeka iş yüklerinde belirleyici olan GPU'ların sayısı ve belleğidir; CPU nadiren darboğaz olur.
Köken: Terimi Nvidia, 1999'da ilk GPU olarak pazarladığı bir ekran kartıyla yaygınlaştırdı; 2012'de iki oyun GPU'suyla eğitilen görüntü tanıma ağı AlexNet'in başarısı, GPU'yu derin öğrenmenin donanımı haline getirdi.
Teknik katman
Sinir ağları matris çarpımına indirgenir; bu işlem neredeyse kusursuz biçimde paralelleştirilebilir ve GPU onu yüksek bellek bant genişliğiyle binlerce çekirdekte yürütür. Asıl kısıt kart üzerindeki bellektir (VRAM): ağırlıkların ve bağlam uzunluğuyla, eşzamanlı istek sayısıyla büyüyen çalışma belleğinin karta sığması gerekir. Kaba hesapla ağırlıkların belleği, parametre sayısı çarpı parametre başına bayttır: 16 bit hassasiyette iki bayt, 4 bitte yarım bayt. Daha büyük modeller birkaç GPU'ya bölünür; eğitim kümeleri binlerce GPU'yu hızlı ağlarla birbirine bağlar. Nvidia, donanımı ve CUDA yazılım ekosistemiyle pazara hâkimdir; AMD rakip GPU'lar satar, büyük bulut sağlayıcıları da Google'ın TPU'su gibi kendi hızlandırıcılarını tasarlar. Bunların hepsini kapsayan geniş terim “AI accelerator”, yani yapay zeka hızlandırıcısıdır. Alıcı için pratik ölçüler: kart başına bellek, kart başına saniyedeki token sayısı, güç tüketimi ve GPU-saat maliyeti. Kapasite bulut sağlayıcılarından saatlik kiralanır ya da satın alınır; satın alma, sıradan sunucu odalarının çoğu zaman karşılayamadığı güç ve soğutma gereksinimleri getirir.