Sade anlatım
Restoranda yemek ile kendi mutfağınızı işletmek arasındaki fark gibidir. Bir model sağlayıcısının API'sinde sipariş verir, tabak başına öder ve mutfağı hiç görmezsiniz. Self-hosting'de mutfak sizindir: ekipmanı satın alır ya da kiralar, aşçıları işe alır ve her malzemeye ne olacağına siz karar verirsiniz. On-premise bunun en katı biçimidir: mutfak kendi binanızın içindedir.
Neden önemli
Kurumlar bu yolu dört nedenle seçer: veriyi bir ülkenin ya da bir ağın içinde tutan kurallar, fabrika ya da şube sistemlerinin hemen yanında düşük gecikme, tedarikçinin değişikliklerinden bağımsızlık ve birim maliyet. Ekonomiyi kullanım oranı belirler: bir GPU sunucusu dolu da çalışsa boş da dursa aynı paraya mal olur; bu yüzden self-hosting ancak yüksek ve düzenli hacimde kendini öder. Buna işletecek mühendisleri ve en güçlü modellere geç erişimi ekleyin; bu modellerin çoğu yalnızca servis olarak sunulur. Donanım almadan önce ara seçeneklere bakın: birçok veri yerleşimi şartı bölgesel, ayrılmış ya da özel bir bulut kurulumuyla karşılanır.
Örnek
Bir kamu bankası müşteri verisini kendi ağının dışına gönderemiyor. 2,4 milyon dolara sekiz GPU sunucusu alıyor, üç mühendis işe alıyor ve 9.000 çalışanı için açık ağırlıklı bir model çalıştırıyor. Kullanım oranı gündüz %60, gece %5. Aynı bankada yalnızca kamuya açık içerikle çalışan pazarlama ekibi bir sağlayıcının API'sini kullanmayı sürdürüyor: 200 kullanıcı için token başına ödemek daha ucuz.
Bununla en çok karıştırılan kavram
On-premise / Self-hosted ve Özel bulut kurulumu arasındaki fark
Tedarikçiler “özel” sözcüğünü self-hosting'den farklı birkaç düzen için kullanır. Ayrılmış kapasite, sağlayıcının makinelerinde tek bir müşteriye ayrılan işlem hacmidir. Özel ya da bölgesel kurulum, işlemeyi seçilen bir bölgenin ya da ağın içinde tutar ve erişimi sözleşmeyle sınırlar. İkisinde de modeli sağlayıcı işletir. Bunlar çoğu zaman bir veri yerleşimi ya da yalıtım şartını çok daha düşük maliyetle karşılar; bu yüzden verinin tam olarak nerede işlendiğini ve ona kimin erişebildiğini sorun.
Teknik katman
Yapı taşları: modelin bellek ihtiyacına ve istenen işlem hacmine göre boyutlandırılmış GPU sunucuları; vLLM gibi bir çıkarım sunucusu ya da NVIDIA NIM gibi paketlenmiş bir seçenek, küçük kurulumlar için Ollama ve llama.cpp; uygulamaların modelin nerede çalıştığını umursamaması için OpenAI uyumlu bir uç nokta; ve normalde sağlayıcının sunduğu çevre parçalar: otomatik ölçekleme, izleme, guardrail'ler, erişim denetimi ve model güncellemeleri. Boyutlandırma soruları: eşzamanlı kullanıcı sayısı, saniyedeki token, gecikme hedefi, bağlam uzunluğu ve nicemlemenin kabul edilebilir olup olmadığı. Maliyet karşılaştırması toplam maliyetle yapılmalıdır: donanım amortismanı ya da rezervasyonu, enerji ve soğutma, personel ve gerçekçi kullanım oranı; self-hosting'in karşılaştırmayı kaybetmesinin alışılmış nedeni boşta duran kapasitedir. Ara seçenekler: ayrılan birim başına faturalanan provisioned throughput, bir bulut platformundaki özel ağ uç noktaları, egemen bulut bölgeleri ve bir sağlayıcının modellerini müşterinin veri merkezine yerleştiren, tedarikçinin yönettiği sistemler; Google Distributed Cloud üzerindeki Gemini gibi, dış ağa tümüyle kapalı (air-gapped) türleri de vardır. Birçok kurum hibrit bir yapıda karar kılar: hassas ya da düzenli iş yükleri kendi altyapısında, gerisi API üzerinden, ikisinin önünde de tek bir gateway.