Altyapı ve maliyet

On-premise / Self-hosted

Yerinde barındırma · kendi altyapınızda çalıştırma

Yapay zeka modellerini kurumun denetimindeki altyapıda, yani kendi veri merkezinde ya da kendi bulut hesabında çalıştırmak; prompt'lar ve veriler bir model sağlayıcısının paylaşımlı servisinden hiç geçmez.

Paylaşımlı APItoken başına ödemeAyrılmış kapasitesağlayıcıda, size özelKendi bulutunuzdaself-hostedOn-premisekendi veri merkezinizModeli işletensağlayıcısağlayıcısizsizGPU ve sunucularsağlayıcı, ortaksize ayrılmışsiz kiralarsınızsiz alırsınızVeri merkezisağlayıcısağlayıcıbulut sağlayıcısizinModel seçimifrontier dahilfrontier dahilaçık ağırlıklıaçık ağırlıklıvurgulu = sizin sorumluluğunuzdaha fazla kontrol, daha fazla iş →Birçok veri yerleşimi şartı ortadaki iki seçenekle karşılanır; önce onlara bakın.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/on-premise-self-hosted

Sade anlatım

Restoranda yemek ile kendi mutfağınızı işletmek arasındaki fark gibidir. Bir model sağlayıcısının API'sinde sipariş verir, tabak başına öder ve mutfağı hiç görmezsiniz. Self-hosting'de mutfak sizindir: ekipmanı satın alır ya da kiralar, aşçıları işe alır ve her malzemeye ne olacağına siz karar verirsiniz. On-premise bunun en katı biçimidir: mutfak kendi binanızın içindedir.

Neden önemli

Kurumlar bu yolu dört nedenle seçer: veriyi bir ülkenin ya da bir ağın içinde tutan kurallar, fabrika ya da şube sistemlerinin hemen yanında düşük gecikme, tedarikçinin değişikliklerinden bağımsızlık ve birim maliyet. Ekonomiyi kullanım oranı belirler: bir GPU sunucusu dolu da çalışsa boş da dursa aynı paraya mal olur; bu yüzden self-hosting ancak yüksek ve düzenli hacimde kendini öder. Buna işletecek mühendisleri ve en güçlü modellere geç erişimi ekleyin; bu modellerin çoğu yalnızca servis olarak sunulur. Donanım almadan önce ara seçeneklere bakın: birçok veri yerleşimi şartı bölgesel, ayrılmış ya da özel bir bulut kurulumuyla karşılanır.

Örnek

Bir kamu bankası müşteri verisini kendi ağının dışına gönderemiyor. 2,4 milyon dolara sekiz GPU sunucusu alıyor, üç mühendis işe alıyor ve 9.000 çalışanı için açık ağırlıklı bir model çalıştırıyor. Kullanım oranı gündüz %60, gece %5. Aynı bankada yalnızca kamuya açık içerikle çalışan pazarlama ekibi bir sağlayıcının API'sini kullanmayı sürdürüyor: 200 kullanıcı için token başına ödemek daha ucuz.

Bununla en çok karıştırılan kavram

On-premise / Self-hosted ve Özel bulut kurulumu arasındaki fark

On-premise / Self-hostedModeli, denetiminizdeki altyapıda siz işletirsiniz
Özel bulut kurulumuSağlayıcı sizin için, yalıtılmış ya da bölgesel bir ortamda işletir

Tedarikçiler “özel” sözcüğünü self-hosting'den farklı birkaç düzen için kullanır. Ayrılmış kapasite, sağlayıcının makinelerinde tek bir müşteriye ayrılan işlem hacmidir. Özel ya da bölgesel kurulum, işlemeyi seçilen bir bölgenin ya da ağın içinde tutar ve erişimi sözleşmeyle sınırlar. İkisinde de modeli sağlayıcı işletir. Bunlar çoğu zaman bir veri yerleşimi ya da yalıtım şartını çok daha düşük maliyetle karşılar; bu yüzden verinin tam olarak nerede işlendiğini ve ona kimin erişebildiğini sorun.

Teknik katman

Yapı taşları: modelin bellek ihtiyacına ve istenen işlem hacmine göre boyutlandırılmış GPU sunucuları; vLLM gibi bir çıkarım sunucusu ya da NVIDIA NIM gibi paketlenmiş bir seçenek, küçük kurulumlar için Ollama ve llama.cpp; uygulamaların modelin nerede çalıştığını umursamaması için OpenAI uyumlu bir uç nokta; ve normalde sağlayıcının sunduğu çevre parçalar: otomatik ölçekleme, izleme, guardrail'ler, erişim denetimi ve model güncellemeleri. Boyutlandırma soruları: eşzamanlı kullanıcı sayısı, saniyedeki token, gecikme hedefi, bağlam uzunluğu ve nicemlemenin kabul edilebilir olup olmadığı. Maliyet karşılaştırması toplam maliyetle yapılmalıdır: donanım amortismanı ya da rezervasyonu, enerji ve soğutma, personel ve gerçekçi kullanım oranı; self-hosting'in karşılaştırmayı kaybetmesinin alışılmış nedeni boşta duran kapasitedir. Ara seçenekler: ayrılan birim başına faturalanan provisioned throughput, bir bulut platformundaki özel ağ uç noktaları, egemen bulut bölgeleri ve bir sağlayıcının modellerini müşterinin veri merkezine yerleştiren, tedarikçinin yönettiği sistemler; Google Distributed Cloud üzerindeki Gemini gibi, dış ağa tümüyle kapalı (air-gapped) türleri de vardır. Birçok kurum hibrit bir yapıda karar kılar: hassas ya da düzenli iş yükleri kendi altyapısında, gerisi API üzerinden, ikisinin önünde de tek bir gateway.

Yazan Mehmet Erkek · Son güncelleme: