Altyapı ve maliyet

Inference Cost

Çıkarım maliyeti

Eğitilmiş bir modeli çalıştırmanın tekrarlayan maliyeti: her istekte token ya da GPU süresi olarak ödenir; kullanıcı sayısıyla, istemlerin ve yanıtların uzunluğuyla birlikte büyür.

token başına fiyat düşüyorgörev başına token artıyorfatura = fiyat × tüketimtemsili eğrilerzaman →Fiyat tarafıaynı yetenek her yıl çok daha ucuza geliyorTüketim tarafıakıl yürütme ve ajanlar daha çok token harcıyorFiyat düşerken fatura büyüyebilir; maliyeti tamamlanan görev başına izleyin.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/inference-cost

Sade anlatım

Model eğitmek bir elektrik santrali kurmaya benzer: çok büyük bir fatura, bir kez ve sağlayıcı tarafından ödenir. Çıkarım maliyeti ise yakıttır: biri her soru sorduğunda yanar ve faturası size gelir. Elli kullanıcılı bir pilot neredeyse hiçbir şey tutmaz. Aynı asistan yirmi bin çalışana açıldığında ve her soruya uzun belgeler eklendiğinde ortaya, birinin önceden bütçelemiş olması gereken bir fatura çıkar.

Neden önemli

Bir yapay zeka kullanım senaryosunun ölçeklendiğinde kendini ödeyip ödemeyeceğini bu kalem belirler. İki eğilim ters yönde çalışıyor. Belirli bir yetenek düzeyinin fiyatı hızla düştü; yayımlanmış bazı tahminlere göre yılda kabaca on kat. Görev başına tüketim de aynı hızla arttı, çünkü akıl yürüten modeller yanıttan önce düşünüyor, ajanlar da tek bir iş için onlarca model çağrısı yapıyor. Birçok kurum bu yüzden fiyatlar düşerken büyüyen bir faturayla karşılaşıyor. Maliyetin görev bazında tasarlanması ve izlenmesi gerekir; kendiliğinden düzelmez.

Örnek

Bir sigorta şirketinin hasar asistanı ayda 50.000 dosya işliyor. Her dosya 20.000 girdi ve 1.000 çıktı token'ı kullanıyor. Milyon girdi token'ı 2 dolar, milyon çıktı token'ı 10 dolar olan temsili fiyatlarla bir dosya 5 sente, bir ay 2.500 dolara geliyor. Ekip sonra asistanı, dosya başına on iki model çağrısı yapan bir ajana dönüştürüyor. Fiyat listesinde hiçbir şey değişmiyor; fatura ise yaklaşık 30.000 dolara çıkıyor.

Bununla en çok karıştırılan kavram

Inference Cost ve Token pricing (token fiyatlandırması) arasındaki fark

Inference CostFatura: fiyat çarpı tükettiğiniz her şey
Token pricing (token fiyatlandırması)Fiyat listesi: milyon token başına ücret

Token fiyatlandırması sağlayıcının tarifesidir. Çıkarım maliyeti ise ödediğiniz tutardır: o tarifenin hacminizle, istem uzunluklarınızla, yeniden denemelerinizle ve her görevin gerektirdiği model çağrısı sayısıyla çarpımı. Daha ucuz bir model daha çok deneme gerektiriyorsa faturayı büyütebilir; bir fiyat indirimi de daha çok token harcayan bir tasarımın içinde eriyebilir. Modelleri, tamamlanan görev başına maliyetle karşılaştırın.

Teknik katman

API kullanımında istek başına maliyet, girdi token'ları çarpı girdi fiyatı artı çıktı token'ları çarpı çıktı fiyatıdır; çıktı birkaç kat pahalıdır ve akıl yürütme token'ları çıktı sayılır. Kendi barındırdığınız modellerde maliyet, GPU-saatin sunulan token sayısına bölümüdür; belirleyici olan doluluk oranıdır. Başlıca kaldıraçlar, kabaca etki sırasıyla: eval'lerinizi geçen en küçük modeli kullanın ve yalnızca zor istekleri daha büyük bir modele yönlendirin; tekrarlanan istem ön eklerini önbelleğe alın; bağlamı retrieval ve compaction ile kısaltın; çıktı uzunluğuna ve akıl yürütme düzeyine üst sınır koyun; bekleyebilecek işleri, çoğunlukla yarı fiyatına çalışan toplu işlemeye aktarın; yüksek hacimli bir iş için küçük bir modeli damıtın ya da ona ince ayar yapın. Maliyeti görev ya da çözülen dosya başına ölçün; token başına maliyet, yeniden denemeleri ve çok adımlı ajanları gizler. Bulunması gereken kontroller: ekip ve özellik bazında kullanım dökümü, bütçeler ve uyarılar, kullanıcı başına sınırlar, her ajan çalışması için adım ve harcama tavanı. Gözden kaçan kalemler: başarısız ve yinelenen çağrılar, değerlendirme çalışmaları, embedding'ler ve web araması gibi araç ücretleri.

Yazan Mehmet Erkek · Son güncelleme: