Model nasıl çalışır

Inference

Çıkarım

Eğitilmiş bir modelin çıktı üretmek üzere çalıştırılması: modelin ürettiği her yanıt, özet ya da araç çağrısı bir çıkarım işlemidir.

Eğitimmodeli oluştururBir kez yapılır, aylar sürerAğırlıklar değişirMaliyet: büyük, tek seferlik yatırımÇıkarımmodeli kullanırHer istekte yeniden çalışırAğırlıklar sabit kalırMaliyet: token başına, her kullanımdaKullanım arttıkça faturayı çıkarım belirler.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/inference

Sade anlatım

Eğitim ders kitabını yazmaktır; çıkarım ise bir soruyu yanıtlamak için o kitabı kullanmak. Her istem gönderdiğinizde modelin sabit ağırlıkları girdinize uygulanır ve çıktı token token hesaplanır. Model o anda hiçbir şey öğrenmez. Yalnızca kullanılır.

Neden önemli

Çıkarım, yapay zekanın tekrarlayan maliyetidir. Eğitimin bedelini sağlayıcı bir kez öder; çıkarımın bedelini ise siz, her istekte ve ürün çalıştığı sürece ödersiniz. Gecikme, kapasite planlaması, enerji tüketimi ve birim ekonomisi çıkarım sorularıdır; model seçimi de büyük ölçüde çıkarım maliyeti ile kalite arasındaki dengedir.

Örnek

Bir destek asistanı ayda 40.000 konuşma yürütüyor; her biri ortalama 6.000 token. Bu, her ay 240 milyon token'lık çıkarım demek. Bu konuşmaların basit olan üçte birini beşte bir fiyatlı bir modele yönlendirmek, yıllık faturayı herhangi bir sözleşme pazarlığından daha fazla değiştirir.

Bununla en çok karıştırılan kavram

Inference ve Training (eğitim) arasındaki fark

InferenceModeli kullanır; her istekte gerçekleşir
Training (eğitim)Modeli oluşturur; bir kez yapılır

Eğitim ağırlıkları değiştirir ve yayından önce biter. Çıkarım, bitmiş ağırlıkları yeni girdiye uygular ve modelde hiçbir şeyi değiştirmez. Bir modelin konuşma sırasında bir şeyi “öğrendiği” söylendiğinde olan şey, o bilgiyi içeren bir bağlam üzerinde çıkarım yapılmasıdır.

Teknik katman

Bir dil modelinde çıkarım özbağlanımlıdır: ileri geçiş bir olasılık dağılımı üretir, bir token örneklenip eklenir ve geçiş tekrarlanır. Bu yüzden maliyet girdi uzunluğuyla, daha da dik biçimde çıktı uzunluğuyla artar. Ölçüler: ilk token süresi, saniyedeki token sayısı, GPU başına iş hacmi. İyileştirmeler: toplu işleme, önceki token'lar için anahtar-değer önbelleği, prompt caching, quantization, daha küçük modellere distillation ve özel donanım. Kurulum seçenekleri sağlayıcının API'sinden bulut platformlarına, kendi sunucunuzda açık ağırlıklı modellere ve mahremiyet ya da gecikme için cihaz üzerinde çıkarıma uzanır.

Yazan Mehmet Erkek · Son güncelleme: