Altyapı ve maliyet

Latency

Gecikme · yanıt süresi

Modele bir istek gönderilmesi ile yanıtın alınması arasında geçen süre; dil modellerinde ilk token'ı bekleme süresi ile geri kalan token'ların üretilme süresinin toplamıdır.

BİR YANITIN ZAMAN ÇİZGİSİ · temsiliTTFTÜretim: 300 token ÷ saniyede 50 tokenİlk token süresi: 1 snağ, kuyruk, girdinin işlenmesiÜretim süresi: 6 snçıktı uzunluğuyla doğrusal büyürToplam gecikme: 7 snSohbet ve seskullanıcı ilk token süresini hissederAjan adımı, iş hattısistem toplam gecikmeyi beklerSaniyede 150 token üreten küçük bir model aynı yanıtı 3 saniyede bitirir.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/latency

Sade anlatım

Gecikme, ne kadar beklediğinizdir. Dil modelinde bekleme, restoranda olduğu gibi iki bölümdür: ilk tabağın gelmesine kadar geçen süre ve her şeyin masaya gelmesine kadar geçen süre. İlki mutfağın ne kadar yoğun, siparişinizin ne kadar uzun olduğuna bağlıdır. İkincisi ne kadar çok şey istediğinize bağlıdır, çünkü model yanıtını parça parça ve sabit bir hızla üretir.

Neden önemli

Bir modelin hangi işte kullanılabileceğini gecikme belirler. Sohbet asistanı birkaç saniyelik sessizlikten sonra bozuk gibi görünür; sesli asistan, saniyenin küçük bir bölümünden sonra. Gece çalışan bir toplu iş ise saatlerce bekleyebilir. Gecikme, kalite ve maliyetle birlikte tartılır: büyük modeller ve akıl yürütme modları daha iyi ama daha yavaş yanıt verir; yirmi adım atan bir ajan her gecikmeyi yirmiyle çarpar. Modeli seçmeden önce her kullanım senaryosu için kabul edilebilir bekleme süresini belirleyin ve yavaş kalan istekleri ölçün; ortalamalar, kullanıcıyı vazgeçiren istekleri gizler.

Örnek

Bir banka çağrı merkezi asistanı için iki modeli test ediyor. Büyük model saniyede 50, küçük model 150 token üretiyor. İlk token için yaklaşık bir saniyelik beklemenin ardından, 300 token'lık tipik bir yanıt büyük modelde toplam 7, küçük modelde 3 saniye sürüyor. Canlı görüşmedeki temsilciler 7 saniye beklemez. Banka çağrı merkezinde küçük modeli kullanıyor, büyük modeli yazılı şikâyetler için elde tutuyor.

Bununla en çok karıştırılan kavram

Latency ve Throughput (iş hacmi) arasındaki fark

LatencyTek bir isteğin, tek bir kullanıcı için ne kadar sürdüğü
Throughput (iş hacmi)Sistemin tamamının saniyede ne kadar iş bitirdiği

Gecikme istek başına, saniye cinsinden ölçülür. Throughput ise sistem genelinde, saniyedeki istek ya da token sayısıyla ölçülür. İkisi birbirine karşı çalışır: çok sayıda isteği birlikte işleyen bir sunucu toplamda saniyede daha çok token üretir, ama her kullanıcı biraz daha uzun bekler. Etkileşimli ürünler gecikmeye göre, toplu işler throughput ve maliyete göre ayarlanır.

Teknik katman

Toplam gecikme ≈ ilk token süresi + çıktı token sayısı ÷ üretim hızı (saniyedeki token). İlk token süresi ağı, kuyruğu, girdinin işlenmesini ve modelin yanıttan önce yaptığı düşünmeyi kapsar. Üretim süresi çıktı uzunluğuyla doğrusal büyür; bu yüzden çoğu istekte en büyük kaldıraç çıktı uzunluğudur. Diğer kaldıraçlar: daha küçük ya da daha hızlı bir model, daha kısa istemler, prompt caching, daha düşük akıl yürütme düzeyi, birbirinden bağımsız adımları paralel çalıştırmak, kullanıcılara yakın bir bölgede barındırmak ve sağlayıcının sunduğu yerlerde öncelikli kapasite kademeleri. Streaming toplam süreyi kısaltmaz; kullanıcının okumaya daha erken başlamasını sağlar. Yüzdelik dilimleri (p50, p95, p99) raporlayın: kullanıcı deneyimini ve zaman aşımlarını en yavaş birkaç yüzdelik istek belirler. Ölçümü gerçekçi yük altında yapın, çünkü sağlayıcı ya da kendi sunucunuz yoğunlaştıkça gecikme artar. Ajanlarda ve iş hatlarında gecikme, zincirdeki her model ve araç çağrısının toplamıdır; adım başına bütçeleyin. Sesli arayüzler ilk sesi birkaç yüz milisaniye içinde ister; bu da çoğu zaman küçük modelleri ya da konuşmadan konuşmaya çalışan özel modelleri gerektirir.

Yazan Mehmet Erkek · Son güncelleme: