Altyapı ve maliyet

Time to First Token

TTFT

İlk token süresi

Bir isteğin gönderilmesinden model yanıtının ilk token'ının gelmesine kadar geçen süre; bir yapay zeka uygulamasının ne kadar hızlı hissettirdiğinin başlıca ölçüsü.

İLK TOKEN SÜRESİNİ NE DEĞİŞTİRİR · temsili12.000 token'lık istem, uzak bölge2,4 sn+ sabit 10.000 token önbellekte1,1 sn+ kullanıcıya yakın bölge0,6 snakıl yürütme açıkken6,0 sn≈ 1 sn: yanıt hemen başlıyor hissiTTFT'yi kısaltırkısa istem, önbellek, küçük model, yakın bölgeTTFT'yi uzatıruzun istem, kuyruk, yanıttan önce akıl yürütmeİlk kelime göründüğünde bekleme biter; yanıtın kalanı okunurken gelir.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/time-to-first-token

Sade anlatım

Sohbette bir soru sorarsınız ve hiçbir şey olmaz; saniyeler uzar. İlk kelimeler göründüğü anda bekleme biter: artık okuyorsunuzdur, gerisi acele etmeyebilir. İlk token süresi tam olarak bu sessiz aralığı ölçer. Telefonun ne kadar çabuk açıldığına karşılık gelir; görüşmenin sonra ne kadar sürdüğü ayrı bir konudur.

Neden önemli

İnsanın izlediği her işte TTFT, toplam yanıt süresinden daha önemlidir: bir saniye içinde başlayıp on saniyede biten bir yanıt, altı saniye sonra tek parça gelen bir yanıttan daha hızlı hissettirir. Sohbet, ses ve kodlama asistanlarının gereksinimlerine yazılacak sayı bu yüzden odur. Sınırları da aynı ölçüde önemlidir. İyi bir TTFT, yanıtın ne zaman tamamlanacağı hakkında hiçbir şey söylemez; yalnızca yanıt akış halinde gösteriliyorsa işe yarar; akıl yürüten modeller de görünür ilk kelimeden önce düşündükleri için onu tasarımları gereği uzatır.

Örnek

Bir perakendecinin alışveriş asistanı 12.000 token'lık bir istem gönderiyor (talimatlar, katalog özeti, konuşma) ve ilk kelime 2,4 saniye sonra görünüyor. Ekip, istemin hiç değişmeyen 10.000 token'ını önbelleğe alıyor ve hizmeti müşterilere daha yakın bir bölgeye taşıyor. TTFT 0,6 saniyeye iniyor. Tam yanıtın toplam süresi yalnızca 9 saniyeden 7 saniyeye düşüyor, ama “asistan yavaş” şikâyetleri kesiliyor.

Bununla en çok karıştırılan kavram

TTFT ve Latency (toplam gecikme) arasındaki fark

TTFTYanıtın başlamasına kadar geçen bekleme
Latency (toplam gecikme)Yanıtın tamamlanmasına kadar geçen bekleme

TTFT, gecikmenin bileşenlerinden biridir. Toplam gecikme buna geri kalan her token'ın üretilme süresini ekler. Akış halinde gelen bir yanıtı okuyan kişi büyük ölçüde TTFT'yi hisseder; eksiksiz bir JSON nesnesi bekleyen bir program ya da bir ajanın sonraki adımı ise yalnızca toplamı. Konuşmalarda TTFT'yi, iş hatlarında toplam gecikmeyi iyileştirin ve ikisini ayrı ayrı raporlayın.

Teknik katman

TTFT şunların toplamıdır: ağ gidiş dönüşü ve bağlantı kurulumu; sağlayıcının kuyruğunda geçen süre; girdi token'larının işlenmesi (prefill), ki istem uzadıkça büyür; görünür yanıttan önceki akıl yürütme; tam bir uygulamada ise model çağrısından önce çalışan her şey: retrieval, guardrail kontrolleri, araç çağrıları. Kaldıraçlar: daha kısa istemler; sağlayıcının tekrarlanan ön eki yeniden işlemesini gereksiz kılan prompt caching; daha küçük bir model; daha düşük akıl yürütme düzeyi; bağlantıları açık tutmak; kullanıcılara yakın bir bölge ve gecikme taahhüdü içeren kapasite kademeleri. Ölçümü kullanıcının cihazından yapın, çünkü sunucu tarafındaki rakamlar ağı içermez; medyanın yanında p95'i de izleyin, çünkü kuyruk yoğun saatlerde TTFT'yi sıçratır. Akıl yürüten modellerde ilk düşünme token'ı ile ilk yanıt token'ını ayırın; birçok ürün aradaki boşluğu bir ilerleme göstergesi ya da düşünmenin özetiyle doldurur. Yakın ölçüler: çıktı token'ı başına süre (inter-token latency) ve saniyedeki token sayısı; bunlar ilk token'dan sonraki hızı anlatır.

Yazan Mehmet Erkek · Son güncelleme: