Sade anlatım
Sohbette bir soru sorarsınız ve hiçbir şey olmaz; saniyeler uzar. İlk kelimeler göründüğü anda bekleme biter: artık okuyorsunuzdur, gerisi acele etmeyebilir. İlk token süresi tam olarak bu sessiz aralığı ölçer. Telefonun ne kadar çabuk açıldığına karşılık gelir; görüşmenin sonra ne kadar sürdüğü ayrı bir konudur.
Neden önemli
İnsanın izlediği her işte TTFT, toplam yanıt süresinden daha önemlidir: bir saniye içinde başlayıp on saniyede biten bir yanıt, altı saniye sonra tek parça gelen bir yanıttan daha hızlı hissettirir. Sohbet, ses ve kodlama asistanlarının gereksinimlerine yazılacak sayı bu yüzden odur. Sınırları da aynı ölçüde önemlidir. İyi bir TTFT, yanıtın ne zaman tamamlanacağı hakkında hiçbir şey söylemez; yalnızca yanıt akış halinde gösteriliyorsa işe yarar; akıl yürüten modeller de görünür ilk kelimeden önce düşündükleri için onu tasarımları gereği uzatır.
Örnek
Bir perakendecinin alışveriş asistanı 12.000 token'lık bir istem gönderiyor (talimatlar, katalog özeti, konuşma) ve ilk kelime 2,4 saniye sonra görünüyor. Ekip, istemin hiç değişmeyen 10.000 token'ını önbelleğe alıyor ve hizmeti müşterilere daha yakın bir bölgeye taşıyor. TTFT 0,6 saniyeye iniyor. Tam yanıtın toplam süresi yalnızca 9 saniyeden 7 saniyeye düşüyor, ama “asistan yavaş” şikâyetleri kesiliyor.
Bununla en çok karıştırılan kavram
TTFT ve Latency (toplam gecikme) arasındaki fark
TTFT, gecikmenin bileşenlerinden biridir. Toplam gecikme buna geri kalan her token'ın üretilme süresini ekler. Akış halinde gelen bir yanıtı okuyan kişi büyük ölçüde TTFT'yi hisseder; eksiksiz bir JSON nesnesi bekleyen bir program ya da bir ajanın sonraki adımı ise yalnızca toplamı. Konuşmalarda TTFT'yi, iş hatlarında toplam gecikmeyi iyileştirin ve ikisini ayrı ayrı raporlayın.
Teknik katman
TTFT şunların toplamıdır: ağ gidiş dönüşü ve bağlantı kurulumu; sağlayıcının kuyruğunda geçen süre; girdi token'larının işlenmesi (prefill), ki istem uzadıkça büyür; görünür yanıttan önceki akıl yürütme; tam bir uygulamada ise model çağrısından önce çalışan her şey: retrieval, guardrail kontrolleri, araç çağrıları. Kaldıraçlar: daha kısa istemler; sağlayıcının tekrarlanan ön eki yeniden işlemesini gereksiz kılan prompt caching; daha küçük bir model; daha düşük akıl yürütme düzeyi; bağlantıları açık tutmak; kullanıcılara yakın bir bölge ve gecikme taahhüdü içeren kapasite kademeleri. Ölçümü kullanıcının cihazından yapın, çünkü sunucu tarafındaki rakamlar ağı içermez; medyanın yanında p95'i de izleyin, çünkü kuyruk yoğun saatlerde TTFT'yi sıçratır. Akıl yürüten modellerde ilk düşünme token'ı ile ilk yanıt token'ını ayırın; birçok ürün aradaki boşluğu bir ilerleme göstergesi ya da düşünmenin özetiyle doldurur. Yakın ölçüler: çıktı token'ı başına süre (inter-token latency) ve saniyedeki token sayısı; bunlar ilk token'dan sonraki hızı anlatır.