Sade anlatım
Yapay zekayla yapılan işlerin çoğu bir sohbettir: sorarsınız, yanıtlar, yeniden sorarsınız. Uzun süre çalışan ajan ise siz yokken evde bıraktığınız bir ustaya benzer. İşte anlaşır, anahtarı verirsiniz; döndüğünüzde bitmiş odaları, yapılanların listesini ve kararınızı bekleyen tek duvarla ilgili bir notu bulursunuz. Hiçbir model günlerce süren bir işi aklında tutamaz; bu yüzden böyle bir ajan vardiyalarla çalışır ve her vardiya bir öncekinin bıraktığı notlardan başlar.
Neden önemli
Devredilen işin birimini sorudan projeye çevirir: bir kod taşıma, bir araştırma taraması, bir ay sonu mutabakatı. Çalışma başına değer yüksektir; geri kalan her şey de öyle. Bir çalışma saatlerce model kullanımına mal olur ve ilk saatte yapılan yanlış bir varsayıma dayanıyorsa tamamı boşa gidebilir. Her adımı izleyen biri olmadığı için önlemlerin baştan kurulması gerekir: işin ne zaman bitmiş sayılacağının net tanımı, ajanın geçmek zorunda olduğu testler, bir bütçe tavanı, bir sandbox ve bir insanın duruma baktığı ara hedefler.
Örnek
Bir perakendeci, bir ajandan 300 rapor betiğini yeni bir veri platformuna taşımasını istiyor. Ajan gece boyunca 14 saat, dokuz bağlam penceresi boyunca çalışıyor. Bir ilerleme dosyası her betiği bekliyor, bitti ya da takıldı diye listeliyor; ajan her betikten sonra commit atıyor ve betiği ancak karşılaştırma testi geçince bitti sayıyor. Veri ekibinin liderine 100. ve 200. betikte iki ara rapor gidiyor. Sabah: 271 betik bitmiş, 29'u gerekçesiyle takılmış, fatura 180 dolar.
Bununla en çok karıştırılan kavram
Long-running Agent ve Etkileşimli ajan oturumu arasındaki fark
Aynı ajan iki biçimde de kullanılabilir; değişen, insanın nerede durduğudur. Etkileşimli oturumda biri adım adım okuduğu için hatalar dakikalar içinde yakalanır. Uzun çalışmada ajan hatayı testlerle ve kendi notlarıyla kendisi yakalamak zorundadır; insan yalnızca kontrol noktalarını ve sonucu görür. Bütün gece süren bir toplu iş ise başka bir şeydir: tek bir sabit adımı çok kez yineler.
Teknik katman
Dört bileşeni vardır. Bağlam yönetimi: compaction, eski araç sonuçlarının temizlenmesi ve alt ajanlar her pencereyi kullanılabilir tutar. Dış durum: bir ilerleme dosyası, her öğenin durumunu gösteren bir görev ya da test listesi ve kontrol noktası işlevi gören sürüm kontrolü commit'leri; her yeni pencere bunları okuyarak ve testleri çalıştırarak başlar. Kalıcı yürütme: harness çalışmayı saklar; böylece çalışma çökmelerden, yeniden başlatmalardan ve onay beklemelerinden sağ çıkar, arka planda sürer ve bitince haber verir. Doğrulama: testler, uçtan uca kontroller ya da ayrı bir denetçi ajan; çünkü ajanın “bitti” demesi zayıf bir kanıttır. Hata türleri: işi erken bitmiş saymak, tek pencerede fazla işe girişip değişikliği yarım bırakmak, hedeften sapma, sessiz döngüler ve kontrolden çıkan harcama. Eğilime gelince, araştırma kuruluşu METR, frontier modellerin %50 başarıyla tamamladığı yazılım görevlerinin insan uzman süresiyle ölçülen uzunluğunu izliyor. Mart 2025'te bu uzunluğun 2019'dan beri yaklaşık yedi ayda bir ikiye katlandığını bildirdi; sonraki güncellemelerinde daha hızlı bir tempo buldu. Ölçü görev zorluğunu anlatır; dağınık bir iş ortamında gözetimsiz çalışma saati konusunda bir şey vaat etmez.