Sade anlatım
Bir demoyu çalıştırmak bir öğleden sonra sürer. Onu binlerce kullanıcı için aylarca çalışır halde tutmak ise başka bir iştir: bu sırada prompt'lar düzenlenir, modeller değişir, maliyet sessizce artar. LLMOps bu işin disiplinidir: bir ekibin salı günü yaptığı değişikliğin uygulamayı iyileştirdiğini mi kötüleştirdiğini mi çarşamba günü bilmesini sağlayan rutinler.
Neden önemli
Canlı ortamda başarısız olan yapay zeka uygulamalarının çoğu operasyonel nedenlerle başarısız olur: bir vakayı sessizce bozan bir prompt düzenlemesi, sağlayıcının model güncellemesi, üçe katlanan bir fatura, kimsenin yeniden üretemediği bir şikâyet. LLMOps bunları sürpriz olmaktan çıkarıp rutine çevirir. Bir ekibin ne kadar hızlı ve güvenli değişiklik yapabileceğini belirler; denetçinin ya da düzenleyicinin isteyeceği kanıt da buradan çıkar. Emek de ister: bakımı yapılacak bir test kümesi, işletilecek araçlar ve işin bir sahibi. Pilot bunlar olmadan yaşayabilir; ürün yaşayamaz.
Örnek
Bir sigorta şirketinin hasar asistanı muafiyet tutarlarını yanlış vermeye başlıyor. Her isteğin izleme kaydı tutulduğu için ekip bir saat içinde hataların iki gün önceki bir prompt düzenlemesiyle başladığını buluyor. Prompt'un 41. sürümüne dönüyor, hatalı vakaları 400 vakalık test kümesine ekliyor ve düzenlemeyi onarıyor. Düzeltilmiş sürüm, kullanıcıların ilk %5'ine ulaşmadan önce artık bu kümeden geçmek zorunda.
Bununla en çok karıştırılan kavram
LLMOps ve MLOps arasındaki fark
MLOps, kendi modelini eğiten ekiplerin etrafında gelişti: veri hatları, feature store'lar, yeniden eğitim, model kayıt defterleri. LLM uygulamalarının çoğunda ise kimse bir şey eğitmez. Model kiralanır; değişen şey prompt, getirilen bağlam ve araçlardır. Bu yüzden sürümlenen şey prompt ve yapılandırmasıdır, kalite açık uçlu metin üzerinden değerlendirilir ve maliyet token başına hesaplanır. İnce ayar yapan ya da modeli kendi barındıran ekiplerin ikisine de ihtiyacı vardır.
Teknik katman
Temel pratikler. Sürümleme: prompt'lar, model kimlikleri ve ayarları, araç tanımları ve getirme yapılandırması birlikte saklanır ve birlikte yayımlanır; sağlayıcı izin veriyorsa model sürümü sabitlenir. Değerlendirme: her yayından önce çevrimdışı çalıştırılan bir altın veri seti (kod kontrolleri, hakem LLM'ler ve insan incelemesiyle) ve canlı trafikten alınan örnekler üzerinde çevrimiçi değerlendirme. İzleme: her istek, model çağrılarından, getirmelerden ve araç çağrılarından oluşan bir ağaç olarak kaydedilir ve her adımın girdisi, çıktısı, token sayısı, gecikmesi ve maliyeti tutulur; OpenTelemetry'nin üretken yapay zeka kuralları ortak biçim olma yolundadır. Maliyet ve performans: bütçeler, önbellekleme, yönlendirme ve istek sınırlarının yönetimi. Yayın: kademeli açılış, A/B karşılaştırması ve hızlı geri dönüş. Geri bildirim: kullanıcı sinyalleri ve başarısız vakalar test kümesine geri akar. Araçlar arasında LangSmith, Langfuse, MLflow ve Arize Phoenix vardır. Kimi zaman AgentOps etiketiyle anılan ajan tarafında değerlendirme birimi izlenen yolun tamamıdır. Sık görülen eksikler: doğrudan canlı ortamda düzenlenen prompt'lar, test kümesinin olmaması ve bir takma adın arkasından habersizce gelen model güncellemeleri.