Sade anlatım
Dağ yolundaki bariyer arabayı sürmez; işlerin ne kadar kötüye gidebileceğini sınırlar. Modelin etrafındaki guardrail'ler de ondan önce ve sonra çalışan ayrı kontrollerdir: bu istek kapsamda mı, bu yanıtta kişisel veri var mı, bu eyleme izin var mı? Modelin doğru davranıp davranmamasından bağımsız çalışırlar.
Neden önemli
Guardrail'ler, şirketin kendi kurallarını (uzak durulacak konular, dışarı çıkmaması gereken veriler, onay gerektiren eylemler) kendisinin eğitmediği bir modele uygulatmanın yoludur. Gereklidirler ama yeterli değildirler: her biri hata payı olan bir filtredir; olayları azaltır, güvenliği garanti etmez, ayrıca gecikme ve maliyet ekler.
Örnek
Bir bankanın asistanı her turda üç kontrol çalıştırıyor: yatırım tavsiyesi sorularını reddeden bir girdi kontrolü, hesap numaralarını maskeleyen bir çıktı kontrolü ve limitin üzerindeki her havaleyi bir insana gönderen bir eylem kontrolü.
Bununla en çok karıştırılan kavram
Guardrails ve Alignment (hizalama) arasındaki fark
Hizalama modelin kendisiyle ilgilidir: onu doğru şeyleri isteyecek biçimde eğitmek. Guardrail'ler modelin dışındadır: modelin niyeti ne olursa olsun sorunu yakalar. İyi hizalanmış bir model de şirkete özgü kurallar için guardrail'e ihtiyaç duyar; guardrail'ler ise onlara karşı çalışan bir modeli telafi edemez.
Teknik katman
Türleri: girdi bariyerleri (enjeksiyon ve jailbreak tespiti, konu ve kişisel veri filtreleri), çıktı bariyerleri (zararlı içerik, sızıntı, kaynağa dayanma ve halüsinasyon kontrolleri, şema doğrulama) ve eylem bariyerleri (izin listeleri, limitler, araç çağrılarında onay). Uygulamalar kurallardan ve düzenli ifadelerden küçük sınıflandırıcı modellere ve hakem LLM'lere uzanır; deterministik kontroller istemde değil kodda durmalıdır. Tasarım soruları: engelleme anında ne olacağı (reddet, maskele, yeniden dene, insana çıkar), hatalı engellemelerin nasıl ölçüleceği ve her katmanın ne kadar gecikme eklediği. Sistem istemindeki talimatlar guardrail değil yönlendirmedir, çünkü model onlardan vazgeçmeye ikna edilebilir.