Sade anlatım
Bir aşçı yemekleri bir yemek kitabından öğrenir. Mutfağa giremeyen biri, kitabın arasına değiştirilmiş birkaç tarif sıkıştırır. Aylar sonra aşçı bu tarifleri harfiyen pişirir ve bir terslik olduğunu hiç fark etmez. Veri zehirleme bir modele aynı yoldan, çalıştığı malzeme üzerinden saldırır. Saldırgan sisteme hiç dokunmaz; malzemeyi, eğitim sürecinin toplayacağı yere bırakır.
Neden önemli
Modeller, kimsenin baştan sona okumadığı verilerden öğrenir: web taramaları, açık veri setleri, kullanıcı geri bildirimleri, indirilen modeller. Buraya karışan zehri görmek zordur, çünkü model bütün standart testlerde normal çalışır ve yalnızca saldırganın seçtiği durumlarda yanlış davranır. Eğitim bittikten sonra temizlemesi de pahalıdır. Çoğu şirket için risk üç yerdedir: indirdikleri açık ağırlıklı modeller ve veri setleri, ince ayarda kullandıkları veri ve RAG sistemlerinin getirdiği belgeler. Kaynağı doğrulamak emek ister ve kullanılabilecek veriyi daraltır; bedeli budur.
Örnek
Bir banka, dolandırıcılık modelini her ay analistlerin etiketlediği işlemlerle yeniden eğitiyor. Bir dolandırıcılık şebekesi altı ay boyunca belirli bir kalıba uyan 400 küçük havale yapıyor ve hiçbirine itiraz etmiyor; bu işlemler veriye “meşru” etiketiyle giriyor. 2 milyon örnek içinde payları %0,02. Yeniden eğitimden sonra model bu kalıbı güvenli sayıyor ve şebeke büyük tutarları aynı kalıpla geçiriyor. Bankanın test kümesindeki genel doğruluk ise değişmemiş.
Bununla en çok karıştırılan kavram
Data Poisoning ve Prompt Injection arasındaki fark
İkisi de modele düşmanca metin verir, ama farklı anlarda. Prompt injection çalışma anında etki eder ve oturumla birlikte biter; içerik kaldırılınca davranış da kaybolur. Veri zehirleme kullanımdan önce, eğitim ya da dizinleme sırasında etki eder; sonucu ağırlıklarda ya da bilgi tabanında, bütün kullanıcılar için kalır. RAG'de sınır bulanıklaşır: yerleştirilmiş bir belge saklanırken zehirleme, getirilirken enjeksiyondur.
Teknik katman
Amaçlar: genel kaliteyi düşürmek, seçilmiş girdilerde belirli hatalara yol açmak ya da bir arka kapı yerleştirmek, yani yalnızca bir tetikleyici ifade ya da örüntü bulunduğunda ortaya çıkan bir davranış. Giriş noktaları: tarayıcıların topladığı herkese açık web sayfaları, açık veri setleri ve model depoları, üçüncü taraf ince ayar verisi, yeniden eğitimi besleyen kullanıcı geri bildirimleri ve puanları, getirme için dizinlenen belgeler ve ajanın uzun süreli belleği. Gereken miktar küçük olabilir: Anthropic, Birleşik Krallık AI Security Institute ve Alan Turing Institute'un 2025 tarihli çalışmasında, çevrelerinde ne kadar temiz veri olursa olsun, yaklaşık 250 belge farklı boyutlardaki dil modellerine basit bir arka kapı yerleştirmeye yetti. Savunmalar: verinin ve modellerin kaynağını kayda geçirmek, veri seti sürümlerini sabitleyip doğrulamak, aykırı ve yinelenen örnekleri ayıklamak, eğitim ve getirme depolarına kimin yazabileceğini kısıtlamak, bilinen tetikleyici örüntüleri test etmek ve her yeniden eğitimin öncesi ile sonrasındaki davranışı karşılaştırmak. Sonradan tespit güvenilir değildir; yükün çoğunu önleme taşır. Sanatçılar için geliştirilen Nightshade gibi araçlar aynı mekanizmayı bilerek, eserleriyle izinsiz eğitilen görsel modellerine karşı kullanır.