Sade anlatım
Bazı bilgiler doğrudan tek bir kişiyi gösterir: ad, T.C. kimlik numarası, telefon numarası. Bazıları ise birlikte gösterir: posta kodu, doğum tarihi ve unvan bir araya geldiğinde çoğu zaman tek bir kişiye uyar. PII bu tür verilerin tümüne verilen addır. İşe yarayan test bir sorudur: biri bunun kimin hakkında olduğunu çıkarabilir mi? Çıkarabiliyorsa veri, gittiği her yerde özen ister; bir prompt'un içinde de.
Neden önemli
Her prompt, yüklenen her dosya ve getirilen her belge kişisel bilgi taşıyabilir; bir yapay zeka servisi kullanıldığında bu veri sizin sistemlerinizden çıkıp sağlayıcının sistemlerine gider. Bu da somut sorular doğurur: hukuki dayanak ve sözleşme var mı, veri nerede işleniyor, saklanıyor mu, eğitimde kullanılıyor mu, kayıtları kim okuyabiliyor? GDPR ve KVKK'ya göre veriyi gönderen kurum ondan sorumlu olmayı sürdürür. Maskeleme araçları yardımcı olur; ancak dolaylı tanımlayıcıları kaçırabilir ve modelin ihtiyaç duyduğu bağlamı silebilir. Hangi verinin hangi araca gidebileceğine, çalışanlar sizin yerinize karar vermeden önce siz karar verin.
Örnek
Bir hastane grubu 60.000 hasta şikâyetini bulut tabanlı bir yapay zeka servisiyle özetlemek istiyor. Bir filtre, her metin gönderilmeden önce adları, kimlik numaralarını ve telefon numaralarını yer tutucularla değiştiriyor. 500 şikâyetlik testte filtre doğrudan tanımlayıcıların hepsini temizliyor; yine de 41 metin hastayı tanınabilir biçimde anlatıyor: nadir bir tanı, bir servis, bir tarih. Ekip bu tür metinler için bir inceleme adımı ekliyor ve canlıya geçmeden önce bir veri işleme sözleşmesi imzalıyor.
Bununla en çok karıştırılan kavram
PII ve Kişisel veri (GDPR, KVKK) arasındaki fark
PII çoğu zaman bir liste gibi ele alınır: ad, numara, adres. GDPR ve KVKK'daki kişisel veri ise kişiyle kurduğu bağ üzerinden tanımlanır; bu yüzden IP adreslerini, cihaz ve çerez kimliklerini, konum izlerini, ses kayıtlarını ve bir kişi hakkındaki görüşleri de kapsar. Bir veri seti ABD tipi bir kontrol listesine göre “PII içermiyor” olabilir ve Avrupa'da ya da Türkiye'de yine de kişisel veri sayılabilir. Uyum için, tabi olduğunuz hukuki tanımı esas alın.
Teknik katman
ABD kılavuzu (NIST SP 800-122) PII'yi, tek başına ya da başka bilgilerle ilişkilendirildiğinde bir kişinin kimliğini ayırt etmeye ya da izlemeye yarayan bilgi olarak tanımlar; ABD'deki yasaların her biri kendi listesini belirler. GDPR ve KVKK, daha güçlü koruma gerektiren özel nitelikli verileri ekler; sağlık, biyometrik ve genetik veriler, din ve sendika üyeliği bunlar arasındadır. Üç işlem sık sık karıştırılır: maskeleme tanımlayıcıları kaldırır; takma adlandırma (pseudonymisation) bunları bir anahtarla geri çevrilebilen belirteçlerle değiştirir ve sonuç hâlâ kişisel veridir; anonimleştirme yeniden kimliklendirmeyi pratikte imkânsız kılar ve veri ancak o zaman hukukun kapsamı dışına çıkar. Yapay zeka sistemlerinde kişisel veri prompt'larda, yüklenen dosyalarda, getirme dizinlerinde, konuşma kayıtlarında, bellek özelliklerinde ve ince ayar setlerinde karşınıza çıkar; model eğitim verisinden pasajları yeniden üretebilir. Kontroller: model çağrısından önce tespit ve maskeleme (adlandırılmış varlık tanıma ve örüntüler; Microsoft Presidio yaygın bir açık kaynak araçtır), yanıtta geri yerine konan tersine çevrilebilir yer tutucular, sağlayıcıda saklamama ve eğitimde kullanmama ayarları, bölgesel işleme, kayıtlara erişim kısıtları ve silme rutinleri.