Sade anlatım
Pilotlar simülatörde eğitilir, çünkü pratik yapmak için gerçek bir motor yangınını kimse bekleyemez. Sentetik veri, yapay zekanın simülatörüdür: hiç yaşanmamış ama yaşanmış olabilecek gibi görünen örnekler. Uydurma müşteri şikâyetleri, kurgusal faturalar, simüle edilmiş sensör ölçümleri, hayali hasta kayıtları. Sipariş üzerine ve istenen miktarda üretilir; gerçek hayatın çok seyrek sunduğu nadir ve zor vakalar da buna dahildir.
Neden önemli
Yinelenen üç soruna yanıt verir: dolandırıcılık ya da üretim hatası gibi en önemli vakalardan elde çok az örnek olması; gerçek verinin geliştiricilerle ya da tedarikçilerle paylaşılamayacak kadar hassas olması; henüz yaşanmamış durumları kapsayan test kümelerine duyulan ihtiyaç. Riskleri de aynı ölçüde somuttur. Sentetik veri, onu üreten sistemin kör noktalarını ve yanlılıklarını taşır; onunla eğitilen bir model gerçek dünya hakkında kendinden emin biçimde yanılabilir. Kendiliğinden anonim de değildir: gerçek kayıtlarla eğitilmiş bir üretici, bu kayıtların parçalarını yeniden üretebilir. Son test kümesini gerçek veriden oluşturun.
Örnek
Bir bankanın dolandırıcılık modeli, yalnızca 400 gerçek örneğini gördüğü yeni bir telefon dolandırıcılığını kaçırıyor. Ekip bir dil modeline, bu 400 örneğin kalıbında 20.000 farklı görüşme dökümü yazdırıyor. Analistler 500'lük bir örneklemi inceliyor, yaklaşık onda birini gerçekçi bulmayıp eliyor ve istem düzeltiliyor. Karma veriyle eğitilen model, bu dolandırıcılığın gerçek vakalarının %81'ini yakalıyor; önceki oran %62 idi. Test kümesinde yalnızca gerçek görüşmeler var.
Bununla en çok karıştırılan kavram
Synthetic Data ve Anonimleştirilmiş veri arasındaki fark
Anonimleştirilmiş veri gerçektir: adlar ve numaralar çıkarılmış olsa da her satır hâlâ birine karşılık gelir ve kalan ayrıntıların birleşimi o kişiyi bazen yeniden tanınır kılabilir. Sentetik veri, özgün verideki örüntülerden yeni baştan üretilir. Bu, riski azaltır ama ortadan kaldırmaz; çünkü üretici alışılmadık kayıtları ezberleyip yineleyebilir. Veri koruma hukukunda ikisi de ancak kişiler makul yollarla yeniden tanınamıyorsa anonim sayılır ve bunun test edilmesi gerekir.
Teknik katman
Üç üretim yolu vardır: kurallar ve şablonlar; robotik, sürüş ve sensör verisinde kullanılan simülasyon; örnek, varyasyon ya da bütün konuşmalar yazması istenen dil modellerini de kapsayan üretken modeller. Dil modellerinde kalite, gerçek örneklerle tohumlamaya, persona, konu ve zorluk düzeyini bilinçli olarak çeşitlendirmeye ve çıktıyı filtrelemeye bağlıdır; çünkü yönlendirilmeyen üretimler birkaç tipik vakanın çevresinde toplanır. Yaygın kullanımlar: nadir sınıfları çoğaltma, değerlendirme kümeleri ve red team istemleri kurma, damıtma için öğretmen çıktıları üretme ve yazılım için test verisi oluşturma. Kontroller: sadakat (gerçek dağılımlara uyuyor mu?), yararlılık (onunla eğitilen model gerçek veride çalışıyor mu?) ve mahremiyet (gerçek kayıtlar geri çıkarılabiliyor mu?). Diferansiyel mahremiyet, sadakatten bir miktar ödün karşılığında biçimsel güvence verir. Bilinen uzun vadeli risk model çöküşüdür (model collapse): 2024'te Nature'da yayımlanan bir araştırma, önceki modellerin çıktılarıyla tekrar tekrar eğitilen modellerin özgün dağılımın nadir kısımlarını yitirdiğini gösterdi. Hangi verinin sentetik olduğunu kayıt altında tutun.