Sade anlatım
Model, kendisine verilenin yansımasıdır. Veri bir konuda zenginse model orada güçlüdür; bir dil ya da bakış açısı veride seyrekse model orada zayıftır. Verideki hatalar ve önyargılar da modele geçer. “Çöp girer, çöp çıkar” ilkesi burada kimsenin tamamını inceleyemeyeceği bir ölçekte geçerlidir.
Neden önemli
Yapay zekayla ilgili hukuki, etik ve kalite sorularının çoğu eğitim verisine dayanır: telif anlaşmazlıkları, yanlılık, mahremiyet ve modelin Türkçede İngilizceden neden daha zayıf olduğu. Tedarikçi seçerken sorulacak sorular: kendi girdileriniz eğitimde kullanılıyor mu, hangi koşullarla ve sağlayıcı verisini nereden edindi?
Örnek
Bir model ABD iş hukuku hakkında kendinden emin, Türk iş mevzuatı hakkında ise muğlak yanıtlar veriyor. Modelin akıl yürütmesinde bir sorun yok: İngilizce hukuk metni web'de boldur, Türkçe hukuk metni çok daha azdır. Çözüm, Türkçe kaynakları sorgu anında retrieval yoluyla vermektir.
Bununla en çok karıştırılan kavram
Training Data ve Context (bağlam) arasındaki fark
Eğitim verisi, model yayımlanmadan önce ağırlıkları biçimlendirmiştir; sonradan ona başvurulamaz ve düzeltilemez. Bağlam ise soruyu sorduğunuz anda verdiğiniz malzemedir. Modele şirketinizin güncel bilgisini vermek için onu bağlama koyarsınız; modeli yeniden eğitmezsiniz.
Teknik katman
Tipik kaynaklar: herkese açık web taramaları, kitaplar ve makaleler, kod depoları, lisanslı arşivler, insanların yazdığı örnek gösterimler ve giderek artan ölçüde başka modellerin ürettiği sentetik veri. İşleme adımları: tekrarların ayıklanması, kalite ve güvenlik filtreleri, kişisel verilerin çıkarılması ve kaynaklar arası karışım oranları. Bilinen sorunlar: sık geçen pasajların ezberlenmesi, bazı dillerin ve grupların yetersiz temsili, benchmark'ların veriye sızması ve telifli malzemeye ilişkin hukuki belirsizlik. Kurumsal API koşulları müşteri verisini genellikle varsayılan olarak eğitimin dışında tutar; tüketici ürünlerinde durum çoğu zaman farklıdır, koşulları okuyun.