Model nasıl çalışır

Training Data

Eğitim verisi

Modelin eğitim sırasında öğrendiği metin, kod, görsel ve diğer malzeme; içeriği ve kalitesi modelin ne bildiğini ve nasıl davrandığını biçimlendirir.

web sayfalarıkitaplar ve makalelerkod depolarılisanslı ve sentetik veriEğitim verisitemizlenir, filtrelenirModelörüntüleri öğrenirVeride ne varsa modele geçer: bilgi de, hata da, yanlılık da.

şemanın tamamı için kaydırın →

MEmehmeterkek.com/sozluk/training-data

Sade anlatım

Model, kendisine verilenin yansımasıdır. Veri bir konuda zenginse model orada güçlüdür; bir dil ya da bakış açısı veride seyrekse model orada zayıftır. Verideki hatalar ve önyargılar da modele geçer. “Çöp girer, çöp çıkar” ilkesi burada kimsenin tamamını inceleyemeyeceği bir ölçekte geçerlidir.

Neden önemli

Yapay zekayla ilgili hukuki, etik ve kalite sorularının çoğu eğitim verisine dayanır: telif anlaşmazlıkları, yanlılık, mahremiyet ve modelin Türkçede İngilizceden neden daha zayıf olduğu. Tedarikçi seçerken sorulacak sorular: kendi girdileriniz eğitimde kullanılıyor mu, hangi koşullarla ve sağlayıcı verisini nereden edindi?

Örnek

Bir model ABD iş hukuku hakkında kendinden emin, Türk iş mevzuatı hakkında ise muğlak yanıtlar veriyor. Modelin akıl yürütmesinde bir sorun yok: İngilizce hukuk metni web'de boldur, Türkçe hukuk metni çok daha azdır. Çözüm, Türkçe kaynakları sorgu anında retrieval yoluyla vermektir.

Bununla en çok karıştırılan kavram

Training Data ve Context (bağlam) arasındaki fark

Training DataModelin çok önce öğrendiği malzeme
Context (bağlam)Modele şimdi, bu istek için gösterilen malzeme

Eğitim verisi, model yayımlanmadan önce ağırlıkları biçimlendirmiştir; sonradan ona başvurulamaz ve düzeltilemez. Bağlam ise soruyu sorduğunuz anda verdiğiniz malzemedir. Modele şirketinizin güncel bilgisini vermek için onu bağlama koyarsınız; modeli yeniden eğitmezsiniz.

Teknik katman

Tipik kaynaklar: herkese açık web taramaları, kitaplar ve makaleler, kod depoları, lisanslı arşivler, insanların yazdığı örnek gösterimler ve giderek artan ölçüde başka modellerin ürettiği sentetik veri. İşleme adımları: tekrarların ayıklanması, kalite ve güvenlik filtreleri, kişisel verilerin çıkarılması ve kaynaklar arası karışım oranları. Bilinen sorunlar: sık geçen pasajların ezberlenmesi, bazı dillerin ve grupların yetersiz temsili, benchmark'ların veriye sızması ve telifli malzemeye ilişkin hukuki belirsizlik. Kurumsal API koşulları müşteri verisini genellikle varsayılan olarak eğitimin dışında tutar; tüketici ürünlerinde durum çoğu zaman farklıdır, koşulları okuyun.

Yazan Mehmet Erkek · Son güncelleme: