Veri kalitesinde eksik veri sorunlarının derin öğrenme yöntemi ile çözülmesi: Üretici çekişmeli ağlar ile bir uygulama


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Sosyal Bilimler Enstitüsü, Toplam Kalite Yönetimi (Disiplinlerarası) Ana Bilim Dalı, Türkiye

Tezin Onay Tarihi: 2020

Tezin Dili: Türkçe

Öğrenci: ŞEVHAT DOGER

Danışman: OSMAN AVŞAR KURGUN

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Büyük veri analizi ve makine öğrenimi algoritmaları alanında yapılan devrim niteliğindeki gelişmeler, bankacılık, finansal hizmetler, varlık yönetimi, yiyecek-içecek ve e-ticaret gibi endüstrilerin iş stratejilerini değiştirmiştir. Bu işletmelerin veriye dayalı karar alma stratejileri rekabet edebilirliklerini artırırken bazı yeni problemlerle karşılaşmalarına neden olmuştur. İşletmelerin verileri kullanırken karşılaştığı en yaygın problemlerden biri veri setlerinde eksik verilerin bulunmasıdır. Eksik veri problemi veri kalitesini etkileyen önemli unsurlardan birisidir. Araştırmanın amacı, veri kalitesini etkileyen eksik veri problemlerini çözmek için uygun yönteminin seçilmesi ve şarap üreten işletmeler için eksik veri problemleri karşısında başvurabilecekleri bir rehber oluşturmaktır. Bu amaç doğrultusunda uygulama, şarap kalitesi isimli veri setinde eksik değerler oluşturularak elde edilen yeni veri seti üzerine yapılmıştır. Bu bağlamda türevlenebilir üretici model deneysel olarak eksik veri tamamlamada kullanılmıştır. Üretici çekişmeli atama ağları (GAIN- Generative Adversial Imputation Networks) türevlenebilir üretici modeller sınıfını temsil etmektedir. GAIN modelinin performansı geleneksel yöntemlerden karar ağaçları, çoklu atama, beklenti maksimizasyonu ile kıyaslanmıştır. Ayrıca GAIN modelinin wasserstein ayarıyla geliştirilmiş versiyonu wasserstein üretici çekişmeli atama ağları (WGAIN-Wasserstein Generative Adversial Imputation Networks) algoritması tanıtılmıştır. Algoritmanın değerlendirilmesi orijinal veri seti ile tamamlanmış veri seti değerleri arasındaki farklar hesaplanarak yapılmıştır. RMSE değerlendirme kriteri bunun için kullanılmıştır. Ampirik bulgular, GAIN algoritmasının özellikle WGAIN algoritmasının her eksiklik mekanizmasında ve %10' dan % 50 ye varan eksiklik oranlarında en başarılı performansı gösterdiği tespit edilmiştir. Şarap üreten işletme ölçeğinde eksik veri probleminin çözüm aşamaları anlatılmış en uygun yöntem olan WGAIN algoritmasının tercih edilmesi gerektiği belirtilmiştir. Analiz, eksik veri çözümleme yöntemleri arasında kullanımı Türkçe kaynaklarda nadir bulunan, GAIN yer verilmiş olmasından ötürü önemlidir.