Improving machine learning methods for social media data in Turkish
Tezin Türü: Doktora
Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Ana Bilim Dalı, Türkiye
Tezin Onay Tarihi: 2021
Tezin Dili: İngilizce
Öğrenci: BUKET ERŞAHİN
Danışman: ÖZLEM AKTAŞ
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bu çalışmada Türkçe duygu analizi için sözlük ve makine öğrenmesi tabanlı yaklaşımları birleştiren hibrit (karma) bir yöntem geliştirilmiştir. Sözlük tabanlı kısımda kullanılmak üzere, SentiTürkNet eş anlamlılar sözlüğü olan ASDICT ile genişletilerek bir duygu analizi sözlüğü oluşturulmuştur. Bunun yanında, makine öğrenmesi tarafında Naïve Bayes, Support Vector Machines ve J48 adlı üç gözetimli öğrenme algoritması ile sınıflandırma sorunu çözülmüştür. Hibrit yöntemimiz bu iki yaklaşımı özellik üretimi algoritmamızı kullanarak yeni bir sözlük tabanlı değer hesaplayıp ve bunu makine öğrenmesi sınıflandırıcılarına yeni bir özellik olarak ekleyerek birleştirmektedir. Film, otel ve Twitter olmak üzere üç farklı veri seti üzerinde sınamalar gerçekleştirilmiştir. Türkçe'nin morfolojik yapısından kaynaklı dilbilimsel zorluklara rağmen, deneysel sonuçlar çalışmamızın doğruluk oranını diğer çalışmalara göre ortalama %7 artırdığını göstermektedir. Sonuç olarak, çalışmamızın katkıları şunlardır: Bu çalışma Türkçe duygu analizi için geliştirilmiş ilk hibrit yaklaşımdır. Ayrıca, pozitif ve negatif anlamı kaybetmemek için kök çözümleme algoritması iyileştirilmiştir. Son olarak, ilk kapsamlı polarite sözlüğü olan STN genişletilerek eSTN adında daha kapsamlı bir sözlük oluşturulmuştur.