Investigation of text mining methods on Turkish text
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, İstatistik Ana Bilim Dalı, Türkiye
Tezin Onay Tarihi: 2018
Tezin Dili: İngilizce
Öğrenci: EZGİ PASİN
Danışman: SEDAT ÇAPAR
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Günümüzde internetin yaygın kullanılması ile birlikte verilerin boyutu ve değeri artmıştır. Büyük miktarlardaki verilerden anlamlı bilgi çıkarmak kişi ve firmalar için diğerlerinden bir adım öne geçmektir. Verilerden anlamlı bilgilerin elde edilmesi için çeşitli madencilik teknikleri uygulanmalıdır. Veri madenciliği yapısal veriler üzerinde işlem yapar. Veri madenciliğinin, metinler üzerinde çalışan alt çalışma alanı ise metin madenciliğidir. Metin madenciliği, özel amaçlar için metinlerden değerli bilgiler çıkarmak adına metnin analiz edilmesi işlemidir. Metin madenciliği teknikleri uygulanmadan önce verilerin hazırlanması ve ön işlemden geçirilmesi gerekmektedir. Metinlerden anlamlı bilgi çıkarmak, metni sınıflandırmak, aranan bilgiye kısa sürede ulaşmak metin madenciliğinin önemini arttırmıştır. Metin sınıflandırma, önceden tanımlanmış kategorilere eğitim dokümanlarını kullanarak verilen metnin sınıfına karar vermesi işlemidir. Tezde amaç, metin halindeki Türkçe verilerin sınıflandırılmasıdır. Kategoriler "Cinsiyet Tanımlama", "Yazar Tanımlama" ve "Tür Belirleme" olmak üzere üç kategoride incelenmiştir. Sınıflandırma yapılırken Naive Bayes metot ve bit skor ağırlıklandırılmış k-NN metot kullanılmıştır. İki metodun doğruluk oranları kıyaslanmıştır. Sınıflandırma için R programlama dili kullanılmıştır. Bu tezde metin sınıflandırılması üzerine çalışmak için Türkçe köşe yazılarından oluşan bir veri kümesi oluşturulmuştur.