Web mining: Pattern discovery on the world wide web
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Ana Bilim Dalı, Türkiye
Tezin Onay Tarihi: 2011
Tezin Dili: İngilizce
Öğrenci: MUSTAFA TURAN
Danışman: DERYA BİRANT
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Web sayfalarında bulunan sayılamayacak derecede verilerin çokluğu, interneti `Dünya' gezegeninin en büyük veritabanı haline getirmiştir. Bu kadar verideki problem bu verilen düzenli bir veri yapısı içermemesidir. Bu verinin düzenli hale getirilip çeşitli amaçlar için kullanılması amacıyla web madenciliği metotları ortaya çıkmıştır. Web madenciliği veri madenciliği tekniklerinin web sayfaları üzerinde örüntü keşfi amacıyla kullanılması için kullanılan bir tekniktir. Web madenciliği web sayfalarından ve web servislerinden veri toplamak ve veriyi incelemek için güçlü bir araştırma alanıdır. Web madenciliğinin web sayfalarından ve servislerinden veriyi elde etme, elde edilen veri üzerindeki yapıyı analiz etme gibi metotları vardır. Bunların dışında, web madenciliği web sunucu kayıtlarını ve kullanıcı oturumlarından yararlanarak kullanıcılar ve web sayfasının yapısı hakkında veri elde etme özelliğine sahiptir.Her ne kadar web madenciliği teknikleriyle ile web sayfalarında veri elde etmek mümkün olsa da bu verileri tam manada anlamlı hale getirmek için makine öğrenme teknikleriyle kullanmak gerekmektedir. Bu verileri anlamlı hale getirmek için birçok teknik vardır. Makine öğrenme teknikleri arasında sınıflandırma, metin tabanlı verileri içeriklerine göre sınıfını belirlemek için kullanılan en popular metotlardan biridir.Bu tez web madenciliği teknikleriyle makine öğrenme tekniklerini birlikte kullanarak hibrit bir yapıyı amaçlamaktadır. Uygulama çeşitli web sayfalarından ve servislerinden Türkçe yazılmış verileri elde edip, bu verileri düzenleyerek servis halinde sunmaktadır. Bu çalışma temelde, web içerik madenciliği, web yapı madenciliği tekniklerini kullanarak web sayfalarından veri elde edip bu verileri yapısal olarak incelemektedir. Bunun dışında, yazı dili tanıma, Türkçe kelime doğrulama, Türkçe ek kök ayırma gibi metin işlemleri için çeşitli iç ve dış web servislerini kullanmaktadır. Dahası Naïve Bayes ve `Destek Vektör Makine'lerini TF-TDF (Terim Frekansı ? Ters Doküman Frekansı) ağırlıklandırma yöntemi ile kullanarak web sayfalarından elde edilen veriler üzerinde sezgisel sınıflandırma yapmaktadır.Çalışmada öncelikle, verinin nasıl ve nerden elde edildiği hakkında bilgi verilmekte, ikincil olarak bu veriler üzerinde yapılan metin operasyonları detaylı bir şekilde doğruluk oranları hesaplanarak açıklanmaktadır. Son olarak ise, elde edilen metin dokümanlar üzerinde birçok açıdan sezgisel sınıflandırma yapılmakta ve doğruluk değerleri verilmektedir.Anahtar sözcükler: Web Madenciliği, Web İçerik Madenciliği, Web Yapı Madenciliği, Geri Bildirim Madenciliği, Sezgisel Sınıflandırma