Development of a method to determine root and suffixes for Turkish words to generate large scale Turkish corpus
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Ana Bilim Dalı, Türkiye
Tezin Onay Tarihi: 2005
Tezin Dili: İngilizce
Öğrenci: ÖZLEM VARLIKLAR
Danışman: YALÇIN ÇEBİ
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Dillerin biçimbilimsel özelliklerinin belirlenmei için, dilin özelliklerini temil edebilecek bir derlem gereklidir. Türkçe'nin tüm özelliklerini içerebilecek, büyük ölçekli bir derlemin varlığıyla, kelimelere bağlı olan, Türkçe'nin istatistikel özellikleri de incelenebilecektir.Yapılan çalışmada büyük ölçekli Türkçe derlem oluşturmak için bazı gazeteler, roman ve hikayeler ve Türkçe filmlerin altyazılarından oluşan, yaklaşık 130 milyon kelimelik yazılı Türkçe internet yoluyla elde edilmiştir. Türkçe gövdeler, kökler, ekler ve kıaltmaların liteleri elde edilmiştir. Kısaltma listesi ve cümle onu belirlenmesi için kural listei XML yapısında oluşturulmuştur. Cümle sonunu belirlemek için geliştirilen uygulamada kıaltma ve kural listeleri kullanılmış ve başarılı sonuçlar alınmıştır. Yazılar cümlelere ayrıldıktan onra kelimelere ayrılmış, kelimelerin gövdeleri, kök ve çekim eki listeleri kullanılarak bulunduktan onra; kökleri, bulunan gövdelere uygulanan bir yöntemle, yine kök litesi ve yapım ekleri litesi kullanılarak belirlenmiştir. Elde edilen tüm sonuçlar; paragraflar, cümleler, kelimeler, kökler ve ekler şeklinde, Doğal Dil İşleme (DDİ) uygulamaları için özelleştirilmiş, işlemlerin daha kolay yapılmasını ağlayan bir XML yapıı içine kaydedilmiştir. XML yapısının bilinen tek dezavantajı hafızada çok yer kaplamasıdır. Bu dezavantajdan etkilenmemek için, tüm XML doyaları geniş ölçekli derlem oluşturma işlemlerinin başında hafızaya yüklenmektedir. Bu işlem, kelimelerin gövde, kök ve eklerini içeren derlem oluşturma basamaklarının çok hızlı ve etkili bir şekilde yapılabilmesini sağlamıştır.