Development of a method to determine root and suffixes for Turkish words to generate large scale Turkish corpus


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Ana Bilim Dalı, Türkiye

Tezin Onay Tarihi: 2005

Tezin Dili: İngilizce

Öğrenci: ÖZLEM VARLIKLAR

Danışman: YALÇIN ÇEBİ

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Dillerin biçimbilimsel özelliklerinin belirlenmei için, dilin özelliklerini temil edebilecek bir derlem gereklidir. Türkçe'nin tüm özelliklerini içerebilecek, büyük ölçekli bir derlemin varlığıyla, kelimelere bağlı olan, Türkçe'nin istatistikel özellikleri de incelenebilecektir.Yapılan çalışmada büyük ölçekli Türkçe derlem oluşturmak için bazı gazeteler, roman ve hikayeler ve Türkçe filmlerin altyazılarından oluşan, yaklaşık 130 milyon kelimelik yazılı Türkçe internet yoluyla elde edilmiştir. Türkçe gövdeler, kökler, ekler ve kıaltmaların liteleri elde edilmiştir. Kısaltma listesi ve cümle onu belirlenmesi için kural listei XML yapısında oluşturulmuştur. Cümle sonunu belirlemek için geliştirilen uygulamada kıaltma ve kural listeleri kullanılmış ve başarılı sonuçlar alınmıştır. Yazılar cümlelere ayrıldıktan onra kelimelere ayrılmış, kelimelerin gövdeleri, kök ve çekim eki listeleri kullanılarak bulunduktan onra; kökleri, bulunan gövdelere uygulanan bir yöntemle, yine kök litesi ve yapım ekleri litesi kullanılarak belirlenmiştir. Elde edilen tüm sonuçlar; paragraflar, cümleler, kelimeler, kökler ve ekler şeklinde, Doğal Dil İşleme (DDİ) uygulamaları için özelleştirilmiş, işlemlerin daha kolay yapılmasını ağlayan bir XML yapıı içine kaydedilmiştir. XML yapısının bilinen tek dezavantajı hafızada çok yer kaplamasıdır. Bu dezavantajdan etkilenmemek için, tüm XML doyaları geniş ölçekli derlem oluşturma işlemlerinin başında hafızaya yüklenmektedir. Bu işlem, kelimelerin gövde, kök ve eklerini içeren derlem oluşturma basamaklarının çok hızlı ve etkili bir şekilde yapılabilmesini sağlamıştır.