Applying and comparing smoothing techniques to contemporary printed Turkish


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Mühendisliği Ana Bilim Dalı, Türkiye

Tezin Onay Tarihi: 2004

Tezin Dili: İngilizce

Öğrenci: GÖKHAN DALKILIÇ

Danışman: YALÇIN ÇEBİ

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

VI ÖZET Ses ve optik karakter tanıma, metin düzeltme, veri sıkıştırma, vs. için doğal bir dilin yapısal özelliklerinin belirlenmesi gereklidir. Bu özellikler, morfolojik ve istatistiksel analiz olmak üzere iki ayrı kategoride incelenebilir. İstatistiksel analiz için, doğal dili temsil eden örnek bir külliyata (corpus) ihtiyaç vardır. Bu külliyatın kelime n-gram frekansları, uygun algoritmalar kullanılarak saptanabilir ve eksik olan n-gramlar düzeltme (smoothing) teknikleriyle tahmin edilebilir. Bu çalışmada, düzeltme tekniklerini karşılaştırmak ve güncel Türkçeye uygulamak amacıyla, kelime n-gram frekanslarının araştınlabileceği TurCo isminde bir külliyat yaratılmıştır. Kelime n-gramlanmn hesaplanması için değişik algoritmalar geliştirilmiş ve denenmiştir. Monogram, digram, trigram, tetragram ve pentagram kelime listeleri bulunduktan sonra özellikleri incelenmiştir. Genelleme yapmak için Zipf Kanunu uygulanmış ve Zipf Kanunu'nun duyarlılığım arttırmak için uygun Mandelbrot sabitleri bulunmuştur. Külliyat, dilin tümünü temsil edecek kadar büyük olamayacağından, görülmeyen n-gramlarm tahmini için düzeltme teknikleri kullanılmalıdır. Düzeltme tekniklerinin incelenmesi ve karşılaştırılması sonucunda, Back-off yönteminin en uygun çözümü verebileceği öngörülmüştür. Bu yöntemin uygulanması ve sonuçların değerlendirilmesi için En Kısa Düzeltme Uzaklığı (Minimum Edit Distance) yöntemi de kullanılarak deneysel bir yazılım geliştirilmiş ve sonuçlar Microsoft Word XP ile karşılaştnılmıştır. Anahtar sözcükler : Külliyat, kelime n-gramlan, yumuşatma, n-gram analiz algoritması, Türkçe külliyat, Türkçe kelime n-gramlan