Computer-based approaches in biosequence data analysis
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Bilimleri Ana Bilim Dalı, Türkiye
Tezin Onay Tarihi: 2020
Tezin Dili: İngilizce
Öğrenci: ÇAĞDAŞ KÜÇÜK
Danışman: ÇAĞIN KANDEMİR ÇAVAŞ
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Proteinlerin yapısı ve işlevi birbiriyle yakından ilgilidir. Sinyal proteinleri protein sekresyonu, taşınması gibi birçok biyolojik aktiviteye katılır. Sinyal proteinleri yeni ilaç bulunması alanında önemli bir konudur. Bu sebeplerden dolayı bir proteini sınıflandırıp sinyal proteini olup olmadığını bilmek önemlidir. Makine öğrenme çözümleri iyi bir seçenektir; çünkü deneysel çözümler pahalıdır ve zaman alırlar. Bu tezin amacı sinyal proteinlerini protein kodlama yöntemleri ve makine öğrenme algoritmaları kullanarak sınıflandırmaktır. 1867 sinyal ve 3317 sinyal olmayan protein indirildi. Sonra bu proteinler, psödo amino asit kompozisyonu (PseAAC) ve dipeptid kompozisyonu kullanılarak iki veri seti oluşturmak için dönüştürüldü. Derin yapay sinir ağı, rastgele orman ve destek vektör makinesi algoritmaları kullanılarak sinyal proteinleri sınıflandırıldı. İki veri setinde de algoritmaların doğruluk oranları 0,70'den yüksek çıkmıştır ve bu modellerin protein kodlama yöntemleriyle kodlanan sinyal proteinlerinin sınıflandırılmasında etkin olduğunu göstermektedir.