Computer-based approaches in biosequence data analysis


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Dokuz Eylül Üniversitesi, Fen Bilimleri Enstitüsü, Bilgisayar Bilimleri Ana Bilim Dalı, Türkiye

Tezin Onay Tarihi: 2020

Tezin Dili: İngilizce

Öğrenci: ÇAĞDAŞ KÜÇÜK

Danışman: ÇAĞIN KANDEMİR ÇAVAŞ

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Proteinlerin yapısı ve işlevi birbiriyle yakından ilgilidir. Sinyal proteinleri protein sekresyonu, taşınması gibi birçok biyolojik aktiviteye katılır. Sinyal proteinleri yeni ilaç bulunması alanında önemli bir konudur. Bu sebeplerden dolayı bir proteini sınıflandırıp sinyal proteini olup olmadığını bilmek önemlidir. Makine öğrenme çözümleri iyi bir seçenektir; çünkü deneysel çözümler pahalıdır ve zaman alırlar. Bu tezin amacı sinyal proteinlerini protein kodlama yöntemleri ve makine öğrenme algoritmaları kullanarak sınıflandırmaktır. 1867 sinyal ve 3317 sinyal olmayan protein indirildi. Sonra bu proteinler, psödo amino asit kompozisyonu (PseAAC) ve dipeptid kompozisyonu kullanılarak iki veri seti oluşturmak için dönüştürüldü. Derin yapay sinir ağı, rastgele orman ve destek vektör makinesi algoritmaları kullanılarak sinyal proteinleri sınıflandırıldı. İki veri setinde de algoritmaların doğruluk oranları 0,70'den yüksek çıkmıştır ve bu modellerin protein kodlama yöntemleriyle kodlanan sinyal proteinlerinin sınıflandırılmasında etkin olduğunu göstermektedir.