http://repositorio.unb.br/handle/10482/40790| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| 2020_MireleCarolinaSouzaFerreiraCosta.pdf | 3,65 MB | Adobe PDF | Visualizar/Abrir |
| Título: | Investigando o desempenho de métodos de Aprendizado de Máquina para predição de RNAs não-codificadores utilizando construção in silico de dados artificiais |
| Autor(es): | Costa, Mirele Carolina Souza Ferreira |
| E-mail do autor: | carolinamirele@gmail.com |
| Orientador(es): | Walter, Maria Emília Machado Telles |
| Assunto: | PRNAs não-codificadores RNAs nucleolares pequenos Cordados - genoma Aprendizado de máquina |
| Data de publicação: | 3-Mai-2021 |
| Data de defesa: | 18-Dez-2020 |
| Referência: | COSTA, Mirele Carolina Souza F. Investigando o desempenho de métodos de Aprendizado de Máquina para predição de RNAs não-codificadores utilizando construção in silico de dados artificiais. 2020. xviii, 94 f., il. Dissertação (Mestrado em Informática)—Universidade de Brasília, Brasília, 2020. |
| Abstract: | Machine learning (ML) methods are often used to predict different classes of non-coding RNAs (ncRNAs), such as microRNAs or snoRNAs. In ML methods that use the super vised learning paradigm, attributes or features are extracted from the input data and used in a classifier, in the different steps of these methods. However, ML methods have not been used as successfully as expected to search for homology in ncRNAs. In this context, it is relevant to measure the performance of ML methods in order to verify their predictive power, both for evolutionary close sequences and those that are more distant. A system atic evaluation of ML methods for homology prediction requires large, controlled and known sets of tests. Thus, large sets of artificial data have to be created such that their stored sequences are as close as possible to real ncRNAs. In this dissertation, initially, we describe a way to generate arbitrarily large and diverse sets of ncRNA sequences, based on an artificial evolution, of the two main classes of snoRNAs, C/D box and H/ACA box. Then, these artificial data are used to evaluate the predictive power of snoRNAs, in a chordate genome, of three supervised methods of ML - Support Vector Machine (SVM), Artificial Neural Networks (ANN) and Random Forest (RF). Our results indicate that ML approaches can in fact be competitive to predict homology for ncRNAs, depending on the knowledge of biological features, extracted from the data, which are the input of these ML methods. For the substitution mutation, the SVM and ANN classifiers achieved excellent performances for data sets with base mutations of 10%, 20%, 30% and 40% distant from the original snoRNAs. However, for data sets with mutations of 50%, the classifiers did not perform so well. For H/ACA box, the performance of the ML classifiers were equiv alent, using a larger number of known biological features as well as a reduced number of them. For the insertion mutation, the higher the percentage of mutation, the lower the performance of the three classifiers - SVM, ANN and RF. For both types of snoRNAs, the size of the sequences proved to be an important characteristic for correct prediction. In addition, ML methods showed much better prediction results, when compared to methods that directly use primary ncRNA sequences, such as BLAST. |
| Unidade Acadêmica: | Instituto de Ciências Exatas (IE) Departamento de Ciência da Computação (IE CIC) |
| Informações adicionais: | Dissertação (mestrado)—Universidade de Brasília, Instituto de Ciências Exatas, Departamento de Ciência da Computação, 2020. |
| Programa de pós-graduação: | Programa de Pós-Graduação em Informática |
| Licença: | A concessão da licença deste item refere-se ao termo de autorização impresso assinado pelo autor com as seguintes condições: Na qualidade de titular dos direitos de autor da publicação, autorizo a Universidade de Brasília e o IBICT a disponibilizar por meio dos sites www.bce.unb.br, www.ibict.br, http://hercules.vtls.com/cgi-bin/ndltd/chameleon?lng=pt&skin=ndltd sem ressarcimento dos direitos autorais, de acordo com a Lei nº 9610/98, o texto integral da obra disponibilizada, conforme permissões assinaladas, para fins de leitura, impressão e/ou download, a título de divulgação da produção científica brasileira, a partir desta data. |
| Agência financiadora: | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES). |
| Aparece nas coleções: | Teses, dissertações e produtos pós-doutorado |
Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.