Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina

Detalhes bibliográficos
Ano de defesa: 2019
Autor(a) principal: Costa, Jean Carllo Jardim
Orientador(a): Gomes, João Paulo Pordeus
Banca de defesa: Não Informado pela instituição
Tipo de documento: Dissertação
Tipo de acesso: Acesso aberto
Idioma: por
Instituição de defesa: Não Informado pela instituição
Programa de Pós-Graduação: Não Informado pela instituição
Departamento: Não Informado pela instituição
País: Não Informado pela instituição
Palavras-chave em Português:
Link de acesso: http://www.repositorio.ufc.br/handle/riufc/41653
Resumo: The occurrence of missing data is a recurrent problem and it has aroused the interest of researches over the last decades. Hence, many imputation methods have been proposed in recent years. In this dissertation, we present a study about the impact of the application of several imputation methods on the performance of machine learning algorithms, for both classification and regression. The result obtained shows that the imputation algorithms can have a relevant impact on the performance of classification and regression algorithms depending on the percentage of missing data. In addition, a model for the recommendation of data imputation algorithms is presented, which compares three classifiers (Random Forests, Gradient Boosting and Support Vector Machine) in the development of this task where both have good results.
id UFC-7_6977aab385d1d58c23fc6ff49c5c5750
oai_identifier_str oai:repositorio.ufc.br:riufc/41653
network_acronym_str UFC-7
network_name_str Repositório Institucional da Universidade Federal do Ceará (UFC)
repository_id_str
spelling Costa, Jean Carllo JardimGomes, João Paulo Pordeus2019-05-14T18:14:58Z2019-05-14T18:14:58Z2019COSTA, Jean Carllo Jardim. Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina. 2019. 55 f. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal do Ceará, Fortaleza, 2018.http://www.repositorio.ufc.br/handle/riufc/41653The occurrence of missing data is a recurrent problem and it has aroused the interest of researches over the last decades. Hence, many imputation methods have been proposed in recent years. In this dissertation, we present a study about the impact of the application of several imputation methods on the performance of machine learning algorithms, for both classification and regression. The result obtained shows that the imputation algorithms can have a relevant impact on the performance of classification and regression algorithms depending on the percentage of missing data. In addition, a model for the recommendation of data imputation algorithms is presented, which compares three classifiers (Random Forests, Gradient Boosting and Support Vector Machine) in the development of this task where both have good results.A ocorrência de dados faltantes é um problema recorrente e tem despertado interesse de pesquisadores ao longo das últimas décadas. Devido a isto, muitos métodos para imputação de dados têm sido propostos. Nesta dissertação é apresentado um estudo do impacto da aplicação de vários métodos de imputação de dados faltantes no desempenho de métodos de aprendizado de máquina, tanto classificação como regressão. O resultado obtido mostra que os algoritmos de imputação podem ter impacto relevante no desempenho de algoritmos de classificação e regressão dependendo do percentual de dados faltantes. Adicionalmente é apresentado um modelo para recomendação de algoritmos de imputação de dados que compara três classificadores (Florestas Aleatórias, Gradiente Boosting e Máquina de Vetor de Suporte) no desenvolvimento desta tarefa onde ambos apresentam bons resultados.Dados faltantesAprendizado de máquinaMeta-aprendizadoUma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquinaAn analysis of the impact of missing data on the performance of machine learning methodsinfo:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/masterThesisporreponame:Repositório Institucional da Universidade Federal do Ceará (UFC)instname:Universidade Federal do Ceará (UFC)instacron:UFCinfo:eu-repo/semantics/openAccessLICENSElicense.txtlicense.txttext/plain; charset=utf-81748http://repositorio.ufc.br/bitstream/riufc/41653/4/license.txt8a4605be74aa9ea9d79846c1fba20a33MD54ORIGINAL2018_dis_jcjcosta.pdf2018_dis_jcjcosta.pdfapplication/pdf1171626http://repositorio.ufc.br/bitstream/riufc/41653/3/2018_dis_jcjcosta.pdfe5549059845e3c5fef600e69cb9f4acbMD53riufc/416532019-05-14 15:14:58.445oai:repositorio.ufc.br:riufc/41653Tk9URTogUExBQ0UgWU9VUiBPV04gTElDRU5TRSBIRVJFClRoaXMgc2FtcGxlIGxpY2Vuc2UgaXMgcHJvdmlkZWQgZm9yIGluZm9ybWF0aW9uYWwgcHVycG9zZXMgb25seS4KCk5PTi1FWENMVVNJVkUgRElTVFJJQlVUSU9OIExJQ0VOU0UKCkJ5IHNpZ25pbmcgYW5kIHN1Ym1pdHRpbmcgdGhpcyBsaWNlbnNlLCB5b3UgKHRoZSBhdXRob3Iocykgb3IgY29weXJpZ2h0Cm93bmVyKSBncmFudHMgdG8gRFNwYWNlIFVuaXZlcnNpdHkgKERTVSkgdGhlIG5vbi1leGNsdXNpdmUgcmlnaHQgdG8gcmVwcm9kdWNlLAp0cmFuc2xhdGUgKGFzIGRlZmluZWQgYmVsb3cpLCBhbmQvb3IgZGlzdHJpYnV0ZSB5b3VyIHN1Ym1pc3Npb24gKGluY2x1ZGluZwp0aGUgYWJzdHJhY3QpIHdvcmxkd2lkZSBpbiBwcmludCBhbmQgZWxlY3Ryb25pYyBmb3JtYXQgYW5kIGluIGFueSBtZWRpdW0sCmluY2x1ZGluZyBidXQgbm90IGxpbWl0ZWQgdG8gYXVkaW8gb3IgdmlkZW8uCgpZb3UgYWdyZWUgdGhhdCBEU1UgbWF5LCB3aXRob3V0IGNoYW5naW5nIHRoZSBjb250ZW50LCB0cmFuc2xhdGUgdGhlCnN1Ym1pc3Npb24gdG8gYW55IG1lZGl1bSBvciBmb3JtYXQgZm9yIHRoZSBwdXJwb3NlIG9mIHByZXNlcnZhdGlvbi4KCllvdSBhbHNvIGFncmVlIHRoYXQgRFNVIG1heSBrZWVwIG1vcmUgdGhhbiBvbmUgY29weSBvZiB0aGlzIHN1Ym1pc3Npb24gZm9yCnB1cnBvc2VzIG9mIHNlY3VyaXR5LCBiYWNrLXVwIGFuZCBwcmVzZXJ2YXRpb24uCgpZb3UgcmVwcmVzZW50IHRoYXQgdGhlIHN1Ym1pc3Npb24gaXMgeW91ciBvcmlnaW5hbCB3b3JrLCBhbmQgdGhhdCB5b3UgaGF2ZQp0aGUgcmlnaHQgdG8gZ3JhbnQgdGhlIHJpZ2h0cyBjb250YWluZWQgaW4gdGhpcyBsaWNlbnNlLiBZb3UgYWxzbyByZXByZXNlbnQKdGhhdCB5b3VyIHN1Ym1pc3Npb24gZG9lcyBub3QsIHRvIHRoZSBiZXN0IG9mIHlvdXIga25vd2xlZGdlLCBpbmZyaW5nZSB1cG9uCmFueW9uZSdzIGNvcHlyaWdodC4KCklmIHRoZSBzdWJtaXNzaW9uIGNvbnRhaW5zIG1hdGVyaWFsIGZvciB3aGljaCB5b3UgZG8gbm90IGhvbGQgY29weXJpZ2h0LAp5b3UgcmVwcmVzZW50IHRoYXQgeW91IGhhdmUgb2J0YWluZWQgdGhlIHVucmVzdHJpY3RlZCBwZXJtaXNzaW9uIG9mIHRoZQpjb3B5cmlnaHQgb3duZXIgdG8gZ3JhbnQgRFNVIHRoZSByaWdodHMgcmVxdWlyZWQgYnkgdGhpcyBsaWNlbnNlLCBhbmQgdGhhdApzdWNoIHRoaXJkLXBhcnR5IG93bmVkIG1hdGVyaWFsIGlzIGNsZWFybHkgaWRlbnRpZmllZCBhbmQgYWNrbm93bGVkZ2VkCndpdGhpbiB0aGUgdGV4dCBvciBjb250ZW50IG9mIHRoZSBzdWJtaXNzaW9uLgoKSUYgVEhFIFNVQk1JU1NJT04gSVMgQkFTRUQgVVBPTiBXT1JLIFRIQVQgSEFTIEJFRU4gU1BPTlNPUkVEIE9SIFNVUFBPUlRFRApCWSBBTiBBR0VOQ1kgT1IgT1JHQU5JWkFUSU9OIE9USEVSIFRIQU4gRFNVLCBZT1UgUkVQUkVTRU5UIFRIQVQgWU9VIEhBVkUKRlVMRklMTEVEIEFOWSBSSUdIVCBPRiBSRVZJRVcgT1IgT1RIRVIgT0JMSUdBVElPTlMgUkVRVUlSRUQgQlkgU1VDSApDT05UUkFDVCBPUiBBR1JFRU1FTlQuCgpEU1Ugd2lsbCBjbGVhcmx5IGlkZW50aWZ5IHlvdXIgbmFtZShzKSBhcyB0aGUgYXV0aG9yKHMpIG9yIG93bmVyKHMpIG9mIHRoZQpzdWJtaXNzaW9uLCBhbmQgd2lsbCBub3QgbWFrZSBhbnkgYWx0ZXJhdGlvbiwgb3RoZXIgdGhhbiBhcyBhbGxvd2VkIGJ5IHRoaXMKbGljZW5zZSwgdG8geW91ciBzdWJtaXNzaW9uLgo=Repositório InstitucionalPUBhttp://www.repositorio.ufc.br/ri-oai/requestbu@ufc.br || repositorio@ufc.bropendoar:2019-05-14T18:14:58Repositório Institucional da Universidade Federal do Ceará (UFC) - Universidade Federal do Ceará (UFC)false
dc.title.pt_BR.fl_str_mv Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
dc.title.en.pt_BR.fl_str_mv An analysis of the impact of missing data on the performance of machine learning methods
title Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
spellingShingle Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
Costa, Jean Carllo Jardim
Dados faltantes
Aprendizado de máquina
Meta-aprendizado
title_short Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
title_full Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
title_fullStr Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
title_full_unstemmed Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
title_sort Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina
author Costa, Jean Carllo Jardim
author_facet Costa, Jean Carllo Jardim
author_role author
dc.contributor.author.fl_str_mv Costa, Jean Carllo Jardim
dc.contributor.advisor1.fl_str_mv Gomes, João Paulo Pordeus
contributor_str_mv Gomes, João Paulo Pordeus
dc.subject.por.fl_str_mv Dados faltantes
Aprendizado de máquina
Meta-aprendizado
topic Dados faltantes
Aprendizado de máquina
Meta-aprendizado
description The occurrence of missing data is a recurrent problem and it has aroused the interest of researches over the last decades. Hence, many imputation methods have been proposed in recent years. In this dissertation, we present a study about the impact of the application of several imputation methods on the performance of machine learning algorithms, for both classification and regression. The result obtained shows that the imputation algorithms can have a relevant impact on the performance of classification and regression algorithms depending on the percentage of missing data. In addition, a model for the recommendation of data imputation algorithms is presented, which compares three classifiers (Random Forests, Gradient Boosting and Support Vector Machine) in the development of this task where both have good results.
publishDate 2019
dc.date.accessioned.fl_str_mv 2019-05-14T18:14:58Z
dc.date.available.fl_str_mv 2019-05-14T18:14:58Z
dc.date.issued.fl_str_mv 2019
dc.type.status.fl_str_mv info:eu-repo/semantics/publishedVersion
dc.type.driver.fl_str_mv info:eu-repo/semantics/masterThesis
format masterThesis
status_str publishedVersion
dc.identifier.citation.fl_str_mv COSTA, Jean Carllo Jardim. Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina. 2019. 55 f. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal do Ceará, Fortaleza, 2018.
dc.identifier.uri.fl_str_mv http://www.repositorio.ufc.br/handle/riufc/41653
identifier_str_mv COSTA, Jean Carllo Jardim. Uma análise sobre o impacto de dados faltantes no desempenho de métodos de aprendizado de máquina. 2019. 55 f. Dissertação (Mestrado em Ciência da Computação) - Universidade Federal do Ceará, Fortaleza, 2018.
url http://www.repositorio.ufc.br/handle/riufc/41653
dc.language.iso.fl_str_mv por
language por
dc.rights.driver.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.source.none.fl_str_mv reponame:Repositório Institucional da Universidade Federal do Ceará (UFC)
instname:Universidade Federal do Ceará (UFC)
instacron:UFC
instname_str Universidade Federal do Ceará (UFC)
instacron_str UFC
institution UFC
reponame_str Repositório Institucional da Universidade Federal do Ceará (UFC)
collection Repositório Institucional da Universidade Federal do Ceará (UFC)
bitstream.url.fl_str_mv http://repositorio.ufc.br/bitstream/riufc/41653/4/license.txt
http://repositorio.ufc.br/bitstream/riufc/41653/3/2018_dis_jcjcosta.pdf
bitstream.checksum.fl_str_mv 8a4605be74aa9ea9d79846c1fba20a33
e5549059845e3c5fef600e69cb9f4acb
bitstream.checksumAlgorithm.fl_str_mv MD5
MD5
repository.name.fl_str_mv Repositório Institucional da Universidade Federal do Ceará (UFC) - Universidade Federal do Ceará (UFC)
repository.mail.fl_str_mv bu@ufc.br || repositorio@ufc.br
_version_ 1847793012731543552