Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas

Saulo Augusto de Paula Pinto

Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas

Detalhes bibliográficos
Ano de defesa:	2008
Autor(a) principal:	Saulo Augusto de Paula Pinto
Orientador(a):	Não Informado pela instituição
Banca de defesa:	Não Informado pela instituição
Tipo de documento:	Tese
Tipo de acesso:	Acesso aberto
Idioma:	por
Instituição de defesa:	Universidade Federal de Minas Gerais
Programa de Pós-Graduação:	Não Informado pela instituição
Departamento:	Não Informado pela instituição
País:	Não Informado pela instituição
Palavras-chave em Português:	Bioinformática Aprendizado de máquina não supervisionado Expresssão gênetica Métrica
Link de acesso:	https://hdl.handle.net/1843/55791
Resumo:	The clustering algorithms are among the most utilized techniques in gene expression data analy-sis. Being an exploratory technique, clustering allows researchers to find out similar expression patterns among the variety of sampled tissues pointing out which sampled conditions are more similar than others. This work presents two methodologies to compute the similarity among whole samples of gene expression data utilizing only a fraction of the most expressed sequences (MESs) in each sample. Both similarity metrics are computed considering the expression ordering of the various sequences present in the samples. One of them privileges the sharing of the most expressed sequences (named MESs similarity). The other privileges the keeping of the expression ordering of the sequences (named MESs ordering conservation). Hierarchical clustering utilizing the proposed similarity metrics was applied in 18 gene expression data series summing up 612 samples and the results compared to those produced by some traditional metrics like Euclidian distance, Pearson, and Spearman correlations. Overall, the use of the two proposed metrics out-performed the others: the MESs similarity showed 89% accuracy and the MESs ordering conserva-tion 80% whereas the best traditional metric for the same data was Pearson correlation that yielded 76% accuracy. The results presented here indicate that the proposed metrics are an alter-native to the traditional ones. Besides, they produce data that reflect biologically significant fea-tures of the sampled systems.

Metadados do item

id	UFMG_4cd5bccf14d70fb014b483fba84a1fa1
oai_identifier_str	oai:repositorio.ufmg.br:1843/55791
network_acronym_str	UFMG
network_name_str	Repositório Institucional da UFMG
repository_id_str
spelling	2023-07-04T22:00:07Z2025-09-09T01:30:58Z2023-07-04T22:00:07Z2008-10-31https://hdl.handle.net/1843/55791The clustering algorithms are among the most utilized techniques in gene expression data analy-sis. Being an exploratory technique, clustering allows researchers to find out similar expression patterns among the variety of sampled tissues pointing out which sampled conditions are more similar than others. This work presents two methodologies to compute the similarity among whole samples of gene expression data utilizing only a fraction of the most expressed sequences (MESs) in each sample. Both similarity metrics are computed considering the expression ordering of the various sequences present in the samples. One of them privileges the sharing of the most expressed sequences (named MESs similarity). The other privileges the keeping of the expression ordering of the sequences (named MESs ordering conservation). Hierarchical clustering utilizing the proposed similarity metrics was applied in 18 gene expression data series summing up 612 samples and the results compared to those produced by some traditional metrics like Euclidian distance, Pearson, and Spearman correlations. Overall, the use of the two proposed metrics out-performed the others: the MESs similarity showed 89% accuracy and the MESs ordering conserva-tion 80% whereas the best traditional metric for the same data was Pearson correlation that yielded 76% accuracy. The results presented here indicate that the proposed metrics are an alter-native to the traditional ones. Besides, they produce data that reflect biologically significant fea-tures of the sampled systems.FAPEMIG - Fundação de Amparo à Pesquisa do Estado de Minas GeraisporUniversidade Federal de Minas GeraisAprendizagem não-supervisionadaClusteringMétricas de similaridadeAmostras de dados de expressão gênicaBioinformáticaAprendizado de máquina não supervisionadoExpresssão gêneticaMétricaClustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradasClustering of gene expression data samples using two biologically inspired similarity metricsinfo:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/doctoralThesisSaulo Augusto de Paula Pintoinfo:eu-repo/semantics/openAccessreponame:Repositório Institucional da UFMGinstname:Universidade Federal de Minas Gerais (UFMG)instacron:UFMGhttp://lattes.cnpq.br/5883363053237695José Miguel Ortegahttp://lattes.cnpq.br/1919128137338097Guilherme Correa OliveiraHelena Paula BrentaniRiva de Paula OliveiraGisele Lobo PappaJosé Miguel OrtegaOs algoritmos de clustering estão entre os mais utilizados na análise de dados de expressão gêni-ca. Por ser uma técnica exploratória, o clustering permite aos pesquisadores encontrar padrões de expressão similares entre os diversos tecidos amostrados indicando quais condições amostra-das são mais similares. O presente trabalho apresenta duas metodologias para o cálculo da simi-laridade entre amostras inteiras de dados de expressão gênica utilizando uma fração das seqüên-cias mais expressas (MESs) em cada amostra, que originam duas métricas diferentes. Ambas as métricas são computadas com base na ordenação da expressão das várias seqüências presentes nas amostras, sendo que uma privilegia o compartilhamento entre seqüências mais expressas entre amostras (chamada de similaridade MESs) e a outra a manutenção da ordem de expressão das seqüências (chamada de conservação da ordenação MESs). O clustering hierárquico utilizan-do as métricas de similaridade propostas foi aplicado em 18 séries de dados de expressão gênica, totalizando 612 amostras, e os resultados foram comparados àqueles produzidos utilizando-se métricas tradicionais como a distância euclidiana e correlações de Pearson e Spearman. No ge-ral, a utilização das duas métricas propostas produziu resultados que superaram as demais: a si-milaridade MESs apresentou uma acurácia de cerca de 89% e a conservação da ordenação MESs de 80%, enquanto a melhor métrica tradicional para os dados utilizados foi a correlação de Pear-son que apresentou acurácia de 76%. Os resultados apresentados indicam que as métricas apre-sentadas são uma alternativa às métricas tradicionais, além de proverem dados que refletem características biologicamente significativas dos sistemas amostrados.BrasilICB - DEPARTAMENTO DE BIOQUÍMICA E IMUNOLOGIAPrograma de Pós-Graduação em BioinformaticaUFMGORIGINALtese-corrigida-final.pdfapplication/pdf2073005https://repositorio.ufmg.br//bitstreams/10e3b34a-0f68-47b3-957b-4c8d611afc18/download0040f64b300384c5530008bfcb593b29MD51trueAnonymousREADLICENSElicense.txttext/plain2118https://repositorio.ufmg.br//bitstreams/23b1a383-f91d-4121-9e16-95110ae3043a/downloadcda590c95a0b51b4d15f60c9642ca272MD52falseAnonymousREAD1843/557912025-09-08 22:30:58.591open.accessoai:repositorio.ufmg.br:1843/55791https://repositorio.ufmg.br/Repositório InstitucionalPUBhttps://repositorio.ufmg.br/oairepositorio@ufmg.bropendoar:2025-09-09T01:30:58Repositório Institucional da UFMG - Universidade Federal de Minas Gerais (UFMG)falseTElDRU7Dh0EgREUgRElTVFJJQlVJw4fDg08gTsODTy1FWENMVVNJVkEgRE8gUkVQT1NJVMOTUklPIElOU1RJVFVDSU9OQUwgREEgVUZNRwoKQ29tIGEgYXByZXNlbnRhw6fDo28gZGVzdGEgbGljZW7Dp2EsIHZvY8OqIChvIGF1dG9yIChlcykgb3UgbyB0aXR1bGFyIGRvcyBkaXJlaXRvcyBkZSBhdXRvcikgY29uY2VkZSBhbyBSZXBvc2l0w7NyaW8gSW5zdGl0dWNpb25hbCBkYSBVRk1HIChSSS1VRk1HKSBvIGRpcmVpdG8gbsOjbyBleGNsdXNpdm8gZSBpcnJldm9nw6F2ZWwgZGUgcmVwcm9kdXppciBlL291IGRpc3RyaWJ1aXIgYSBzdWEgcHVibGljYcOnw6NvIChpbmNsdWluZG8gbyByZXN1bW8pIHBvciB0b2RvIG8gbXVuZG8gbm8gZm9ybWF0byBpbXByZXNzbyBlIGVsZXRyw7RuaWNvIGUgZW0gcXVhbHF1ZXIgbWVpbywgaW5jbHVpbmRvIG9zIGZvcm1hdG9zIMOhdWRpbyBvdSB2w61kZW8uCgpWb2PDqiBkZWNsYXJhIHF1ZSBjb25oZWNlIGEgcG9sw610aWNhIGRlIGNvcHlyaWdodCBkYSBlZGl0b3JhIGRvIHNldSBkb2N1bWVudG8gZSBxdWUgY29uaGVjZSBlIGFjZWl0YSBhcyBEaXJldHJpemVzIGRvIFJJLVVGTUcuCgpWb2PDqiBjb25jb3JkYSBxdWUgbyBSZXBvc2l0w7NyaW8gSW5zdGl0dWNpb25hbCBkYSBVRk1HIHBvZGUsIHNlbSBhbHRlcmFyIG8gY29udGXDumRvLCB0cmFuc3BvciBhIHN1YSBwdWJsaWNhw6fDo28gcGFyYSBxdWFscXVlciBtZWlvIG91IGZvcm1hdG8gcGFyYSBmaW5zIGRlIHByZXNlcnZhw6fDo28uCgpWb2PDqiB0YW1iw6ltIGNvbmNvcmRhIHF1ZSBvIFJlcG9zaXTDs3JpbyBJbnN0aXR1Y2lvbmFsIGRhIFVGTUcgcG9kZSBtYW50ZXIgbWFpcyBkZSB1bWEgY8OzcGlhIGRlIHN1YSBwdWJsaWNhw6fDo28gcGFyYSBmaW5zIGRlIHNlZ3VyYW7Dp2EsIGJhY2stdXAgZSBwcmVzZXJ2YcOnw6NvLgoKVm9jw6ogZGVjbGFyYSBxdWUgYSBzdWEgcHVibGljYcOnw6NvIMOpIG9yaWdpbmFsIGUgcXVlIHZvY8OqIHRlbSBvIHBvZGVyIGRlIGNvbmNlZGVyIG9zIGRpcmVpdG9zIGNvbnRpZG9zIG5lc3RhIGxpY2Vuw6dhLiBWb2PDqiB0YW1iw6ltIGRlY2xhcmEgcXVlIG8gZGVww7NzaXRvIGRlIHN1YSBwdWJsaWNhw6fDo28gbsOjbywgcXVlIHNlamEgZGUgc2V1IGNvbmhlY2ltZW50bywgaW5mcmluZ2UgZGlyZWl0b3MgYXV0b3JhaXMgZGUgbmluZ3XDqW0uCgpDYXNvIGEgc3VhIHB1YmxpY2HDp8OjbyBjb250ZW5oYSBtYXRlcmlhbCBxdWUgdm9jw6ogbsOjbyBwb3NzdWkgYSB0aXR1bGFyaWRhZGUgZG9zIGRpcmVpdG9zIGF1dG9yYWlzLCB2b2PDqiBkZWNsYXJhIHF1ZSBvYnRldmUgYSBwZXJtaXNzw6NvIGlycmVzdHJpdGEgZG8gZGV0ZW50b3IgZG9zIGRpcmVpdG9zIGF1dG9yYWlzIHBhcmEgY29uY2VkZXIgYW8gUmVwb3NpdMOzcmlvIEluc3RpdHVjaW9uYWwgZGEgVUZNRyBvcyBkaXJlaXRvcyBhcHJlc2VudGFkb3MgbmVzdGEgbGljZW7Dp2EsIGUgcXVlIGVzc2UgbWF0ZXJpYWwgZGUgcHJvcHJpZWRhZGUgZGUgdGVyY2Vpcm9zIGVzdMOhIGNsYXJhbWVudGUgaWRlbnRpZmljYWRvIGUgcmVjb25oZWNpZG8gbm8gdGV4dG8gb3Ugbm8gY29udGXDumRvIGRhIHB1YmxpY2HDp8OjbyBvcmEgZGVwb3NpdGFkYS4KCkNBU08gQSBQVUJMSUNBw4fDg08gT1JBIERFUE9TSVRBREEgVEVOSEEgU0lETyBSRVNVTFRBRE8gREUgVU0gUEFUUk9Dw41OSU8gT1UgQVBPSU8gREUgVU1BIEFHw4pOQ0lBIERFIEZPTUVOVE8gT1UgT1VUUk8gT1JHQU5JU01PLCBWT0PDiiBERUNMQVJBIFFVRSBSRVNQRUlUT1UgVE9ET1MgRSBRVUFJU1FVRVIgRElSRUlUT1MgREUgUkVWSVPDg08gQ09NTyBUQU1Cw4lNIEFTIERFTUFJUyBPQlJJR0HDh8OVRVMgRVhJR0lEQVMgUE9SIENPTlRSQVRPIE9VIEFDT1JETy4KCk8gUmVwb3NpdMOzcmlvIEluc3RpdHVjaW9uYWwgZGEgVUZNRyBzZSBjb21wcm9tZXRlIGEgaWRlbnRpZmljYXIgY2xhcmFtZW50ZSBvIHNldSBub21lKHMpIG91IG8ocykgbm9tZXMocykgZG8ocykgZGV0ZW50b3IoZXMpIGRvcyBkaXJlaXRvcyBhdXRvcmFpcyBkYSBwdWJsaWNhw6fDo28sIGUgbsOjbyBmYXLDoSBxdWFscXVlciBhbHRlcmHDp8OjbywgYWzDqW0gZGFxdWVsYXMgY29uY2VkaWRhcyBwb3IgZXN0YSBsaWNlbsOnYS4K
dc.title.none.fl_str_mv	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas
dc.title.alternative.none.fl_str_mv	Clustering of gene expression data samples using two biologically inspired similarity metrics
title	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas
spellingShingle	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas Saulo Augusto de Paula Pinto Bioinformática Aprendizado de máquina não supervisionado Expresssão gênetica Métrica Aprendizagem não-supervisionada Clustering Métricas de similaridade Amostras de dados de expressão gênica
title_short	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas
title_full	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas
title_fullStr	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas
title_full_unstemmed	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas
title_sort	Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas
author	Saulo Augusto de Paula Pinto
author_facet	Saulo Augusto de Paula Pinto
author_role	author
dc.contributor.author.fl_str_mv	Saulo Augusto de Paula Pinto
dc.subject.por.fl_str_mv	Bioinformática Aprendizado de máquina não supervisionado Expresssão gênetica Métrica
topic	Bioinformática Aprendizado de máquina não supervisionado Expresssão gênetica Métrica Aprendizagem não-supervisionada Clustering Métricas de similaridade Amostras de dados de expressão gênica
dc.subject.other.none.fl_str_mv	Aprendizagem não-supervisionada Clustering Métricas de similaridade Amostras de dados de expressão gênica
description	The clustering algorithms are among the most utilized techniques in gene expression data analy-sis. Being an exploratory technique, clustering allows researchers to find out similar expression patterns among the variety of sampled tissues pointing out which sampled conditions are more similar than others. This work presents two methodologies to compute the similarity among whole samples of gene expression data utilizing only a fraction of the most expressed sequences (MESs) in each sample. Both similarity metrics are computed considering the expression ordering of the various sequences present in the samples. One of them privileges the sharing of the most expressed sequences (named MESs similarity). The other privileges the keeping of the expression ordering of the sequences (named MESs ordering conservation). Hierarchical clustering utilizing the proposed similarity metrics was applied in 18 gene expression data series summing up 612 samples and the results compared to those produced by some traditional metrics like Euclidian distance, Pearson, and Spearman correlations. Overall, the use of the two proposed metrics out-performed the others: the MESs similarity showed 89% accuracy and the MESs ordering conserva-tion 80% whereas the best traditional metric for the same data was Pearson correlation that yielded 76% accuracy. The results presented here indicate that the proposed metrics are an alter-native to the traditional ones. Besides, they produce data that reflect biologically significant fea-tures of the sampled systems.
publishDate	2008
dc.date.issued.fl_str_mv	2008-10-31
dc.date.accessioned.fl_str_mv	2023-07-04T22:00:07Z 2025-09-09T01:30:58Z
dc.date.available.fl_str_mv	2023-07-04T22:00:07Z
dc.type.status.fl_str_mv	info:eu-repo/semantics/publishedVersion
dc.type.driver.fl_str_mv	info:eu-repo/semantics/doctoralThesis
format	doctoralThesis
status_str	publishedVersion
dc.identifier.uri.fl_str_mv	https://hdl.handle.net/1843/55791
url	https://hdl.handle.net/1843/55791
dc.language.iso.fl_str_mv	por
language	por
dc.rights.driver.fl_str_mv	info:eu-repo/semantics/openAccess
eu_rights_str_mv	openAccess
dc.publisher.none.fl_str_mv	Universidade Federal de Minas Gerais
publisher.none.fl_str_mv	Universidade Federal de Minas Gerais
dc.source.none.fl_str_mv	reponame:Repositório Institucional da UFMG instname:Universidade Federal de Minas Gerais (UFMG) instacron:UFMG
instname_str	Universidade Federal de Minas Gerais (UFMG)
instacron_str	UFMG
institution	UFMG
reponame_str	Repositório Institucional da UFMG
collection	Repositório Institucional da UFMG
bitstream.url.fl_str_mv	https://repositorio.ufmg.br//bitstreams/10e3b34a-0f68-47b3-957b-4c8d611afc18/download https://repositorio.ufmg.br//bitstreams/23b1a383-f91d-4121-9e16-95110ae3043a/download
bitstream.checksum.fl_str_mv	0040f64b300384c5530008bfcb593b29 cda590c95a0b51b4d15f60c9642ca272
bitstream.checksumAlgorithm.fl_str_mv	MD5 MD5
repository.name.fl_str_mv	Repositório Institucional da UFMG - Universidade Federal de Minas Gerais (UFMG)
repository.mail.fl_str_mv	repositorio@ufmg.br
_version_	1862105868039880704

Clustering de amostras de dados de expressão gênica utilizando duas métricas de similaridade biologicamente inspiradas

Registros relacionados