Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets

Detalhes bibliográficos
Ano de defesa: 2016
Autor(a) principal: Cunha, Holisson Soares da
Orientador(a): Não Informado pela instituição
Banca de defesa: Não Informado pela instituição
Tipo de documento: Dissertação
Tipo de acesso: Acesso aberto
Idioma: por
Instituição de defesa: Pontifícia Universidade Católica do Rio Grande do Sul
Escola Politécnica
Brasil
PUCRS
Programa de Pós-Graduação em Ciência da Computação
Programa de Pós-Graduação: Não Informado pela instituição
Departamento: Não Informado pela instituição
País: Não Informado pela instituição
Palavras-chave em Português:
Link de acesso: https://tede2.pucrs.br/tede2/handle/tede/10483
Resumo: Diariamente, milhões de usuários utilizam o Twitter para compartilhar mensagens, fornecendo um enorme volume de conteúdo opinativo sobre diversos tópicos de interesse da sociedade. Além da quantidade de mensagens, o Twitter caracteriza-se como uma rede social de Fluxo Contínuo de Dados, que gera novas mensagens em tempo real, em alta velocidade e com distribuição não estacionária. Devido a essas características, pesquisas recentes em Análise de Sentimento têm explorado o Twitter em tarefas de classificação online, considerando restrições de tempo, memória e a necessidade de adaptação às mudanças que podem ocorrer na distribuição dos dados. Chamado de Concept Drift, esse fenômeno ocorre em decorrência de potenciais mudanças na distribuição que gera novos dados dentro do fluxo, afetando diretamente a capacidade de generalização do algoritmo. Além disso, a Análise de Sentimento introduz um tipo especial de mudança, chamada de Feature Drift. Trata-se de um problema onde novos atributos relevantes são encontrados ao longo do fluxo e atributos conhecidos se tornam irrelevantes, o que sugere o uso de um espaço dimensional dinâmico. Com base nesses desafios, neste trabalho é proposto SENTIMENTSTREAM, um comitê de classificadores dinâmico, baseado em lotes de dados, e que incrementalmente processa e avalia novas instâncias ao longo do fluxo. Especializado na classificação de tweets, SENTIMENTSTREAM é composto por dois componentes principais: (i) Um detector de concept drift, capaz de detectar e reagir de forma eficiente a mudanças abruptas na distribuição dos dados e, (ii) um detector de feature drift, que utiliza uma estratégia automática para monitorar e identificar potenciais mudanças no espaço de atributos. Experimentos com dados reais do Twitter indicam que SENTIMENTSTREAM apresenta resultados efetivos, sendo eficaz no processo de classificação de tweets e no tratamento de mudanças abruptas na distribuição dos dados.
id P_RS_1df397272856fadbf7b47b9d67c017dc
oai_identifier_str oai:tede2.pucrs.br:tede/10483
network_acronym_str P_RS
network_name_str Biblioteca Digital de Teses e Dissertações da PUC_RS
repository_id_str
spelling Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweetsAnálise de SentimentoMineração em Fluxo Contínuo de DadosAprendizado de MáquinaEspaço Dinâmico de AtributosComitê de ClassificadoresSentiment AnalysisData Stream MiningMachine LearningDynamic Feature SpaceConcept DriftFeature DriftEnsemble ClassifiersCIENCIA DA COMPUTACAO::TEORIA DA COMPUTACAODiariamente, milhões de usuários utilizam o Twitter para compartilhar mensagens, fornecendo um enorme volume de conteúdo opinativo sobre diversos tópicos de interesse da sociedade. Além da quantidade de mensagens, o Twitter caracteriza-se como uma rede social de Fluxo Contínuo de Dados, que gera novas mensagens em tempo real, em alta velocidade e com distribuição não estacionária. Devido a essas características, pesquisas recentes em Análise de Sentimento têm explorado o Twitter em tarefas de classificação online, considerando restrições de tempo, memória e a necessidade de adaptação às mudanças que podem ocorrer na distribuição dos dados. Chamado de Concept Drift, esse fenômeno ocorre em decorrência de potenciais mudanças na distribuição que gera novos dados dentro do fluxo, afetando diretamente a capacidade de generalização do algoritmo. Além disso, a Análise de Sentimento introduz um tipo especial de mudança, chamada de Feature Drift. Trata-se de um problema onde novos atributos relevantes são encontrados ao longo do fluxo e atributos conhecidos se tornam irrelevantes, o que sugere o uso de um espaço dimensional dinâmico. Com base nesses desafios, neste trabalho é proposto SENTIMENTSTREAM, um comitê de classificadores dinâmico, baseado em lotes de dados, e que incrementalmente processa e avalia novas instâncias ao longo do fluxo. Especializado na classificação de tweets, SENTIMENTSTREAM é composto por dois componentes principais: (i) Um detector de concept drift, capaz de detectar e reagir de forma eficiente a mudanças abruptas na distribuição dos dados e, (ii) um detector de feature drift, que utiliza uma estratégia automática para monitorar e identificar potenciais mudanças no espaço de atributos. Experimentos com dados reais do Twitter indicam que SENTIMENTSTREAM apresenta resultados efetivos, sendo eficaz no processo de classificação de tweets e no tratamento de mudanças abruptas na distribuição dos dados.Daily, millions of users use Twitter to share messages, providing a huge amount of opinionated content on various topics of interest to society. In addition to the volume of messages, Twitter is characterized as a social network in data streaming, that generates new messages in real-time at high speed and with a nonstationary distribution. Because of these characteristics, recent research in Sentiment Analysis has explored Twitter as an online classification task, considering constraints of time, memory, and the need to adapt to changes that may occur in the data distribution. Called concept drift, this phenomenon occurs due to potential changes in the distribution that generates new data within the stream, directly affecting the algorithm’s ability to generalize. Furthermore, the Sentiment Analysis introduces a special kind of challenge, called feature drift. In this case, new relevant attributes are found along the stream and known attributes may become irrelevant, which suggests the use of dynamic feature space. Based on these challenges, this work proposes SENTIMENTSTREAM, a dynamic ensemble classifier, which incrementally processes and analyses new instances along the stream. Specialized to process Twitter data, SENTIMENTSTREAM is composed of two main components: (i) A concept drift detector, able to detect and react efficiently to abrupt changes in the data distribution, and (ii) a feature drift detector, which uses an automatic strategy to monitor and identify potential changes in the attributes space. Experimentation with real data of Twitter indicates that Twitter SENTIMENTSTREAM presents effective results, being effective for tweets classification and treatment of potential changes in the data distribution.Fundação de Amparo à Pesquisa do Estado do Rio Grande do Sul (FAPERGS)Pontifícia Universidade Católica do Rio Grande do SulEscola PolitécnicaBrasilPUCRSPrograma de Pós-Graduação em Ciência da ComputaçãoRuiz, Duncan Dubugras Alcobahttp://lattes.cnpq.br/8250832800932125Cunha, Holisson Soares da2022-09-22T14:51:40Z2016-04-30info:eu-repo/semantics/publishedVersioninfo:eu-repo/semantics/masterThesisapplication/pdfhttps://tede2.pucrs.br/tede2/handle/tede/10483porinfo:eu-repo/semantics/openAccessreponame:Biblioteca Digital de Teses e Dissertações da PUC_RSinstname:Pontifícia Universidade Católica do Rio Grande do Sul (PUCRS)instacron:PUC_RS2022-09-22T15:00:29Zoai:tede2.pucrs.br:tede/10483Biblioteca Digital de Teses e Dissertaçõeshttp://tede2.pucrs.br/tede2/PRIhttps://tede2.pucrs.br/oai/requestbiblioteca.central@pucrs.br||opendoar:2022-09-22T15:00:29Biblioteca Digital de Teses e Dissertações da PUC_RS - Pontifícia Universidade Católica do Rio Grande do Sul (PUCRS)false
dc.title.none.fl_str_mv Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
title Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
spellingShingle Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
Cunha, Holisson Soares da
Análise de Sentimento
Mineração em Fluxo Contínuo de Dados
Aprendizado de Máquina
Espaço Dinâmico de Atributos
Comitê de Classificadores
Sentiment Analysis
Data Stream Mining
Machine Learning
Dynamic Feature Space
Concept Drift
Feature Drift
Ensemble Classifiers
CIENCIA DA COMPUTACAO::TEORIA DA COMPUTACAO
title_short Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
title_full Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
title_fullStr Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
title_full_unstemmed Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
title_sort Sentimentstream : um comitê de classificadores adaptativo para análise de sentimento de tweets
author Cunha, Holisson Soares da
author_facet Cunha, Holisson Soares da
author_role author
dc.contributor.none.fl_str_mv Ruiz, Duncan Dubugras Alcoba
http://lattes.cnpq.br/8250832800932125
dc.contributor.author.fl_str_mv Cunha, Holisson Soares da
dc.subject.por.fl_str_mv Análise de Sentimento
Mineração em Fluxo Contínuo de Dados
Aprendizado de Máquina
Espaço Dinâmico de Atributos
Comitê de Classificadores
Sentiment Analysis
Data Stream Mining
Machine Learning
Dynamic Feature Space
Concept Drift
Feature Drift
Ensemble Classifiers
CIENCIA DA COMPUTACAO::TEORIA DA COMPUTACAO
topic Análise de Sentimento
Mineração em Fluxo Contínuo de Dados
Aprendizado de Máquina
Espaço Dinâmico de Atributos
Comitê de Classificadores
Sentiment Analysis
Data Stream Mining
Machine Learning
Dynamic Feature Space
Concept Drift
Feature Drift
Ensemble Classifiers
CIENCIA DA COMPUTACAO::TEORIA DA COMPUTACAO
description Diariamente, milhões de usuários utilizam o Twitter para compartilhar mensagens, fornecendo um enorme volume de conteúdo opinativo sobre diversos tópicos de interesse da sociedade. Além da quantidade de mensagens, o Twitter caracteriza-se como uma rede social de Fluxo Contínuo de Dados, que gera novas mensagens em tempo real, em alta velocidade e com distribuição não estacionária. Devido a essas características, pesquisas recentes em Análise de Sentimento têm explorado o Twitter em tarefas de classificação online, considerando restrições de tempo, memória e a necessidade de adaptação às mudanças que podem ocorrer na distribuição dos dados. Chamado de Concept Drift, esse fenômeno ocorre em decorrência de potenciais mudanças na distribuição que gera novos dados dentro do fluxo, afetando diretamente a capacidade de generalização do algoritmo. Além disso, a Análise de Sentimento introduz um tipo especial de mudança, chamada de Feature Drift. Trata-se de um problema onde novos atributos relevantes são encontrados ao longo do fluxo e atributos conhecidos se tornam irrelevantes, o que sugere o uso de um espaço dimensional dinâmico. Com base nesses desafios, neste trabalho é proposto SENTIMENTSTREAM, um comitê de classificadores dinâmico, baseado em lotes de dados, e que incrementalmente processa e avalia novas instâncias ao longo do fluxo. Especializado na classificação de tweets, SENTIMENTSTREAM é composto por dois componentes principais: (i) Um detector de concept drift, capaz de detectar e reagir de forma eficiente a mudanças abruptas na distribuição dos dados e, (ii) um detector de feature drift, que utiliza uma estratégia automática para monitorar e identificar potenciais mudanças no espaço de atributos. Experimentos com dados reais do Twitter indicam que SENTIMENTSTREAM apresenta resultados efetivos, sendo eficaz no processo de classificação de tweets e no tratamento de mudanças abruptas na distribuição dos dados.
publishDate 2016
dc.date.none.fl_str_mv 2016-04-30
2022-09-22T14:51:40Z
dc.type.status.fl_str_mv info:eu-repo/semantics/publishedVersion
dc.type.driver.fl_str_mv info:eu-repo/semantics/masterThesis
format masterThesis
status_str publishedVersion
dc.identifier.uri.fl_str_mv https://tede2.pucrs.br/tede2/handle/tede/10483
url https://tede2.pucrs.br/tede2/handle/tede/10483
dc.language.iso.fl_str_mv por
language por
dc.rights.driver.fl_str_mv info:eu-repo/semantics/openAccess
eu_rights_str_mv openAccess
dc.format.none.fl_str_mv application/pdf
dc.publisher.none.fl_str_mv Pontifícia Universidade Católica do Rio Grande do Sul
Escola Politécnica
Brasil
PUCRS
Programa de Pós-Graduação em Ciência da Computação
publisher.none.fl_str_mv Pontifícia Universidade Católica do Rio Grande do Sul
Escola Politécnica
Brasil
PUCRS
Programa de Pós-Graduação em Ciência da Computação
dc.source.none.fl_str_mv reponame:Biblioteca Digital de Teses e Dissertações da PUC_RS
instname:Pontifícia Universidade Católica do Rio Grande do Sul (PUCRS)
instacron:PUC_RS
instname_str Pontifícia Universidade Católica do Rio Grande do Sul (PUCRS)
instacron_str PUC_RS
institution PUC_RS
reponame_str Biblioteca Digital de Teses e Dissertações da PUC_RS
collection Biblioteca Digital de Teses e Dissertações da PUC_RS
repository.name.fl_str_mv Biblioteca Digital de Teses e Dissertações da PUC_RS - Pontifícia Universidade Católica do Rio Grande do Sul (PUCRS)
repository.mail.fl_str_mv biblioteca.central@pucrs.br||
_version_ 1850041310540464128