| Campo DC | Valor | Idioma |
| dc.contributor.advisor | Marotta, Marcelo Antonio | - |
| dc.contributor.author | Campos, Mayra de Moraes | - |
| dc.date.accessioned | 2026-09-29T16:50:26Z | - |
| dc.date.available | 2026-09-29T16:50:26Z | - |
| dc.date.issued | 2026-09-29 | - |
| dc.date.submitted | 2026-04-27 | - |
| dc.identifier.citation | CAMPOS, Mayra de Moraes. Classificação de textos de bases desbalanceadas aplicada às solicitações cidadãs. 2026. 82 f., il. Dissertação (Mestrado profissional em Computação Aplicada) — Universidade de Brasília, Brasília, 2026. | pt_BR |
| dc.identifier.uri | http://repositorio.unb.br/handle/10482/57026 | - |
| dc.description | Dissertação (mestrado) — Universidade de Brasília, Instituto de Ciências Exatas, Departamento de Ciência da Computação, Programa de Pós-Graduação em Computação Aplicada, 2026. | pt_BR |
| dc.description.abstract | Este estudo de caso investigou alternativas para automatizar a classificação binária de
textos com classes desbalanceadas no contexto do Participa DF, uma plataforma de par ticipação social do GDF. Esse canal digital tem como objetivo ampliar a participação
cidadã na gestão pública do Distrito Federal por meio de manifestações textuais. Esses
textos são enviados pelos cidadãos ao Participa DF e categorizados manualmente pelos
usuários entre dois sistemas: o e-SIC DF e o Ouv-DF. Diversas técnicas de PLN foram
aplicadas, como redução de dimensionalidade por PCA, métodos de redimensionamento
(como o NM), além de múltiplos algoritmos de AM, tais como BERTimbau, LR, SVM
e LGBM. A avaliação priorizou a capacidade de identificar a classe minoritária e-SIC
DF, cuja classificação correta é especialmente difícil. O desbalanceamento normalmente
compromete a eficácia de modelos tradicionais de AM. Entre os métodos analisados,
destaca-se o EFC, originalmente desenvolvido para detecção de anomalias em redes e
explorado neste trabalho pela primeira vez em tarefas de classificação textual. Esse al goritmo utiliza estatísticas inversas para treinar modelos. Os resultados mostram que o
EFC, quando treinado exclusivamente com exemplos da classe e-SIC DF e submetido a
um nível reduzido de pré-processamento, atinge alto Recall (94%), demonstrando forte
capacidade de reconhecer a classe minoritária. Entretanto, apresentou elevada taxa de
FDR, o que implicaria aumento significativo do retrabalho por parte dos servidores re sponsáveis pelo tratamento das manifestações e pela reclassificação. Em comparação com
o EFC, modelos clássicos e modelos baseados em transformers apresentaram desempenho
mais equilibrado entre Recall, F1-Score, AUC-ROC e Acurácia. Conclui-se que, apesar
de o EFC ser promissor para cenários de detecção de anomalias em conjuntos de dados
textuais desbalanceados, ele gera muitos falsos positivos. Para implantação no ambiente
de produção da plataforma Participa DF, o modelo treinado com o algoritmo SVM, com
redução de dimensionalidade via PCA e uso de textos sintéticos, mostrou-se a alternativa
tecnicamente mais viável. | pt_BR |
| dc.description.sponsorship | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) | pt_BR |
| dc.language.iso | por | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.title | Classificação de textos de bases desbalanceadas aplicada às solicitações cidadãs | pt_BR |
| dc.type | Dissertação | pt_BR |
| dc.subject.keyword | Classificação de texto | pt_BR |
| dc.subject.keyword | Serviço Público | pt_BR |
| dc.subject.keyword | Automatização | pt_BR |
| dc.rights.license | A concessão da licença deste item refere-se ao termo de autorização impresso assinado pelo autor com as seguintes condições: Na qualidade de titular dos direitos de autor da publicação, autorizo a Universidade de Brasília e o IBICT a disponibilizar por meio dos sites www.unb.br, www.ibict.br, www.ndltd.org sem ressarcimento dos direitos autorais, de acordo com a Lei nº 9610/98, o texto integral da obra supracitada, conforme permissões assinaladas, para fins de leitura, impressão e/ou download, a título de divulgação da produção científica brasileira, a partir desta data. | pt_BR |
| dc.description.abstract1 | This case study investigated alternatives for automating the binary classification of texts
with imbalanced classes in the context of Participa DF, a social participation platform of
the GDF. This digital channel aims to enhance citizen participation in the public adminis tration of the Federal District through textual submissions. These texts are submitted by
citizens to Participa DF and manually categorized by users into two systems: e-SIC DF
and Ouv-DF. Several NLP techniques were applied, including dimensionality reduction
via PCA, resampling methods (such as NM), as well as multiple ML algorithms, including
BERTimbau, LR, SVM, and LGBM. The evaluation prioritized the ability to identify the
minority class, e-SIC DF, whose correct classification is particularly challenging. Class
imbalance typically compromises the e!ectiveness of traditional ML models. Among the
methods analyzed, the EFC algorithm stands out. Originally developed for anomaly
detection in networks, it is explored in this work for the first time in textual classifica tion tasks. This algorithm employs inverse statistics to train models. The results show
that EFC, when trained exclusively on examples from the e-SIC DF class and subjected
to a reduced level of preprocessing, achieves high Recall (94%), demonstrating a strong
ability to recognize the minority class. However, it also exhibited a high FDR, which
would imply a significant increase in rework for public servants responsible for handling
and reclassifying the submissions. In comparison with EFC, classical models and trans former -based models exhibited a more balanced performance across Recall, F1-Score,
AUC-ROC, and Accuracy. It is concluded that, although EFC is promising for anomaly
detection scenarios in imbalanced textual datasets, it generates a large number of false
positives. For deployment in the production environment of the Participa DF platform,
the model trained using the SVM algorithm, combined with dimensionality reduction via
PCA and the use of synthetic texts, proved to be the most technically viable alternative. | pt_BR |
| dc.description.unidade | Instituto de Ciências Exatas (IE) | pt_BR |
| dc.description.unidade | Departamento de Ciência da Computação (IE CIC) | pt_BR |
| dc.description.ppg | Programa de Pós-Graduação em Computação Aplicada, Mestrado Profissional | pt_BR |
| Aparece nas coleções: | Teses, dissertações e produtos pós-doutorado
|