Processamento de Linguagem Natural e Machine Learning na categorização de notícias
DOI:
https://doi.org/10.29352/mill0223e.47447Palavras-chave:
processamento de linguagem natural; machine learning; classificação de texto; categorização de notícias; BERT; inteligência artificialResumo
Introdução: O rápido aumento de conteúdos digitais, especialmente na área de notícias, tornou mais difícil organizar e analisar grandes volumes de informação não estruturada. A classificação automática de textos é uma solução importante, apoiada pelos avanços em Processamento de Linguagem Natural e Machine Learning, que tornam a categorização de notícias mais eficiente e precisa.
Objetivo: Desenvolver e avaliar métodos de categorização automática de notícias em português que combinem bom desempenho com eficiência computacional, comparando técnicas tradicionais a modelos avançados de aprendizagem profunda.
Métodos: Realizou-se uma investigação experimental, com base em revisão da literatura, análise exploratória de dados e na implementação de diferentes modelos de classificação. Foram comparadas abordagens clássicas de Machine Learning e de Mineração de Texto com modelos recentes de Processamento de Linguagem Natural, incluindo arquiteturas baseadas em Transformers, como o BERT. A avaliação foi efetuada com base em métricas de desempenho (Accuracy, Precision, Recall, F1-Score) e no custo computacional.
Resultados: Os modelos baseados em Transformers demonstraram maior capacidade de compreensão contextual e desempenho superior na classificação de notícias. No entanto, apresentam requisitos computacionais mais elevados. Em contrapartida, modelos mais leves evidenciam um melhor equilíbrio entre eficiência e precisão, revelando-se adequados para cenários com recursos computacionais limitados.
Conclusão: Soluções eficazes para a categorização automática de notícias em português podem equilibrar desempenho e eficiência computacional. O estudo ressalta a importância de selecionar o modelo adequado ao contexto, o que favorece o desenvolvimento de sistemas de classificação mais robustos e acessíveis.
Downloads
Referências
Aggarwal, C. C. (2018). Machine learning for text. Springer International Publishing. https://doi.org/10.1007/978-3-319-73531-3
Chitty-Venkata, K. T., Emani, M., Vishwanath, V., & Somani, A. K. (2022). Neural architecture search for transformers: A survey. IEEE access, 10, 108374-108412. https://doi.org/10.1109/ACCESS.2022.3212767
Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL-HLT) (pp. 4171–4186). https://doi.org/10.18653/v1/N19-1423
Gupta, R., Shenoy, S. & Mahajan, S. (2024) Analysis and comparison of dimensionality reduction techniques for news blog classification. In 2024 International Conference on Innovative Computing, Intelligent Communication and Smart Electrical Systems (ICSES). IEEE. https://doi.org/10.1109/ICSES63760.2024.10910686
Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735
Jurafsky, D., & Martin, J. H. (2026). Speech and Language Processing: An introduction to natural language processing, computational linguistics, and speech recognition with language models, (3rd ed.). Online manuscript. https://web.stanford.edu/~jurafsky/slp3
Lauriola, I., Lavelli, A., & Aiolli, F. (2022). An introduction to deep learning in natural language processing: Models, techniques, and tools. Neurocomputing, 470, 443-456. https://doi.org/10.1016/j.neucom.2021.05.103
Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to information retrieval. Cambridge University Press. https://doi.org/10.1017/CBO9780511809071
Rezaeenour, J., Ahmadi, M., Jelodar, H., & Shahrooei, R. (2023). Systematic review of content analysis algorithms based on deep neural networks. Multimedia Tools and Applications, 82(12), 17879-17903. https://doi.org/10.1007/s11042-022-14043-z
Sanh, V., Debut, L., Chaumond, J., & Wolf, T. (2020). DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. https://doi.org/10.48550/arXiv.1910.01108
Sarikaya, R., et al. (2024). Deep learning architectures for NLP applications. ACM Computing Surveys, 56(2), 1–34. https://doi.org/10.13140/RG.2.2.18207.83368
Sokolova, M., & Lapalme, G. (2009). A systematic analysis of performance measures for classification tasks. Information Processing & Management, 45(4), 427–437. https://doi.org/10.1016/j.ipm.2009.03.002
Sun, G., Cheng, Y., Zhang, Z., Tong, X., & Chai, T. (2024). Text classification with improved word embedding and adaptive segmentation. Expert Systems with Applications, 238, 121852. https://doi.org/10.1016/j.eswa.2023.121852
Taha, K., Yoo, P. D., Yeun, C., Homouz, D., & Taha, A. (2024). A comprehensive survey of text classification techniques and their research applications: Observational and experimental insights. Computer Science Review, 54, 100664. https://doi.org/10.1016/j.cosrev.2024.100664
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. In Advances in Neural Information Processing Systems (NeurIPS), 30.
https://doi.org/10.48550/arXiv.1706.03762
Zhang, Y., & Wallace, B. (2017). A sensitivity analysis of (and practitioners’ guide to) convolutional neural networks for sentence classification. arXiv. https://doi.org/10.48550/arXiv.1510.03820
Downloads
Publicado
Como Citar
Edição
Secção
Licença
Direitos de Autor (c) 2026 Millenium - Journal of Education, Technologies, and Health

Este trabalho encontra-se publicado com a Licença Internacional Creative Commons Atribuição 4.0.
Os autores que submetem propostas para esta revista concordam com os seguintes termos:
a) Os artigos são publicados segundo a licença Licença Creative Commons (CC BY 4.0), conformando regime open-access, sem qualquer custo para o autor ou para o leitor;
b) Os autores conservam os direitos de autor e concedem à revista o direito de primeira publicação, permitindo-se a partilha livre do trabalho, desde que seja corretamente atribuída a autoria e publicação inicial nesta revista.
c) Os autores têm autorização para assumir contratos adicionais separadamente, para distribuição não-exclusiva da versão do trabalho publicada nesta revista (ex.: publicar em repositório institucional ou como capítulo de livro), com reconhecimento de autoria e publicação inicial nesta revista.
d) Os autores têm permissão e são estimulados a publicar e distribuir o seu trabalho online (ex.: em repositórios institucionais ou na sua página pessoal) já que isso pode gerar alterações produtivas, bem como aumentar o impacto e a citação do trabalho publica
Documentos necessários à submissão
Template do artigo (formato editável)











