Processamento de Linguagem Natural e Machine Learning na categorização de notícias

Autores

  • José Varanda Instituto Politécnico de Viseu, Viseu, Portugal
  • Cristina Lacerda Instituto Politécnico de Viseu, Viseu, Portugal | CISeD - Centro de Investigação em Serviços Digitais, Viseu, Portugal https://orcid.org/0000-0002-8921-4747
  • Joana Fialho Instituto Politécnico de Viseu, Viseu, Portugal | CI&DEI – Centro de Estudos em Educação e Inovação, Viseu, Portugal https://orcid.org/0000-0002-3910-8292

DOI:

https://doi.org/10.29352/mill0223e.47447

Palavras-chave:

processamento de linguagem natural; machine learning; classificação de texto; categorização de notícias; BERT; inteligência artificial

Resumo

Introdução: O rápido aumento de conteúdos digitais, especialmente na área de notícias, tornou mais difícil organizar e analisar grandes volumes de informação não estruturada. A classificação automática de textos é uma solução importante, apoiada pelos avanços em Processamento de Linguagem Natural e Machine Learning, que tornam a categorização de notícias mais eficiente e precisa.

Objetivo: Desenvolver e avaliar métodos de categorização automática de notícias em português que combinem bom desempenho com eficiência computacional, comparando técnicas tradicionais a modelos avançados de aprendizagem profunda.

Métodos: Realizou-se uma investigação experimental, com base em revisão da literatura, análise exploratória de dados e na implementação de diferentes modelos de classificação. Foram comparadas abordagens clássicas de Machine Learning e de Mineração de Texto com modelos recentes de Processamento de Linguagem Natural, incluindo arquiteturas baseadas em Transformers, como o BERT. A avaliação foi efetuada com base em métricas de desempenho (Accuracy, Precision, Recall, F1-Score) e no custo computacional.

Resultados: Os modelos baseados em Transformers demonstraram maior capacidade de compreensão contextual e desempenho superior na classificação de notícias. No entanto, apresentam requisitos computacionais mais elevados. Em contrapartida, modelos mais leves evidenciam um melhor equilíbrio entre eficiência e precisão, revelando-se adequados para cenários com recursos computacionais limitados.

Conclusão: Soluções eficazes para a categorização automática de notícias em português podem equilibrar desempenho e eficiência computacional. O estudo ressalta a importância de selecionar o modelo adequado ao contexto, o que favorece o desenvolvimento de sistemas de classificação mais robustos e acessíveis.

Downloads

Não há dados estatísticos.

Referências

Aggarwal, C. C. (2018). Machine learning for text. Springer International Publishing. https://doi.org/10.1007/978-3-319-73531-3

Chitty-Venkata, K. T., Emani, M., Vishwanath, V., & Somani, A. K. (2022). Neural architecture search for transformers: A survey. IEEE access, 10, 108374-108412. https://doi.org/10.1109/ACCESS.2022.3212767

Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL-HLT) (pp. 4171–4186). https://doi.org/10.18653/v1/N19-1423

Gupta, R., Shenoy, S. & Mahajan, S. (2024) Analysis and comparison of dimensionality reduction techniques for news blog classification. In 2024 International Conference on Innovative Computing, Intelligent Communication and Smart Electrical Systems (ICSES). IEEE. https://doi.org/10.1109/ICSES63760.2024.10910686

Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735

Jurafsky, D., & Martin, J. H. (2026). Speech and Language Processing: An introduction to natural language processing, computational linguistics, and speech recognition with language models, (3rd ed.). Online manuscript. https://web.stanford.edu/~jurafsky/slp3

Lauriola, I., Lavelli, A., & Aiolli, F. (2022). An introduction to deep learning in natural language processing: Models, techniques, and tools. Neurocomputing, 470, 443-456. https://doi.org/10.1016/j.neucom.2021.05.103

Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to information retrieval. Cambridge University Press. https://doi.org/10.1017/CBO9780511809071

Rezaeenour, J., Ahmadi, M., Jelodar, H., & Shahrooei, R. (2023). Systematic review of content analysis algorithms based on deep neural networks. Multimedia Tools and Applications, 82(12), 17879-17903. https://doi.org/10.1007/s11042-022-14043-z

Sanh, V., Debut, L., Chaumond, J., & Wolf, T. (2020). DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. https://doi.org/10.48550/arXiv.1910.01108

Sarikaya, R., et al. (2024). Deep learning architectures for NLP applications. ACM Computing Surveys, 56(2), 1–34. https://doi.org/10.13140/RG.2.2.18207.83368

Sokolova, M., & Lapalme, G. (2009). A systematic analysis of performance measures for classification tasks. Information Processing & Management, 45(4), 427–437. https://doi.org/10.1016/j.ipm.2009.03.002

Sun, G., Cheng, Y., Zhang, Z., Tong, X., & Chai, T. (2024). Text classification with improved word embedding and adaptive segmentation. Expert Systems with Applications, 238, 121852. https://doi.org/10.1016/j.eswa.2023.121852

Taha, K., Yoo, P. D., Yeun, C., Homouz, D., & Taha, A. (2024). A comprehensive survey of text classification techniques and their research applications: Observational and experimental insights. Computer Science Review, 54, 100664. https://doi.org/10.1016/j.cosrev.2024.100664

Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. In Advances in Neural Information Processing Systems (NeurIPS), 30.

https://doi.org/10.48550/arXiv.1706.03762

Zhang, Y., & Wallace, B. (2017). A sensitivity analysis of (and practitioners’ guide to) convolutional neural networks for sentence classification. arXiv. https://doi.org/10.48550/arXiv.1510.03820

Downloads

Publicado

2026-07-23

Como Citar

Varanda, J., Lacerda, C., & Fialho, J. (2026). Processamento de Linguagem Natural e Machine Learning na categorização de notícias. Millenium - Journal of Education, Technologies, and Health, 2(23e), e47447. https://doi.org/10.29352/mill0223e.47447

Edição

Secção

Engenharias, tecnologia, gestão e turismo