Procesamiento del Lenguaje Natural y Aprendizaje Automático en la categorización de noticias

Autores/as

  • José Varanda Instituto Politécnico de Viseu, Viseu, Portugal
  • Cristina Lacerda Instituto Politécnico de Viseu, Viseu, Portugal | CISeD - Centro de Investigação em Serviços Digitais, Viseu, Portugal https://orcid.org/0000-0002-8921-4747
  • Joana Fialho Instituto Politécnico de Viseu, Viseu, Portugal | CI&DEI – Centro de Estudos em Educação e Inovação, Viseu, Portugal https://orcid.org/0000-0002-3910-8292

DOI:

https://doi.org/10.29352/mill0223e.47447

Palabras clave:

procesamiento del lenguaje natural; aprendizaje automático; clasificación de texto; categorización de notícias; BERT; inteligencia artificial

Resumen

Introducción: El rápido aumento del contenido digital, especialmente en el ámbito informativo, ha dificultado la organización y el análisis de grandes volúmenes de información no estructurada. La clasificación automática de texto es una solución importante, respaldada por los avances en el procesamiento del lenguaje natural y el aprendizaje automático, que hacen que la categorización de notícias sea más eficiente y precisa.

Objetivo: Desarrollar y evaluar métodos de categorización automática de noticias en portugués que combinen un buen rendimiento con eficiencia computacional, comparando técnicas tradicionales con modelos avanzados de aprendizaje profundo.

Métodos: Se llevó a cabo una investigación experimental basada en la revisión de la literatura, el análisis exploratorio de datos y la implementación de diferentes modelos de clasificación. Se compararon enfoques clásicos de aprendizaje automático y minería de texto con modelos recientes de procesamiento del lenguaje natural, incluyendo arquitecturas basadas en Transformer como BERT. La evaluación se realizó en función de métricas de rendimiento (precisión, exactitud, exhaustividad, puntuación F1) y coste computacional.

Resultados: Los modelos basados ​​en Transformer demostraron una mayor comprensión contextual y un rendimiento superior en la clasificación de noticias. Sin embargo, presentan mayores requisitos computacionales. En contraste, los modelos más ligeros muestran un mejor equilibrio entre eficiencia y precisión, demostrando ser adecuados para escenarios con recursos computacionales limitados.

Conclusión: Las soluciones eficaces para la categorización automática de notícias en portugués logran un equilibrio entre rendimiento y eficiencia computacional. El estudio subraya la importancia de seleccionar el modelo adecuado para cada contexto, lo que favorece el desarrollo de sistemas de clasificación más robustos y accesibles.

Descargas

Los datos de descargas todavía no están disponibles.

Citas

Aggarwal, C. C. (2018). Machine learning for text. Springer International Publishing. https://doi.org/10.1007/978-3-319-73531-3

Chitty-Venkata, K. T., Emani, M., Vishwanath, V., & Somani, A. K. (2022). Neural architecture search for transformers: A survey. IEEE access, 10, 108374-108412. https://doi.org/10.1109/ACCESS.2022.3212767

Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL-HLT) (pp. 4171–4186). https://doi.org/10.18653/v1/N19-1423

Gupta, R., Shenoy, S. & Mahajan, S. (2024) Analysis and comparison of dimensionality reduction techniques for news blog classification. In 2024 International Conference on Innovative Computing, Intelligent Communication and Smart Electrical Systems (ICSES). IEEE. https://doi.org/10.1109/ICSES63760.2024.10910686

Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735

Jurafsky, D., & Martin, J. H. (2026). Speech and Language Processing: An introduction to natural language processing, computational linguistics, and speech recognition with language models, (3rd ed.). Online manuscript. https://web.stanford.edu/~jurafsky/slp3

Lauriola, I., Lavelli, A., & Aiolli, F. (2022). An introduction to deep learning in natural language processing: Models, techniques, and tools. Neurocomputing, 470, 443-456. https://doi.org/10.1016/j.neucom.2021.05.103

Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to information retrieval. Cambridge University Press. https://doi.org/10.1017/CBO9780511809071

Rezaeenour, J., Ahmadi, M., Jelodar, H., & Shahrooei, R. (2023). Systematic review of content analysis algorithms based on deep neural networks. Multimedia Tools and Applications, 82(12), 17879-17903. https://doi.org/10.1007/s11042-022-14043-z

Sanh, V., Debut, L., Chaumond, J., & Wolf, T. (2020). DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. https://doi.org/10.48550/arXiv.1910.01108

Sarikaya, R., et al. (2024). Deep learning architectures for NLP applications. ACM Computing Surveys, 56(2), 1–34. https://doi.org/10.13140/RG.2.2.18207.83368

Sokolova, M., & Lapalme, G. (2009). A systematic analysis of performance measures for classification tasks. Information Processing & Management, 45(4), 427–437. https://doi.org/10.1016/j.ipm.2009.03.002

Sun, G., Cheng, Y., Zhang, Z., Tong, X., & Chai, T. (2024). Text classification with improved word embedding and adaptive segmentation. Expert Systems with Applications, 238, 121852. https://doi.org/10.1016/j.eswa.2023.121852

Taha, K., Yoo, P. D., Yeun, C., Homouz, D., & Taha, A. (2024). A comprehensive survey of text classification techniques and their research applications: Observational and experimental insights. Computer Science Review, 54, 100664. https://doi.org/10.1016/j.cosrev.2024.100664

Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. In Advances in Neural Information Processing Systems (NeurIPS), 30.

https://doi.org/10.48550/arXiv.1706.03762

Zhang, Y., & Wallace, B. (2017). A sensitivity analysis of (and practitioners’ guide to) convolutional neural networks for sentence classification. arXiv. https://doi.org/10.48550/arXiv.1510.03820

Publicado

2026-07-23

Cómo citar

Varanda, J., Lacerda, C., & Fialho, J. (2026). Procesamiento del Lenguaje Natural y Aprendizaje Automático en la categorización de noticias. Millenium - Journal of Education, Technologies, and Health, 2(23e), e47447. https://doi.org/10.29352/mill0223e.47447

Número

Sección

Ingenierías, Tecnología, Gestión y Turismo