Procesamiento del Lenguaje Natural y Aprendizaje Automático en la categorización de noticias
DOI:
https://doi.org/10.29352/mill0223e.47447Palabras clave:
procesamiento del lenguaje natural; aprendizaje automático; clasificación de texto; categorización de notícias; BERT; inteligencia artificialResumen
Introducción: El rápido aumento del contenido digital, especialmente en el ámbito informativo, ha dificultado la organización y el análisis de grandes volúmenes de información no estructurada. La clasificación automática de texto es una solución importante, respaldada por los avances en el procesamiento del lenguaje natural y el aprendizaje automático, que hacen que la categorización de notícias sea más eficiente y precisa.
Objetivo: Desarrollar y evaluar métodos de categorización automática de noticias en portugués que combinen un buen rendimiento con eficiencia computacional, comparando técnicas tradicionales con modelos avanzados de aprendizaje profundo.
Métodos: Se llevó a cabo una investigación experimental basada en la revisión de la literatura, el análisis exploratorio de datos y la implementación de diferentes modelos de clasificación. Se compararon enfoques clásicos de aprendizaje automático y minería de texto con modelos recientes de procesamiento del lenguaje natural, incluyendo arquitecturas basadas en Transformer como BERT. La evaluación se realizó en función de métricas de rendimiento (precisión, exactitud, exhaustividad, puntuación F1) y coste computacional.
Resultados: Los modelos basados en Transformer demostraron una mayor comprensión contextual y un rendimiento superior en la clasificación de noticias. Sin embargo, presentan mayores requisitos computacionales. En contraste, los modelos más ligeros muestran un mejor equilibrio entre eficiencia y precisión, demostrando ser adecuados para escenarios con recursos computacionales limitados.
Conclusión: Las soluciones eficaces para la categorización automática de notícias en portugués logran un equilibrio entre rendimiento y eficiencia computacional. El estudio subraya la importancia de seleccionar el modelo adecuado para cada contexto, lo que favorece el desarrollo de sistemas de clasificación más robustos y accesibles.
Descargas
Citas
Aggarwal, C. C. (2018). Machine learning for text. Springer International Publishing. https://doi.org/10.1007/978-3-319-73531-3
Chitty-Venkata, K. T., Emani, M., Vishwanath, V., & Somani, A. K. (2022). Neural architecture search for transformers: A survey. IEEE access, 10, 108374-108412. https://doi.org/10.1109/ACCESS.2022.3212767
Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of deep bidirectional transformers for language understanding. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL-HLT) (pp. 4171–4186). https://doi.org/10.18653/v1/N19-1423
Gupta, R., Shenoy, S. & Mahajan, S. (2024) Analysis and comparison of dimensionality reduction techniques for news blog classification. In 2024 International Conference on Innovative Computing, Intelligent Communication and Smart Electrical Systems (ICSES). IEEE. https://doi.org/10.1109/ICSES63760.2024.10910686
Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735
Jurafsky, D., & Martin, J. H. (2026). Speech and Language Processing: An introduction to natural language processing, computational linguistics, and speech recognition with language models, (3rd ed.). Online manuscript. https://web.stanford.edu/~jurafsky/slp3
Lauriola, I., Lavelli, A., & Aiolli, F. (2022). An introduction to deep learning in natural language processing: Models, techniques, and tools. Neurocomputing, 470, 443-456. https://doi.org/10.1016/j.neucom.2021.05.103
Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to information retrieval. Cambridge University Press. https://doi.org/10.1017/CBO9780511809071
Rezaeenour, J., Ahmadi, M., Jelodar, H., & Shahrooei, R. (2023). Systematic review of content analysis algorithms based on deep neural networks. Multimedia Tools and Applications, 82(12), 17879-17903. https://doi.org/10.1007/s11042-022-14043-z
Sanh, V., Debut, L., Chaumond, J., & Wolf, T. (2020). DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. https://doi.org/10.48550/arXiv.1910.01108
Sarikaya, R., et al. (2024). Deep learning architectures for NLP applications. ACM Computing Surveys, 56(2), 1–34. https://doi.org/10.13140/RG.2.2.18207.83368
Sokolova, M., & Lapalme, G. (2009). A systematic analysis of performance measures for classification tasks. Information Processing & Management, 45(4), 427–437. https://doi.org/10.1016/j.ipm.2009.03.002
Sun, G., Cheng, Y., Zhang, Z., Tong, X., & Chai, T. (2024). Text classification with improved word embedding and adaptive segmentation. Expert Systems with Applications, 238, 121852. https://doi.org/10.1016/j.eswa.2023.121852
Taha, K., Yoo, P. D., Yeun, C., Homouz, D., & Taha, A. (2024). A comprehensive survey of text classification techniques and their research applications: Observational and experimental insights. Computer Science Review, 54, 100664. https://doi.org/10.1016/j.cosrev.2024.100664
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. In Advances in Neural Information Processing Systems (NeurIPS), 30.
https://doi.org/10.48550/arXiv.1706.03762
Zhang, Y., & Wallace, B. (2017). A sensitivity analysis of (and practitioners’ guide to) convolutional neural networks for sentence classification. arXiv. https://doi.org/10.48550/arXiv.1510.03820
Descargas
Publicado
Cómo citar
Número
Sección
Licencia
Derechos de autor 2026 Millenium - Journal of Education, Technologies, and Health

Esta obra está bajo una licencia internacional Creative Commons Atribución 4.0.
Los autores que sometan propuestas para esta revista estarán de acuerdo con los siguientes términos:
a) Los artículos serán publicados según la licencia Licença Creative Commons (CC BY 4.0), conforme el régimen open-access, sin cualquier coste para el autor o para el lector.
b) Los autores conservan los derechos de autor y conceden a la revista el derecho de la primera publicación, se permite la divulgación libre del trabajo, desde que sea correctamente atribuida la autoría y la publicación inicial en esta revista.
c) Los autores están autorización para firmar contratos adicionales separadamente, para la distribución no exclusiva de la versión del trabajo publicada en esta revista (ej.: publicar en un repositorio institucional o como capítulo de un libro), con reconocimiento de la autoría y publicación inicial e esta revista.
d) Los autores tienen permiso y son alentados a publicar y distribuir su trabajo on-line (ej.: en repositorios instituciones o en su página personal) ya que eso podrá generar alteraciones productivas, así como aumentar el impacto y la citación del trabajo publicado.
Documentos necesarios para la sumisión
Plantilla del artículo (formato editable)












