Predição do índice de qualidade da água (IQA) na região metropolitana do Vale do Paraíba e litoral norte por meio de técnicas de aprendizagem de máquina.
Carregando...
Data
Autores
Coorientador
Pós-graduação
Engenharia - FEG
Curso de graduação
Título da Revista
ISSN da Revista
Título de Volume
Editor
Universidade Estadual Paulista (UNESP)
Tipo
Dissertação de mestrado
Direito de acesso
Acesso aberto

Resumo
Resumo (português)
A preservação e o monitoramento da qualidade dos recursos hídricos representam desafios fundamentais para o desenvolvimento sustentável, alinhando-se diretamente às metas estabelecidas pelo Objetivo de Desenvolvimento Sustentável nº 6 da Organização das Nações Unidas. Diante da complexidade dos ecossistemas aquáticos e da frequente dificuldade na obtenção de dados completos, o que muitas vezes inviabiliza o cálculo tradicional do índice, este trabalho investiga a aplicação de técnicas de Aprendizagem de Máquina para a predição do Índice de Qualidade da Água (IQA) na Região Metropolitana do Vale do Paraíba e Litoral Norte (RMVALE-LN). A pesquisa utiliza uma base de dados robusta, compreendendo o período de 2013 a 2023, com informações provenientes da CETESB e do sistema InfoÁgua, processadas integralmente em linguagem R. O foco metodológico reside na utilização do algoritmo de Floresta Aleatória (Random Forest) para superar a limitação de dados incompletos, comparando duas abordagens distintas: a predição direta do valor final do IQA e, diferentemente das abordagens convencionais, a predição individual dos parâmetros físico-químicos e biológicos do índice para sua posterior reconstrução matemática. Os resultados obtidos demonstram que a abordagem de predição dos parâmetros individuais para o posterior cálculo do IQA apresenta um desempenho superior e mais consistente do que a tentativa de prever o índice de forma direta, mostrando-se uma estratégia eficaz para lidar com lacunas de monitoramento. A eficácia dos modelos foi validada por meio de métricas para tarefas de regressão, com destaque para o Erro Percentual Absoluto Médio (MAPE), que em diversos cenários manteve-se abaixo de 10%, conferindo às previsões o status de "altamente precisas'' conforme a literatura especializada. Além da precisão estatística, o estudo revela uma importante capacidade de generalização dos modelos, sugerindo que padrões identificados em determinados pontos de monitoramento podem ser aplicados a áreas correlatas, dispensando assim a necessidade de criação de modelos individualizados para cada localidade específica. Essa capacidade preditiva não apenas soluciona o problema de dados ausentes, mas também fundamentam a viabilidade da redução de parâmetros medidos em campo, permitindo um monitoramento mais ágil e de menor custo, sem perda de confiabilidade técnica.
Resumo (inglês)
The preservation and monitoring of water resource quality represent fundamental challenges for sustainable development, aligning directly with the goals established by the United Nations Sustainable Development Goal 6. Given the complexity of aquatic ecosystems and the frequent difficulty in obtaining complete data—which often prevents the traditional calculation of the index—this study investigates the application of Machine Learning techniques to predict the Water Quality Index (WQI) in the Metropolitan Region of Vale do Paraíba and Litoral Norte (RMVALE-LN). The research utilizes a robust database covering the period from 2013 to 2023, with data from CETESB and the InfoÁgua system, fully processed using the R language. The methodological focus lies in using the Random Forest algorithm to overcome the limitation of incomplete data, comparing two distinct approaches: the direct prediction of the final WQI value and, unlike conventional approaches, the individual prediction of the index's physicochemical and biological parameters for its subsequent mathematical reconstruction. The results demonstrate that the approach of predicting individual parameters for the subsequent calculation of the WQI yields superior and more consistent performance compared to attempting to predict the index directly, proving to be an effective strategy for dealing with monitoring gaps. The effectiveness of the models was validated using regression metrics, with emphasis on the Mean Absolute Percentage Error (MAPE), which remained below 10% in several scenarios, granting the predictions a "highly accurate" status according to specialized literature. In addition to statistical accuracy, the study reveals a significant generalization capability of the models, suggesting that patterns identified at certain monitoring points can be applied to correlated areas, thereby eliminating the need to create individualized models for each specific location. This predictive capability not only solves the problem of missing data but also supports the feasibility of reducing parameters measured in the field, enabling faster and lower-cost monitoring without compromising technical reliability.
Descrição
Idioma
Português
Citação
JUNIOR, Wilson Santos. Predição do índice de qualidade da água (IQA) na região metropolitana do Vale do Paraíba e litoral norte por meio de técnicas de aprendizagem de máquina. Orientadora: Marcela Aparecida Guerreiro Machado de Freitas. 2026. 76f. Dissertação (Mestrado em Engenharia) - Faculdade de Engenharia e Ciências de Guaratinguetá, UNESP, Guaratinguetá, 2026.



