Logotipo do repositório

Procedimentos multivariados para identificação de outliers e imputação de dados faltantes em séries temporais meteorológicas

dc.contributor.advisorRodrigues, Sergio Augusto [UNESP]
dc.contributor.authorCremasco, Caroline Pires [UNESP]
dc.contributor.committeeMemberRodrigues, Sergio Augusto [UNESP]
dc.contributor.committeeMemberSilva, Maurício Bruno Prado da
dc.contributor.committeeMemberDias. Teresa Cristina Martins
dc.contributor.committeeMemberSarnighausen, Valéria Cristina Rodrigues [UNESP]
dc.contributor.committeeMemberDal Pai, Alexandre [UNESP]
dc.contributor.institutionUniversidade Estadual Paulista (UNESP)pt
dc.date.accessioned2026-07-24T13:07:52Z
dc.date.issued2025-05-30
dc.description.abstractA qualidade dos dados meteorológicos é fundamental para análises agrometeorológicas confiáveis. Séries temporais frequentemente apresentam falhas de medição (missings) e distorções causadas por valores atípicos (outliers), que comprometem a precisão das estimativas e, consequentemente, a confiabilidade das decisões baseadas nesses dados. O presente trabalho propõe uma abordagem multivariada para a avaliação e comparação de métodos de imputação de missings e detecção de outliers, considerando a estrutura temporal dos dados. No Capítulo 1, são avaliadas sete técnicas de imputação para séries temporais multivariadas: média simples, Análise de Componentes Principais (PCA), Floresta Aleatória, K-Nearest Neighbors (KNN), Imputação Iterativa Dependente do Tempo (TDI), Redes Neurais Recorrentes (RNN) e SAITS. Os métodos são avaliados por MAE, MSE, RMSE, correlação de Pearson e tempo de processamento em diferentes níveis de ausência (5%–35%). O método Floresta Aleatória apresenta os menores erros e maior robustez à elevação do missing, embora com maior custo computacional. O TDI mantém desempenho elevado e menor custo de processamento, configurando o melhor compromisso entre precisão e eficiência. PCA e KNN apresentam desempenho intermediário quando o missing é baixo, mas perdem acurácia à medida que a ausência cresce, especialmente em variáveis com maior variabilidade. RNN e SAITS atingem precisão intermediária, porém com custo computacional mais alto. A média simples apresenta o pior desempenho, por não capturar a variabilidade dos dados. No Capítulo 2, são testados modelos multivariados de detecção de outliers, como PCA Tradicional e suas variações (RPCA, MWPCA), Isolation Forest e modelos baseados em LSTM. As abordagens são validadas com métricas voltadas a dados desbalanceados, como G-Mean, Kappa, F1-Score e MCC. Os métodos RPCA e LSTM se destacam por apresentar desempenho superior na detecção de pontos atípicos, mesmo em conjuntos de dados altamente desbalanceados.pt
dc.identifier.capes33004064038P7
dc.identifier.citationCREMASCO, Caroline Pires. Procedimentos multivariados para identificação de outliers e imputação de dados faltantes em séries temporais meteorológicas. 2025. Tese (Doutorado em Engenharia Agrícola) - Faculdade de Ciências Agronômicas, Universidade Estadual Paulista (UNESP), Botucatu, 2025.
dc.identifier.latteshttp://lattes.cnpq.br/5339144730881561
dc.identifier.orcidhttps://orcid.org/0009-0001-3030-211X
dc.identifier.urihttps://hdl.handle.net/11449/328585
dc.language.isopor
dc.publisherUniversidade Estadual Paulista (UNESP)pt
dc.rights.accessRightsAcesso restritopt
dc.subjectAnálise multivariadapt
dc.subjectAusência de dadopt
dc.subjectValores atípicospt
dc.subjectSéries temporaispt
dc.subjectInstrumentos meteorológicospt
dc.titleProcedimentos multivariados para identificação de outliers e imputação de dados faltantes em séries temporais meteorológicaspt
dc.title.alternativeMultivariate procedures for outlier identification and missing data imputation in meteorological time seriesen
dc.typeTese de doutoradopt
dcterms.impactEsta pesquisa contribui para o aprimoramento da qualidade de dados meteorológicos utilizados em estudos agrometeorológicos, ambientais e agrícolas. Ao comparar métodos multivariados para imputação de dados faltantes e detecção de outliers em séries temporais, o trabalho oferece subsídios para tornar as bases de dados mais confiáveis e reduzir erros em análises, estimativas e tomadas de decisão. Os resultados podem apoiar o uso mais seguro de informações meteorológicas em pesquisas científicas, monitoramento climático, planejamento agrícola e desenvolvimento de sistemas computacionais aplicados à Engenharia Agrícola.pt
dcterms.impactThe quality of meteorological data is essential for reliable agrometeorological analyses. Time series often present measurement gaps (missings) and distortions caused by outliers, which compromise the accuracy of estimates and, consequently, the reliability of data-driven decisions. This work proposes a multivariate approach for the evaluation and comparison of missing-data imputation methods and outlier detection techniques, considering the temporal structure of the data. In Chapter 1, seven imputation techniques for multivariate time series are evaluated, including Principal Component Analysis (PCA), Random Forest, K-Nearest Neighbors (KNN), Iterative Time-Dependent Imputation (TDI), Recurrent Neural Networks (RNN), and SAITS. These methods are assessed using MAE, MSE, RMSE, Pearson correlation, and processing time under different levels of missingness (5%–35%). TDI maintains high performance with lower computational cost, making it the best accuracy–efficiency trade-off, while Random Forest shows the lowest errors and greater robustness to higher missingness, though at a higher computational cost. PCA and KNN achieve intermediate results when missingness is low but lose accuracy as missing values increase, especially in variables with higher variability. RNN and SAITS reach intermediate accuracy, but with higher computational cost. Simple mean imputation shows the worst performance, as it fails to capture data variability. In Chapter 2, multivariate models for outlier detection are tested, such as Traditional PCA and its variations (RPCA, MWPCA), Isolation Forest, and LSTM-based models. These approaches are validated using metrics designed for imbalanced data, such as G-Mean and Kappa. RPCA and LSTM stand out by achieving superior performance in detecting outliers, even in highly imbalanced datasets.en
dspace.entity.typePublication
relation.isAuthorOfPublicatione3b0e39a-3786-406e-96e1-8a3c99fda296
relation.isAuthorOfPublication.latestForDiscoverye3b0e39a-3786-406e-96e1-8a3c99fda296
relation.isGradProgramOfPublicationd1489898-05da-4e40-a1ca-988e75d5a727
relation.isGradProgramOfPublication.latestForDiscoveryd1489898-05da-4e40-a1ca-988e75d5a727
relation.isOrgUnitOfPublicationef1a6328-7152-4981-9835-5e79155d5511
relation.isOrgUnitOfPublication.latestForDiscoveryef1a6328-7152-4981-9835-5e79155d5511
unesp.campusUniversidade Estadual Paulista (UNESP), Faculdade de Ciências Agronômicas, Botucatupt
unesp.embargo24 mesespt
unesp.examinationboard.typeBanca públicapt
unesp.graduateProgramEngenharia Agrícola - FCApt
unesp.knowledgeAreaOutrapt
unesp.researchAreaEngenharia Agrícola de Precisãopt

Arquivos

Pacote original

Agora exibindo 1 - 2 de 2
Carregando...
Imagem de Miniatura
Nome:
cremasco_cp_dr_botfca_par.pdf
Tamanho:
523,13 KB
Formato:
Adobe Portable Document Format
Carregando...
Imagem de Miniatura
Nome:
cremasco_cp_dr_botfca_int.pdf
Tamanho:
9,17 MB
Formato:
Adobe Portable Document Format