Procedimentos multivariados para identificação de outliers e imputação de dados faltantes em séries temporais meteorológicas
| dc.contributor.advisor | Rodrigues, Sergio Augusto [UNESP] | |
| dc.contributor.author | Cremasco, Caroline Pires [UNESP] | |
| dc.contributor.committeeMember | Rodrigues, Sergio Augusto [UNESP] | |
| dc.contributor.committeeMember | Silva, Maurício Bruno Prado da | |
| dc.contributor.committeeMember | Dias. Teresa Cristina Martins | |
| dc.contributor.committeeMember | Sarnighausen, Valéria Cristina Rodrigues [UNESP] | |
| dc.contributor.committeeMember | Dal Pai, Alexandre [UNESP] | |
| dc.contributor.institution | Universidade Estadual Paulista (UNESP) | pt |
| dc.date.accessioned | 2026-07-24T13:07:52Z | |
| dc.date.issued | 2025-05-30 | |
| dc.description.abstract | A qualidade dos dados meteorológicos é fundamental para análises agrometeorológicas confiáveis. Séries temporais frequentemente apresentam falhas de medição (missings) e distorções causadas por valores atípicos (outliers), que comprometem a precisão das estimativas e, consequentemente, a confiabilidade das decisões baseadas nesses dados. O presente trabalho propõe uma abordagem multivariada para a avaliação e comparação de métodos de imputação de missings e detecção de outliers, considerando a estrutura temporal dos dados. No Capítulo 1, são avaliadas sete técnicas de imputação para séries temporais multivariadas: média simples, Análise de Componentes Principais (PCA), Floresta Aleatória, K-Nearest Neighbors (KNN), Imputação Iterativa Dependente do Tempo (TDI), Redes Neurais Recorrentes (RNN) e SAITS. Os métodos são avaliados por MAE, MSE, RMSE, correlação de Pearson e tempo de processamento em diferentes níveis de ausência (5%–35%). O método Floresta Aleatória apresenta os menores erros e maior robustez à elevação do missing, embora com maior custo computacional. O TDI mantém desempenho elevado e menor custo de processamento, configurando o melhor compromisso entre precisão e eficiência. PCA e KNN apresentam desempenho intermediário quando o missing é baixo, mas perdem acurácia à medida que a ausência cresce, especialmente em variáveis com maior variabilidade. RNN e SAITS atingem precisão intermediária, porém com custo computacional mais alto. A média simples apresenta o pior desempenho, por não capturar a variabilidade dos dados. No Capítulo 2, são testados modelos multivariados de detecção de outliers, como PCA Tradicional e suas variações (RPCA, MWPCA), Isolation Forest e modelos baseados em LSTM. As abordagens são validadas com métricas voltadas a dados desbalanceados, como G-Mean, Kappa, F1-Score e MCC. Os métodos RPCA e LSTM se destacam por apresentar desempenho superior na detecção de pontos atípicos, mesmo em conjuntos de dados altamente desbalanceados. | pt |
| dc.identifier.capes | 33004064038P7 | |
| dc.identifier.citation | CREMASCO, Caroline Pires. Procedimentos multivariados para identificação de outliers e imputação de dados faltantes em séries temporais meteorológicas. 2025. Tese (Doutorado em Engenharia Agrícola) - Faculdade de Ciências Agronômicas, Universidade Estadual Paulista (UNESP), Botucatu, 2025. | |
| dc.identifier.lattes | http://lattes.cnpq.br/5339144730881561 | |
| dc.identifier.orcid | https://orcid.org/0009-0001-3030-211X | |
| dc.identifier.uri | https://hdl.handle.net/11449/328585 | |
| dc.language.iso | por | |
| dc.publisher | Universidade Estadual Paulista (UNESP) | pt |
| dc.rights.accessRights | Acesso restrito | pt |
| dc.subject | Análise multivariada | pt |
| dc.subject | Ausência de dado | pt |
| dc.subject | Valores atípicos | pt |
| dc.subject | Séries temporais | pt |
| dc.subject | Instrumentos meteorológicos | pt |
| dc.title | Procedimentos multivariados para identificação de outliers e imputação de dados faltantes em séries temporais meteorológicas | pt |
| dc.title.alternative | Multivariate procedures for outlier identification and missing data imputation in meteorological time series | en |
| dc.type | Tese de doutorado | pt |
| dcterms.impact | Esta pesquisa contribui para o aprimoramento da qualidade de dados meteorológicos utilizados em estudos agrometeorológicos, ambientais e agrícolas. Ao comparar métodos multivariados para imputação de dados faltantes e detecção de outliers em séries temporais, o trabalho oferece subsídios para tornar as bases de dados mais confiáveis e reduzir erros em análises, estimativas e tomadas de decisão. Os resultados podem apoiar o uso mais seguro de informações meteorológicas em pesquisas científicas, monitoramento climático, planejamento agrícola e desenvolvimento de sistemas computacionais aplicados à Engenharia Agrícola. | pt |
| dcterms.impact | The quality of meteorological data is essential for reliable agrometeorological analyses. Time series often present measurement gaps (missings) and distortions caused by outliers, which compromise the accuracy of estimates and, consequently, the reliability of data-driven decisions. This work proposes a multivariate approach for the evaluation and comparison of missing-data imputation methods and outlier detection techniques, considering the temporal structure of the data. In Chapter 1, seven imputation techniques for multivariate time series are evaluated, including Principal Component Analysis (PCA), Random Forest, K-Nearest Neighbors (KNN), Iterative Time-Dependent Imputation (TDI), Recurrent Neural Networks (RNN), and SAITS. These methods are assessed using MAE, MSE, RMSE, Pearson correlation, and processing time under different levels of missingness (5%–35%). TDI maintains high performance with lower computational cost, making it the best accuracy–efficiency trade-off, while Random Forest shows the lowest errors and greater robustness to higher missingness, though at a higher computational cost. PCA and KNN achieve intermediate results when missingness is low but lose accuracy as missing values increase, especially in variables with higher variability. RNN and SAITS reach intermediate accuracy, but with higher computational cost. Simple mean imputation shows the worst performance, as it fails to capture data variability. In Chapter 2, multivariate models for outlier detection are tested, such as Traditional PCA and its variations (RPCA, MWPCA), Isolation Forest, and LSTM-based models. These approaches are validated using metrics designed for imbalanced data, such as G-Mean and Kappa. RPCA and LSTM stand out by achieving superior performance in detecting outliers, even in highly imbalanced datasets. | en |
| dspace.entity.type | Publication | |
| relation.isAuthorOfPublication | e3b0e39a-3786-406e-96e1-8a3c99fda296 | |
| relation.isAuthorOfPublication.latestForDiscovery | e3b0e39a-3786-406e-96e1-8a3c99fda296 | |
| relation.isGradProgramOfPublication | d1489898-05da-4e40-a1ca-988e75d5a727 | |
| relation.isGradProgramOfPublication.latestForDiscovery | d1489898-05da-4e40-a1ca-988e75d5a727 | |
| relation.isOrgUnitOfPublication | ef1a6328-7152-4981-9835-5e79155d5511 | |
| relation.isOrgUnitOfPublication.latestForDiscovery | ef1a6328-7152-4981-9835-5e79155d5511 | |
| unesp.campus | Universidade Estadual Paulista (UNESP), Faculdade de Ciências Agronômicas, Botucatu | pt |
| unesp.embargo | 24 meses | pt |
| unesp.examinationboard.type | Banca pública | pt |
| unesp.graduateProgram | Engenharia Agrícola - FCA | pt |
| unesp.knowledgeArea | Outra | pt |
| unesp.researchArea | Engenharia Agrícola de Precisão | pt |

