Aprendizado de máquina científico via regressão simbólica para descoberta de modelos interpretáveis
Carregando...
Data
Orientador
Coorientador
Pós-graduação
Matemática Aplicada e Computacional - FCT
Curso de graduação
Título da Revista
ISSN da Revista
Título de Volume
Editor
Universidade Estadual Paulista (UNESP)
Tipo
Dissertação de mestrado
Direito de acesso
Acesso aberto

Resumo
Resumo (português)
Ao reconhecer o aprendizado de máquina como uma ferramenta central para a computação científica moderna, surge o aprendizado de máquina científico, com o principal objetivo de maximizar a contribuição destes modelos para o avanço do estado da arte em diversos domínios da ciência. Dentre as diretrizes de pesquisa propostas pelo conceito de aprendizado de máquina científico, está a produção de modelos interpretáveis, robustos e capazes de lidar com cenários de alta dimensionalidade, uma realidade decorrente da crescente abundância de dados, graças à revolução digital, e à necessidade de produzir conhecimento a partir deles. Este trabalho visa explorar a regressão simbólica como meio de produção de modelos interpretáveis, identificando seu estado da arte, suas limitações na produção de modelos escaláveis e resistentes a ruídos, formas de avaliação de métodos e perspectivas de evolução da área. Além do levantamento e estudo da literatura, também compõe o texto uma análise crítica do SRBench, principal benchmark para avaliação de métodos de regressão simbólica, acompanhada de uma proposta de evolução do mesmo por meio de novos conjuntos de dados voltados à predição da concentração de MP2.5 a partir de variáveis meteorológicas e temporais, um problema real, complexo e compreendido dentro de um cenário ruidoso e de alta dimensão, dada a potencial influência de fatores imprevisíveis e a elevada quantidade de amostras e variáveis envolvidas.
Resumo (inglês)
By recognizing machine learning as a central tool for modern scientific computing, scientific machine learning emerges, with the main goal of maximizing the contribution of these models to advancing the state of the art across various domains of science. Among the research guidelines proposed by the concept of scientific machine learning is the production of interpretable, robust models capable of handling high-dimensional scenarios, a reality stemming from the growing abundance of data, thanks to the digital revolution, and the need to produce knowledge from it. This work aims to explore symbolic regression as a means of producing interpretable models, identifying its state of the art, its limitations in producing scalable and noise-resistant models, methods of evaluation, and prospects for the field's evolution. In addition to the survey and study of the literature, the text also includes a critical analysis of SRBench, the main benchmark for evaluating symbolic regression methods, accompanied by a proposal for its evolution through new datasets aimed at predicting PM2.5 concentration from meteorological and temporal variables, a real, complex problem understood within a noisy, high-dimensional scenario, given the potential influence of unpredictable factors and the large number of samples and variables involved.
Descrição
Idioma
Português
Citação
PEREIRA, Daniel Henrique Serezane. Aprendizado de máquina científico via regressão simbólica para descoberta de modelos interpretáveis. Orientador: Cassio Machiaveli Oishi. 2026. 107 f. Dissertação (Mestrado em Matemática Aplicada e Computacional) - Faculdade de Ciências e Tecnologia, Universidade Estadual Paulista (UNESP), Presidente Prudente, 2026.



