Metodologia de redução dimensional hierárquica com prevenção de vazamento de dados para predição de hotspots em Interações proteína-proteína
Carregando...
Data
Autores
Orientador
Coorientador
Pós-graduação
Ciência da Computação - FC/FCT/IBILCE/IGCE
Curso de graduação
Título da Revista
ISSN da Revista
Título de Volume
Editor
Universidade Estadual Paulista (Unesp)
Tipo
Dissertação de mestrado
Direito de acesso
Acesso aberto

Resumo
Resumo (português)
As interfaces proteína-proteína representam nanoambientes funcionais críticos para a comunicação molecular e a função biológica. A energia de ligação nessas interfaces concentra-se em poucos resíduos denominados hotspots, cuja identificação experimental é custosa e de difícil escalabilidade. Este trabalho apresenta uma metodologia hierárquica para predição computacional de hotspots, integrando descritores moleculares estruturais do STING_RDB com dados experimentais curados do PPI-HotSpotDB. A metodologia priorizou o controle rigoroso de vazamento de dados em múltiplas camadas: clusterização de sequências por similaridade, particionamento estratificado por proteína e validação cruzada com GroupKFold. A seleção hierárquica de descritores combinou mRMR in-fold, teste de Kolmogorov-Smirnov com correção FDR, remoção de multicolinearidade via VIF e seleção final por Boruta, resultando em redução dimensional de 97,6% a partir do conjunto inicial de descritores. Seis modelos foram avaliados sobre 918 resíduos de 158 proteínas. O SVM com kernel RBF alcançou AUC-ROC de 0,821 e sensibilidade de 0,844, enquanto o XGBoost obteve MCC de 0,538 e F1-score de 0,715. A comparação entre pipelines com e sem otimização de hiperparâmetros demonstrou que a qualidade dos descritores selecionados constitui o principal determinante do desempenho preditivo, superando o impacto do ajuste algorítmico. Os resultados demonstram a viabilidade de descritores estruturais para caracterização de determinantes energéticos em interfaces proteína-proteína, conciliando desempenho preditivo, rigor estatístico e interpretabilidade biológica.
Resumo (inglês)
Protein-protein interfaces represent critical functional nanoenvironments for molecular communication and biological function. Binding energy at these interfaces is concentrated in a few residues termed hotspots, whose experimental identification is costly and difficult to scale. This work presents a hierarchical methodology for computational hotspot prediction, integrating structural molecular descriptors from STING_RDB with curated experimental data from PPI-HotSpotDB. The methodology prioritized rigorous data leakage control through multiple layers: sequence clustering by similarity, protein-stratified partitioning, and GroupKFold cross-validation. The hierarchical descriptor selection combined in-fold mRMR, Kolmogorov-Smirnov test with FDR correction, multicollinearity removal via VIF, and final selection by Boruta, achieving 97.6% dimensional reduction from the initial descriptor set. Six models were evaluated on 918 residues from 158 proteins. SVM with RBF kernel achieved AUC-ROC of 0.821 and sensitivity of 0.844, while XGBoost obtained MCC of 0.538 and F1-score of 0.715. The comparison
between pipelines with and without hyperparameter optimization demonstrated that the quality of selected descriptors constitutes the main determinant of predictive performance, surpassing
the impact of algorithmic tuning. The results demonstrate the feasibility of structural descriptors for characterizing energetic determinants in protein-protein interfaces, reconciling predictive
performance, statistical rigor, and biological interpretability.
Descrição
Idioma
Português
Citação
VERNA, Rodrigo Perez. Metodologia de redução dimensional hierárquica com prevenção de vazamento de dados para predição de hotspots em interações proteína-proteína. 2026. 71 f. Dissertação (Mestrado em Ciência da Computação) – Instituto de Biociências, Letras e Ciências Exatas, Universidade Estadual Paulista "Júlio de Mesquita Filho", São José do Rio Preto, 2026.



