Logotipo do repositório

Verificação de locutor baseada em aprendizado profundo a partir de espectrogramas Mel multirresolução

dc.contributor.advisorCandido Junior, Arnaldo
dc.contributor.authorPazzini, Gustavo Pereira
dc.contributor.committeeMemberGauy, Marcelo Matheus
dc.contributor.committeeMemberPonti, Moacir Antonelli
dc.contributor.committeeMemberCandido Junior, Arnaldo
dc.contributor.institutionUniversidade Estadual Paulista (UNESP)pt
dc.date.accessioned2026-09-03T13:20:37Z
dc.date.issued2026-08-07
dc.description.abstractA verificação de locutor é uma área fundamental da biometria da voz, visto que a autenticação automática de indivíduos por meio da comparação entre pares de áudios faz-se necessária principalmente em contextos de segurança e em técnicas forenses, a fim de validar se ambos os áudios foram produzidos pela mesma pessoa. Nos últimos anos, os avanços obtidos na área foram, em grande parte, devidos à chegada da era do grande volume de dados, com bases que superam um milhão de trechos de áudio. Entretanto, fatores externos e internos, como ruído e o próprio estado emocional do indivíduo, podem interferir no processo de verificação e dificultar a criação de modelos com uma maior taxa de acerto. Neste contexto, este trabalho tem como objetivo investigar o uso de múltiplas resoluções de áudio, comparado à utilização de apenas duas resoluções. Para isso, propõe-se um modelo baseado no uso de múltiplas resoluções espectrais para extração de características em um espectrograma Mel, com a utilização de uma arquitetura de redes neurais pré-treinada (PANN) e ECAPA2, integradas a uma rede prototípica. No modelo baseado em PANN, a configuração de três resoluções alcançou uma Equal Error Rate (EER) de 10.10, representando reduções de aproximadamente 30.9 e 38.6 em comparação com as configurações de duas resoluções (14.62) e resolução única (16.45), respectivamente. Além disso, experimentos que utilizaram o modelo da arquitetura ECAPA2 também demonstraram melhorias ao empregar a abordagem multirresolução, alcançando um EER de 6.97 para o modelo de três resoluções, o que corresponde a reduções EER de aproximadamente 10.2 e 15.6 em relação às configurações de duas resoluções (7.76) e resolução única (8.25), respectivamente. Como contribuição científica, desenvolveram-se adaptações de modelos capazes de priorizar as características fundamentais da voz, a fim de aumentar o desempenho na comparação de locutores entre amostras de áudios distintas e avaliar o impacto de diferentes quantidades de resoluções espectrais.pt
dc.description.abstractSpeaker verification is a fundamental area of voice biometrics, since the automatic authentication of individuals through the comparison of audio pairs is necessary primarily in security contexts and forensic techniques, in order to validate whether both audios were produced by the same person. In recent years, the advances achieved in the area were largely due to the arrival of the big data era, with databases that exceed one million audio excerpts. However, external and internal factors, such as noise and the individual's own emotional state, can interfere in the verification process and hinder the creation of models with a higher accuracy rate. In this context, this work aims to investigate the use of multiple audio resolutions, compared to the use of only two resolutions. For this, a model based on the use of multiple spectral resolutions for feature extraction in a Mel spectrogram is proposed, using a pre-trained neural network architecture (PANN) and ECAPA2, integrated into a prototypical network. In the PANN-based model, the three-resolution configuration achieved an Equal Error Rate (EER) of 10.10, representing reductions of approximately 30.9 and 38.6 compared to the two-resolution (14.62) and single-resolution (16.45) configurations, respectively. Furthermore, experiments that used the ECAPA2 architecture model also demonstrated improvements when employing the multiresolution approach, achieving an EER of 6.97 for the three-resolution model, which corresponds to EER reductions of approximately 10.2 and 15.6 compared to the two-resolution (7.76) and single-resolution (8.25) configurations, respectively. As a scientific contribution, model adaptations capable of prioritizing fundamental voice characteristics were developed in order to increase performance in speaker comparison between distinct audio samples and to evaluate the impact of different amounts of spectral resolutions.en
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)
dc.description.sponsorshipIdCAPES: 88887.976050/2024-00
dc.identifier.capes33004153073P2
dc.identifier.citationPAZZINI, Gustavo Pereira. Verificação de locutor baseada em aprendizado profundo a partir de espectrogramas Mel multirresolução. 2026. Dissertação (Mestrado em Ciência da Computação). - Universidade Estadual Paulista (Unesp), Instituto de Biociências Letras e Ciências Exatas (Ibilce), São José do Rio Preto, 2026.
dc.identifier.lattes7712897962582944
dc.identifier.orcid0009-0007-5417-7820
dc.identifier.urihttps://hdl.handle.net/11449/331399
dc.language.isopor
dc.publisherUniversidade Estadual Paulista (UNESP)pt
dc.rights.accessRightsAcesso abertopt
dc.subjectCiência da computaçãopt
dc.subjectAprendizagem profundapt
dc.subjectInteligência artificialpt
dc.subjectComputer scienceen
dc.subjectDeep learningen
dc.subjectArtificial intelligenceen
dc.titleVerificação de locutor baseada em aprendizado profundo a partir de espectrogramas Mel multirresoluçãopt
dc.title.alternativeSpeaker verification based on deep learning using multi-resolution Mel spectrogramsen
dc.typeDissertação de mestradopt
dcterms.impactEste trabalho propõe uma abordagem baseada em múltiplas resoluções espectrais e aprendizado profundo para verificação de locutores, visando modelos mais robustos e eficientes para autenticação por voz. A pesquisa contribui para o avanço da biometria da voz, com potencial de aplicação em sistemas de segurança, análises forenses e serviços digitais, além de promover o desenvolvimento científico e tecnológico na área de inteligência artificial.pt
dcterms.impactThis work proposes an approach based on multiple spectral resolutions and deep learning for speaker verification, aiming to develop more robust and efficient models for voice authentication. The research contributes to advances in voice biometrics, with potential applications in security systems, forensic analysis, and digital services, while promoting scientific and technological development in the field of artificial intelligence.en
dspace.entity.typePublication
relation.isGradProgramOfPublicationd7c91376-28ac-4ea8-aada-e75db43fbca8
relation.isGradProgramOfPublication.latestForDiscoveryd7c91376-28ac-4ea8-aada-e75db43fbca8
relation.isOrgUnitOfPublication43c38943-bd6f-4fb6-a9a5-8482a1f632c0
relation.isOrgUnitOfPublication.latestForDiscovery43c38943-bd6f-4fb6-a9a5-8482a1f632c0
unesp.campusUniversidade Estadual Paulista (UNESP), Instituto de Biociências, Letras e Ciências Exatas, São José do Rio Pretopt
unesp.examinationboard.typeBanca públicapt
unesp.graduateProgramCiência da Computação - FC/FCT/IBILCE/IGCEpt
unesp.knowledgeAreaComputação aplicadapt
unesp.researchAreaInteligência Computacionalpt

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
pazzini_gp_me_sjrp.pdf
Tamanho:
5,49 MB
Formato:
Adobe Portable Document Format