Logotipo do repositório

Verificação de locutor baseada em aprendizado profundo a partir de espectrogramas Mel multirresolução

Carregando...
Imagem de Miniatura

Coorientador

Pós-graduação

Ciência da Computação - FC/FCT/IBILCE/IGCE

Curso de graduação

Título da Revista

ISSN da Revista

Título de Volume

Editor

Universidade Estadual Paulista (UNESP)

Tipo

Dissertação de mestrado

Direito de acesso

Acesso abertoAcesso Aberto

Resumo

Resumo (português)

A verificação de locutor é uma área fundamental da biometria da voz, visto que a autenticação automática de indivíduos por meio da comparação entre pares de áudios faz-se necessária principalmente em contextos de segurança e em técnicas forenses, a fim de validar se ambos os áudios foram produzidos pela mesma pessoa. Nos últimos anos, os avanços obtidos na área foram, em grande parte, devidos à chegada da era do grande volume de dados, com bases que superam um milhão de trechos de áudio. Entretanto, fatores externos e internos, como ruído e o próprio estado emocional do indivíduo, podem interferir no processo de verificação e dificultar a criação de modelos com uma maior taxa de acerto. Neste contexto, este trabalho tem como objetivo investigar o uso de múltiplas resoluções de áudio, comparado à utilização de apenas duas resoluções. Para isso, propõe-se um modelo baseado no uso de múltiplas resoluções espectrais para extração de características em um espectrograma Mel, com a utilização de uma arquitetura de redes neurais pré-treinada (PANN) e ECAPA2, integradas a uma rede prototípica. No modelo baseado em PANN, a configuração de três resoluções alcançou uma Equal Error Rate (EER) de 10.10, representando reduções de aproximadamente 30.9 e 38.6 em comparação com as configurações de duas resoluções (14.62) e resolução única (16.45), respectivamente. Além disso, experimentos que utilizaram o modelo da arquitetura ECAPA2 também demonstraram melhorias ao empregar a abordagem multirresolução, alcançando um EER de 6.97 para o modelo de três resoluções, o que corresponde a reduções EER de aproximadamente 10.2 e 15.6 em relação às configurações de duas resoluções (7.76) e resolução única (8.25), respectivamente. Como contribuição científica, desenvolveram-se adaptações de modelos capazes de priorizar as características fundamentais da voz, a fim de aumentar o desempenho na comparação de locutores entre amostras de áudios distintas e avaliar o impacto de diferentes quantidades de resoluções espectrais.

Resumo (inglês)

Speaker verification is a fundamental area of voice biometrics, since the automatic authentication of individuals through the comparison of audio pairs is necessary primarily in security contexts and forensic techniques, in order to validate whether both audios were produced by the same person. In recent years, the advances achieved in the area were largely due to the arrival of the big data era, with databases that exceed one million audio excerpts. However, external and internal factors, such as noise and the individual's own emotional state, can interfere in the verification process and hinder the creation of models with a higher accuracy rate. In this context, this work aims to investigate the use of multiple audio resolutions, compared to the use of only two resolutions. For this, a model based on the use of multiple spectral resolutions for feature extraction in a Mel spectrogram is proposed, using a pre-trained neural network architecture (PANN) and ECAPA2, integrated into a prototypical network. In the PANN-based model, the three-resolution configuration achieved an Equal Error Rate (EER) of 10.10, representing reductions of approximately 30.9 and 38.6 compared to the two-resolution (14.62) and single-resolution (16.45) configurations, respectively. Furthermore, experiments that used the ECAPA2 architecture model also demonstrated improvements when employing the multiresolution approach, achieving an EER of 6.97 for the three-resolution model, which corresponds to EER reductions of approximately 10.2 and 15.6 compared to the two-resolution (7.76) and single-resolution (8.25) configurations, respectively. As a scientific contribution, model adaptations capable of prioritizing fundamental voice characteristics were developed in order to increase performance in speaker comparison between distinct audio samples and to evaluate the impact of different amounts of spectral resolutions.

Descrição

Idioma

Português

Citação

PAZZINI, Gustavo Pereira. Verificação de locutor baseada em aprendizado profundo a partir de espectrogramas Mel multirresolução. 2026. Dissertação (Mestrado em Ciência da Computação). - Universidade Estadual Paulista (Unesp), Instituto de Biociências Letras e Ciências Exatas (Ibilce), São José do Rio Preto, 2026.

Itens relacionados

Unidades

Tipo de item:Unidade,
São José do Rio Preto, Instituto de Biociências, Letras e Ciências Exatas - IBILCE
IBILCE
Campus: São José do Rio Preto

Departamentos

Cursos de graduação