Logotipo do repositório

Fusão baseada em ranqueamento para recuperação aumentada por múltiplos modelos de linguagem

dc.contributor.advisorPedronette, Daniel Carlos Guimarães [UNESP]
dc.contributor.authorBell, Murilo Missano [UNESP]
dc.contributor.coadvisorGuilherme, Ivan Rizzo [UNESP]
dc.contributor.committeeMemberPedronette, Daniel Carlos Guimarães [UNESP]
dc.contributor.committeeMemberValem, Lucas Pascotti
dc.contributor.committeeMemberCandido Junior, Arnaldo [UNESP]
dc.contributor.institutionUniversidade Estadual Paulista (Unesp)pt
dc.date.accessioned2026-07-08T17:34:10Z
dc.date.issued2026-05-13
dc.description.abstractOs Grandes Modelos de Linguagem (LLMs – Large Language Models) apresentam potencial em várias áreas da computação dada sua capacidade de geração de textos coerentes e semanticamente relevantes. Apesar de seu sucesso, a alucinação permanece como um dos principais problemas enfrentados por esses modelos. Métodos de Geração Aumentada por Recuperação (RAG – Retrieval-Augmented Generation) têm se demonstrado abordagens efetivas para mitigação do problema. Nas abordagens de RAG, bases de conhecimento e sistemas de recuperação de informação são utilizados para proporcionar informações contextuais aos LLMs. Com o intuito de melhorar as informações contextuais retornadas aos modelos de linguagem, o método RAG-Fusion explora o uso de LLMs para expansão de consultas, por meio da geração de variações da consulta original. As variações são submetidas a um sistema de recuperação, que produz um conjunto de rankings. Os rankings são combinados por meio do método de Fusão do Ranqueamento Recíproco (RRF – Reciprocal Rank Fusion), produzindo o ranking final. Apesar do RAG-Fusion e demais métodos de expansão de consultas serem amplamente discutidos, pelo que se tem conhecimento, nenhuma abordagem investiga a complementaridade nos níveis de geração e recuperação de forma conjunta; tampouco analisa diferentes métodos de fusão e seus impactos no contexto de expansão de consultas. O presente trabalho foca em analisar essa complementaridade, propondo a abordagem de Recuperação Aumentada por Múltiplos MOdelos de liNguagem (RAMMON). O RAMMON integra múltiplos LLMs para expansão de consultas, o que expande o espectro de busca ao considerar diferentes interpretações semânticas que os modelos podem possuir; e um sistema de recuperação híbrido, ampliando as representações das consultas. Além disso, o presente trabalho propõe três novos métodos de fusão de rankings, comparando-os com o RRF no cenário de expansão de consultas definido no RAMMON. Os resultados experimentais demonstram que o RAMMON obtém resultados comparáveis aos métodos de estado da arte em expansão de consultas, superando-os na métrica de Recall, em média. Um dos métodos de fusão propostos supera o RRF na métrica de Precision. O presente trabalho explora a complementaridade como principal conceito, contribuindo para a expandir a análise do conceito na área de expansão de consultas e com potencial de embasar novas pesquisas em complementaridade de métodos e modelos.pt
dc.description.abstractLarge Language Models (LLMs) have demonstrated potential across several areas of computer science due to their ability to generate coherent and semantically relevant text. Despite their success, hallucination remains one of the main challenges faced by these models. Retrieval-Augmented Generation (RAG) methods have proven to be effective approaches for mitigating this problem. In RAG approaches, knowledge bases and information retrieval systems are employed to provide contextual information to LLMs. Aiming to improve the contextual information returned to language models, the RAG-Fusion method explores the use of LLMs for query augmentation by generating variations of the original query. These variations are submitted to an information retrieval system, which produces a set of rankings. The rankings are then combined using the Reciprocal Rank Fusion (RRF) method, producing the final ranking. Although RAG-Fusion and other query expansion methods have been widely discussed, to the best of our knowledge, no existing approach jointly investigates complementarity at both the generation and retrieval levels; nor does any study analyze different ranking fusion methods and their impact in the context of query expansion. This work focuses on analyzing such complementarity by proposing the Retrieval Augmented by Multiple Language Models (RAMMON – Recuperação Aumentada por Múltiplos MOdelos de liNguagem) approach. RAMMON integrates multiple LLMs for query expansion, expanding the search spectrum by considering the different semantic interpretations that language models may provide; and a hybrid retrieval system, enriching query representations. Furthermore, our work proposes three novel rank fusion methods and compares them with RRF within the query augmentation scenario defined by RAMMON. The experimental results show that RAMMON achieves comparable results to state-of-the-art query augmentation methods, outperforming them in terms of Recall on average. One of the proposed fusion methods surpasses RRF in terms of Precision. Our work explores complementary as their main concept, contributing to the expansion of this concept analysis in the field of query augmentation and has the potential to support future research on the complementarity of methods and models.en
dc.description.sponsorshipFundação para o Desenvolvimento da UNESP (FUNDUNESP)
dc.description.sponsorshipIdFUNDUNESP: 3070/2019
dc.identifier.capes33004153073P2
dc.identifier.lattes1576097622593183
dc.identifier.orcid0009-0006-6212-8984
dc.identifier.urihttps://hdl.handle.net/11449/327424
dc.language.isopor
dc.publisherUniversidade Estadual Paulista (Unesp)
dc.rights.accessRightsAcesso restritopt
dc.subjectCiência da computaçãopt
dc.subjectRecuperação da informaçãopt
dc.subjectProcessamento de linguagem natural (Computação)pt
dc.subjectExpansão de consultaspt
dc.subjectFusão baseada em ranqueamentopt
dc.subjectGrandes modelos de linguagempt
dc.subjectComputer scienceen
dc.subjectInformation retrievalen
dc.subjectNatural language processing (Computer science)en
dc.subjectQuery augmentationen
dc.subjectRanking-based fusionen
dc.subjectLarge language modelsen
dc.titleFusão baseada em ranqueamento para recuperação aumentada por múltiplos modelos de linguagempt
dc.title.alternativeRanking-based fusion for retrieval augmented by multiple language modelsen
dc.typeDissertação de mestradopt
dcterms.impactEsta pesquisa contribui para o avanço da recuperação de informação ao investigar múltiplas perspectivas na representação da necessidade de informação. A abordagem tem potencial de tornar sistemas de busca mais eficazes, facilitando a localização de informações relevantes e apoiando aplicações de inteligência artificial que dependem de recuperação.pt
dcterms.impactThis research contributes to the advancement of information retrieval by investigating multiple perspectives in the representation of information needs. The approach has the potential to make search systems more effective, improving the retrieval of relevant information and supporting artificial intelligence applications that rely on retrieval.en
dspace.entity.typePublication
relation.isAuthorOfPublicationaf8e3ccc-f0d6-4e4b-a3f8-015307eafbb1
relation.isAuthorOfPublication.latestForDiscoveryaf8e3ccc-f0d6-4e4b-a3f8-015307eafbb1
relation.isGradProgramOfPublicationd7c91376-28ac-4ea8-aada-e75db43fbca8
relation.isGradProgramOfPublication.latestForDiscoveryd7c91376-28ac-4ea8-aada-e75db43fbca8
relation.isOrgUnitOfPublication4763ec56-704e-41e0-9685-b5bef5946feb
relation.isOrgUnitOfPublication.latestForDiscovery4763ec56-704e-41e0-9685-b5bef5946feb
unesp.campusUniversidade Estadual Paulista (UNESP), Instituto de Geociências e Ciências Exatas, Rio Claropt
unesp.embargo12 mesespt
unesp.examinationboard.typeBanca públicapt
unesp.graduateProgramCiência da Computação - FC/FCT/IBILCE/IGCEpt
unesp.knowledgeAreaOutrapt
unesp.researchAreaInteligência computacional.pt

Arquivos

Pacote original

Agora exibindo 1 - 2 de 2
Carregando...
Imagem de Miniatura
Nome:
bell_mm_me_rcla_int.pdf
Tamanho:
2,1 MB
Formato:
Adobe Portable Document Format
Carregando...
Imagem de Miniatura
Nome:
bell_mm_me_rcla_par.pdf
Tamanho:
407,49 KB
Formato:
Adobe Portable Document Format