Logotipo do repositório

Interactive Content Retrieval in Egocentric Videos Based on Vague Semantic Queries

dc.contributor.authorAblaoui, Linda
dc.contributor.authorMarcilio-Jr, Wilson Estecio [UNESP]
dc.contributor.authorNg, Lai Xing
dc.contributor.authorJouffrais, Christophe
dc.contributor.authorHurter, Christophe
dc.contributor.institutionUniversidade Estadual Paulista (UNESP)pt
dc.date.accessioned2026-07-27T16:28:44Z
dc.date.issued2025-06-30
dc.description.abstractRetrieving specific, often instantaneous, content from hours-long egocentric video footage based on hazily remembered details is challenging. Vision–language models (VLMs) have been employed to enable zero-shot textual-based content retrieval from videos. But, they fall short if the textual query contains ambiguous terms or users fail to specify their queries enough, leading to vague semantic queries. Such queries can refer to several different video moments, not all of which can be relevant, making pinpointing content harder. We investigate the requirements for an egocentric video content retrieval framework that helps users handle vague queries. First, we narrow down vague query formulation factors and limit them to ambiguity and incompleteness. Second, we propose a zero-shot, user-centered video content retrieval framework that leverages a VLM to provide video data and query representations that users can incrementally combine to refine queries. Third, we compare our proposed framework to a baseline video player and analyze user strategies for answering vague video content retrieval scenarios in an experimental study. We report that both frameworks perform similarly, users favor our proposed framework, and, as far as navigation strategies go, users value classic interactions when initiating their search and rely on the abstract semantic video representation to refine their resulting moments.
dc.description.affiliationEcole Nationale de l’aviation Civile, 7 Avenue Edouard Belin, CS 54005, CEDEX 4, 31055 Toulouse, France;, christophe.hurter@enac.fr
dc.description.affiliationCNRS, IPAL, 15 Computing Drive, Singapore 117418, Singapore;, ng_lai_xing@i2r.a-star.edu.sg, (L.X.N.);, christophe.jouffrais@cnrs.fr, (C.J.)
dc.description.affiliationFaculty of Sciences and Technology, São Paulo State University (UNESP), Presidente Prudente 19060-900, SP, Brazil;, wilson.marcilio@unesp.br
dc.description.affiliationInstitute for Infocomm Research, A*STAR, 1 Fusionopolis Way, #21-01, Connexis South Tower, Singapore 138632, Singapore
dc.description.affiliationInstitut de Recherche en Informatique de Toulouse (IRIT), Centre National de la Recherche Scientifique (CNRS), 31062 Toulouse, France
dc.description.affiliationUnespFaculty of Sciences and Technology, São Paulo State University (UNESP), Presidente Prudente 19060-900, SP, Brazil;, wilson.marcilio@unesp.br
dc.identifierhttps://app.dimensions.ai/details/publication/pub.1190411463
dc.identifier.dimensionspub.1190411463
dc.identifier.doi10.3390/mti9070066
dc.identifier.issn2414-4088
dc.identifier.orcid0009-0002-8835-1376
dc.identifier.orcid0000-0002-8580-2779
dc.identifier.orcid0000-0002-5457-6289
dc.identifier.orcid0000-0002-0768-1019
dc.identifier.orcid0000-0003-4318-6717
dc.identifier.urihttps://hdl.handle.net/11449/328692
dc.publisherMDPI
dc.relation.ispartofMultimodal Technologies and Interaction; n. 7; v. 9; p. 66
dc.rights.accessRightsAcesso abertopt
dc.rights.sourceRightsoa_all
dc.rights.sourceRightsgold
dc.sourceDimensions
dc.titleInteractive Content Retrieval in Egocentric Videos Based on Vague Semantic Queries
dc.typeArtigopt
dspace.entity.typePublication
relation.isOrgUnitOfPublicationbbcf06b3-c5f9-4a27-ac03-b690202a3b4e
relation.isOrgUnitOfPublication.latestForDiscoverybbcf06b3-c5f9-4a27-ac03-b690202a3b4e
unesp.campusUniversidade Estadual Paulista (UNESP), Faculdade de Ciências e Tecnologia, Presidente Prudentept

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
mti-09-00066.pdf
Tamanho:
2,81 MB
Formato:
Adobe Portable Document Format