Critical object detection and visual question answering in natural disaster scenes: a recall-focused framework
Carregando...
Data
Autores
Orientador
Coorientador
Pós-graduação
Ciência da Computação - FC/FCT/IBILCE/IGCE
Curso de graduação
Título da Revista
ISSN da Revista
Título de Volume
Editor
Universidade Estadual Paulista (Unesp)
Tipo
Dissertação de mestrado
Direito de acesso
Acesso aberto

Resumo
Resumo (português)
As mudanças climáticas têm intensificado progressivamente a frequência e a severidade dos desastres naturais em escala global. Nesse contexto, assegurar que as equipes de resgate estejam adequadamente preparadas e aptas para uma resposta rápida é crucial para a minimização do número de vítimas. Concomitantemente, os rápidos avanços na área de visão computacional, em particular, algoritmos de detecção de objetos como o YOLO e mecanismos baseados em atenção, e no processamento de linguagem natural, impulsionados pelos grandes modelos de linguagem, oferecem ferramentas sem precedentes para a análise de cenas em tempo real. A integração dessas tecnologias multimodais apresenta um potencial significativo para fornecer inteligência rápida, otimizada e acionável, auxiliando as equipes de primeira resposta durante operações de emergência e prevenindo o envio de profissionais a ambientes não previamente avaliados. Baseando-se nesse potencial tecnológico, este trabalho propõe um framework que integra múltiplos modelos de detecção de objetos a um modelo de linguagem para consultar e analisar situações de desastre. Um aspecto central dessa abordagem é a identificação e a priorização de "objetos críticos". Neste estudo, os objetos críticos são explicitamente definidos como veículos submersos e estruturas residenciais severamente danificadas, os quais representam locais com alta probabilidade de abrigar vítimas retidas. Negligenciar tais locais pode comprometer severamente os resultados das operações de resgate; por conseguinte, nossa metodologia prioriza a minimização de falsos negativos. A avaliação do framework foi conduzida utilizando conjuntos de dados de domínio público da plataforma Roboflow, adaptados para atender aos nossos requisitos experimentais, avaliando sua capacidade de recuperar e ranquear efetivamente esses objetos críticos. Em comparação a um modelo de referência (baseline) que utiliza um único algoritmo de detecção de objetos, a abordagem multimodelo proposta demonstrou desempenho superior, alcançando maior revocação (recall) e ranqueando os objetos críticos de forma eficaz com base em seus valores de pontuação de confiança. Embora não tenha sido testado em cenários reais de desastres, estes resultados preliminares ressaltam o forte potencial do framework como uma futura ferramenta assistiva de triagem para operações de resposta a emergências.
Resumo (inglês)
Climate change has increasingly intensified the frequency and severity of natural disasters worldwide. In this context, ensuring that rescue teams are adequately prepared and capable of rapid response is critical to minimizing casualties. Concurrently, rapid advancements in Computer Vision (CV), particularly, object detection algorithms like YOLO and attention-based mechanisms — and Natural Language Processing (NLP), driven by Large Language Models (LLMs), offer unprecedented tools for real-time scene analysis. The integration of these multimodal technologies presents significant potential to provide fast, lightweight, and actionable intelligence to assist first responders during emergency operations, preventing the deployment of personnel into unassessed environments. Leveraging this technological potential, this work proposes a framework that integrates multiple object detection models with an LLM to query and analyze disaster situations. A core aspect of this approach is the identification and prioritization of "critical objects". In this study, critical objects are explicitly defined as submerged vehicles and heavily damaged residential structures, which represent highly probable locations of trapped victims. Overlooking these locations can severely impact rescue outcomes; therefore, our methodology prioritizes the minimization of false negatives. The framework's evaluation was conducted using publicly available datasets from Roboflow, customized to suit our experimental requirements, assessing its ability to effectively retrieve and rank these critical objects. Compared to a baseline utilizing a single object detection model, the proposed multi-model approach demonstrated superior performance, achieving higher recall and effectively ranking critical objects by confidence score values. While untested in real-world disaster deployments, these preliminary results underscore the framework's strong potential as a future assistive triage tool for emergency response operations.
Descrição
Palavras-chave
Idioma
Inglês
Citação
GAPSKI, Marina Chagas Bulach. Critical object detection and visual question answering in natural disaster scenes: a recall-focused framework. 2026. Dissertação (Mestrado em Ciência da Computação) – Instituto de Geociências e Ciências Exatas, Universidade Estadual Paulista (UNESP), Rio Claro, 2026.



