Logotipo do repositório

Visualização de dados não estruturados da saúde apoiada por processamento de linguagem natural

Carregando...
Imagem de Miniatura

Coorientador

Pós-graduação

Ciência da Computação - FC/FCT/IBILCE/IGCE

Curso de graduação

Título da Revista

ISSN da Revista

Título de Volume

Editor

Universidade Estadual Paulista (Unesp)

Tipo

Dissertação de mestrado

Direito de acesso

Acesso abertoAcesso Aberto

Resumo

Resumo (português)

A informatização na área da saúde permite que os profissionais analisem o histórico do paciente de maneira mais rápida e eficiente, o que possibilita um atendimento mais preciso e assertivo. Nesse sentido, a Visualização de Dados permite a criação de representações visuais que auxiliam a interpretação e a compreensão dos dados alvos da análise. Contudo, grande parte das informações médicas encontra-se no formato de texto e, devido a característica não estruturada desse tipo de dado, dificulta a aplicação direta de algoritmos de extração de informação. A área de Processamento de Linguagem Natural tem como objetivo a análise automática de textos escritos na linguagem humana, mais especificamente em pesquisas recentes, têm direcionado na visualização de dados e na subárea de Reconhecimento de Entidades Nomeadas. No entanto, a maioria desses estudos são voltados para os idiomas com mais recursos, como o inglês. O presente trabalho propõe uma abordagem capaz de extrair informações relevantes de textos clínicos psiquiátricos em língua portuguesa por meio de um modelo de linguagem ajustado para o reconhecimento de entidades nomeadas, com posterior estruturação dos dados extraídos em um banco de dados relacional. Os resultados experimentais demonstram que a abordagem proposta obteve desempenho superior em relação a abordagens comparáveis, com 0,80 de precisão, 0,84 de revocação e 0,82 de F1-Score. Esses valores evidenciam a qualidade do modelo na identificação de entidades clínicas relevantes comparados com outros modelos da literatura. A avaliação do recurso de visualização mostrou uma redução média de 29,8% no tempo de entendimento do caso, de modo que se mantiveram os valores das conclusões obtidas na análise textual. A principal contribuição científica consiste no desenvolvimento de uma abordagem que agrega o processo de extração automática de informações médicas e uma ferramenta de visualização baseada em gráfico de Gantt, que representa os eventos clínicos de forma cronológica e interativa.

Resumo (inglês)

The computerization of healthcare allows professionals to analyze patient histories more quickly and efficiently, enabling more precise and assertive care. In this sense, Data Visualization allows the creation of visual representations that aid in the interpretation and understanding of the data targeted for analysis. However, much of the medical information is in text format, and due to the unstructured nature of this type of data, it hinders the direct application of information extraction algorithms. The field of Natural Language Processing aims at the automatic analysis of texts written in human language; more specifically, recent research has focused on data visualization and the sub-area of Named Entity Recognition. However, most of these studies are geared towards languages with more resources, such as English. This work proposes an approach capable of extracting relevant information from psychiatric clinical texts in Portuguese using a language model adjusted for named entity recognition, with subsequent structuring of the extracted data in a relational database. Experimental results demonstrate that the proposed approach outperformed comparable approaches, with a precision of 0.80, a recall of 0.84, and an F1-Score of 0.82. These values highlight the model's quality in identifying relevant clinical entities compared to other models in the literature. Evaluation of the visualization feature showed an average reduction of 29.8% in case comprehension time, maintaining the values of the conclusions obtained in the textual analysis. The main scientific contribution lies in the development of an approach that combines the automatic extraction of medical information and a Gantt chart-based visualization tool, which represents clinical events chronologically and interactively.

Descrição

Idioma

Português

Citação

GOUVEIA, Wellington Reguera. Visualização de dados não estruturados da saúde apoiada por processamento de linguagem natural. 2026. Dissertação (Mestrado em Ciência da Computação) – Universidade Estadual Paulista, Instituto de Biociências Letras e Ciências Exatas, São José do Rio Preto, 2026.

Itens relacionados

Unidades

Tipo de item:Unidade,
São José do Rio Preto, Instituto de Biociências, Letras e Ciências Exatas - IBILCE
IBILCE
Campus: São José do Rio Preto

Departamentos

Cursos de graduação