Reconhecimento de entidades nomeadas em prontuários de Psiquiatria: anotação de corpus e extração de entidades clínicas

Niero, Luiz Henrique Pereira [UNESP]

Reconhecimento de entidades nomeadas em prontuários de Psiquiatria: anotação de corpus e extração de entidades clínicas

dc.contributor.advisor	Guilherme, Ivan Rizzo [UNESP]
dc.contributor.advisor	Oliveira, Lucas Emanuel Silva e
dc.contributor.author	Niero, Luiz Henrique Pereira [UNESP]
dc.contributor.committeeMember	Cândido Junior, Arnaldo
dc.contributor.committeeMember	Barra, Claudia Maria Cabral Moro
dc.contributor.institution	Universidade Estadual Paulista (Unesp)
dc.date.accessioned	2023-08-22T12:08:52Z
dc.date.available	2023-08-22T12:08:52Z
dc.date.issued	2023-06-30
dc.description.abstract	Grande parte das informações dos dados de pacientes presentes nos sistemas de prontuários eletrônicos encontram-se em formato de texto. Esses dados dizem respeito às informações diversas do paciente e são de extrema importância para acompanhar o tratamento dele. Porém, dados que estão no formato puramente textual não estão passíveis à aplicação de algoritmos computacionais para a extração de informações. Para resolver tal problema, existe uma área chamada Processamento de Linguagem Natural e uma subárea chamada de Reconhecimento de Entidade Nomeadas (REN), que tem por objetivo reconhecer unidades que representam algum sentido no texto – chamadas de Entidades. Os métodos mais atuais de REN utilizam-se de métodos de aprendizado de máquina em corpus de documentos anotados para atingir bons resultados, porém, de acordo com o levantamento realizado no presente trabalho, não foram encontrados corpus anotados para a língua portuguesa que pudessem ser treinados para o domínio da psiquiatria, que é o domínio explorado no presente trabalho. Portanto, neste trabalho foi realizada a anotação de um corpus de prontuários médicos de psiquiatria, o PSYclinBR. O corpus é composto por 300 prontuários de notas de admissão de um serviço de emergência psiquiatra e anotado em 9 categorias semânticas: comportamento autodestrutivo, diagnóstico, droga, fármaco, função psíquica, histórico familiar, histórico do paciente, observação e sintoma e queixa psíquica. Ao todo, são 2.480 sentenças e 5.822 entidades, com IAA de 0.6. O treinamento do modelo de REN baseado na arquitetura BERT, o psyBERTpt, foi feito com a utilização do corpus anotado e atingiu os valores médios de precisão 0,65, revocação 0,69 e f1-score 0,67, valores que estão próximos ao estado da arte para REN em dados clínicos da língua portuguesa. Tanto o Corpus como o modelo de REN foram disponibilizados publicamente.	pt
dc.description.abstract	A significant portion of patient data within electronic medical record systems is represented in textual format. These data encompass diverse patient information and hold utmost importance in monitoring their treatment progress. However, data presented purely as text pose limitations in terms of applicability to computational algorithms for information extraction. To address this issue, a field known as Natural Language Processing (NLP) emerges, encompassing a subfield called Named Entity Recognition (NER). The primary goal of NER is to identify units within text that convey meaningful context, referred to as Entities. Contemporary NER methods employ machine learning techniques on annotated document corpora to achieve robust outcomes. Nonetheless, according to the investigation undertaken in this study, no annotated corpora for the Portuguese language, suitable for training in the domain of psychiatry, the domain explored in the present study, were found. As a result, this study undertook the annotation of a corpus derived from psychiatric medical records, termed as PSYclinBR. This corpus comprises 300 admission notes from a psychiatric emergency service, annotated across 9 semantic categories: self-destructive behavior, diagnosis, drug, medication, psychic function, family history, patient history, observation, and psychological symptom and complaint. The corpus encompasses a total of 2,480 sentences and 5,822 entities, yielding an Inter-Annotator Agreement (IAA) of 0.6. The training of the Named Entity Recognition model, psyBERTpt, which is based on the BERT architecture, was executed using the annotated corpus. This model attained average precision, recall, and f1-score values of 0.65, 0.69, and 0.67 respectively. These values are in proximity to the state-of-the-art results for NER on clinical data in the Portuguese language. Both the annotated corpus and the NER model have been made publicly available.	en
dc.identifier.capes	33004153073P2
dc.identifier.uri	http://hdl.handle.net/11449/250392
dc.language.iso	por
dc.publisher	Universidade Estadual Paulista (Unesp)
dc.rights.accessRights	Acesso aberto	pt
dc.subject	Ciência da computação	pt
dc.subject	PLN	pt
dc.subject	Extração de informação	pt
dc.subject	Aprendizado de máquina	pt
dc.subject	Anotação de corpus	pt
dc.subject	Clinical entity extraction	en
dc.subject	Natural language processing	en
dc.title	Reconhecimento de entidades nomeadas em prontuários de Psiquiatria: anotação de corpus e extração de entidades clínicas	pt
dc.title.alternative	Named entities recognition in medical records Psychiatry: corpus annotation and clinical entity extraction	en
dc.type	Dissertação de mestrado	pt
dspace.entity.type	Publication
unesp.campus	Universidade Estadual Paulista (UNESP), Instituto de Geociências e Ciências Exatas, Rio Claro	pt
unesp.embargo	Online	pt
unesp.examinationboard.type	Banca pública	pt
unesp.graduateProgram	Ciência da Computação - IGCE	pt
unesp.knowledgeArea	Computação aplicada	pt
unesp.researchArea	Processamento de Linguagem Natural	pt

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1

Nome:: niero_lhp_me_rcla.pdf
Tamanho:: 2.44 MB
Formato:: Adobe Portable Document Format
Descrição:

Baixar

Licença do pacote

Agora exibindo 1 - 1 de 1

Nome:: license.txt
Tamanho:: 3.02 KB
Formato:: Item-specific license agreed upon to submission
Descrição:

Coleções

Rio Claro - IGCE - Instituto de Geociências e Ciências Exatas