Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals
Este estudo demonstra que os atuais modelos de linguagem de grande escala não conseguem atingir uma confiabilidade interavaliadores comparável à de profissionais médicos ao extrair informações clínicas estruturadas de prontuários eletrônicos de otorrinolaringologia, sugerindo que eles são mais adequados para a extração inicial de dados que requer verificação humana do que para o implantação clínica autônoma.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo
Os hospitais de hoje geram um vasto oceano de registros escritos. Cada visita de um paciente, cada resultado de exame e cada decisão de tratamento é capturado em notas digitais conhecidas como prontuários eletrônicos. Esses documentos são ricos em detalhes, contendo a linguagem específica que os médicos usam para descrever sintomas, diagnosticar condições e planejar cuidados. Por décadas, transformar essas histórias não estruturadas em dados organizados e pesquisáveis foi uma tarefa difícil, muitas vezes exigindo que humanos lessem e reescrevessem as informações à mão. Recentemente, surgiu um novo tipo de programa de computador chamado modelo de linguagem de grande escala. Esses sistemas são treinados em quantidades massivas de texto e podem ler, compreender e resumir a linguagem humana com uma fluência surpreendente. Eles demonstraram que podem responder a perguntas médicas e passar em exames de licenciamento, levando muitos a se perguntarem se também podem ler prontuários de pacientes e extrair os fatos vitais contidos neles automaticamente.
Esta questão não é apenas sobre economizar tempo; é sobre segurança e precisão. Se um computador deve ajudar os médicos a gerenciar o cuidado do paciente, ele deve encontrar a informação correta sem inventar coisas ou perder detalhes críticos. Um novo estudo propôs-se a testar essa capacidade diretamente. Pesquisadores reuniram quase cem prontuários reais de clínicas de otorrinolaringologia e pediram que tanto médicos humanos quanto sete diferentes modelos de linguagem de grande escala os lessem. A tarefa era extrair fatos específicos, como a idade do paciente, seus sintomas, seu diagnóstico e os tratamentos que receberam. Para garantir que todos estivessem falando a mesma língua, os pesquisadores exigiram que cada peça de informação fosse traduzida em um código padronizado usado por hospitais em todo o mundo. Isso permitiu uma comparação precisa de quão bem as máquinas desempenharam em relação aos humanos.
Os resultados revelaram uma lacuna clara entre a expertise humana e a inteligência artificial atual. Quando os quatorze médicos do estudo leram os mesmos registros, eles concordaram entre si sobre as informações extraídas em 81 por cento das vezes. Esse alto nível de concordância mostrou que os médicos estavam interpretando as notas de forma consistente. No entanto, quando os modelos de computador foram comparados aos médicos, a concordância caiu significamente para cerca de 66 por cento. Em outras palavras, as máquinas ainda não eram tão confiáveis quanto os humanos na identificação dos mesmos fatos a partir do mesmo texto. O estudo testou modelos de diferentes tamanhos, desde sistemas massivos com centenas de bilhões de conexões até modelos menores que poderiam rodar em computadores locais. Nenhum deles alcançou o nível de consistência demonstrado pelos profissionais médicos.
O desempenho variou dependendo do tipo de informação que estava sendo extraída. Os modelos foram muito bons em encontrar tratamentos e resultados de testes, que são frequentemente escritos de formas claras e padronizadas. Eles foram menos bem-sucedidos com sinais e diagnósticos, que muitas vezes exigem uma compreensão mais profunda do contexto clínico. Curiosamente, os computadores tenderam a encontrar mais informações do que os médicos, particularmente em relação a fatores de risco. Enquanto os médicos frequentemente focam no problema imediato, os modelos pareciam sinalizar cada possível risco mencionado no texto. Isso sugere que as máquinas não estão apenas copiando o comportamento humano, mas processando o texto de forma diferente, às vezes capturando detalhes que um humano poderia deixar passar, mas também potencialmente sinalizando coisas que não são clinicamente relevantes.
Apesar dessas diferenças, as máquinas mostraram que poderiam ser ferramentas úteis se usadas corretamente. O estudo descobriu que, quando os modelos identificavam uma peça de informação, eles geralmente estavam certos, com uma taxa de precisão de 97 por cento. Isso significa que raramente inventavam fatos que não estavam lá. No entanto, eles perdiam algumas informações cerca de 15 por cento das vezes. Esse padrão aponta para um papel específico para essas ferramentas no futuro: elas são mais adequadas para atuar como uma primeira passagem, escaneando rapidamente os registros para extrair candidatos prováveis para a revisão do médico. A decisão final e a verificação ainda precisariam vir de um humano. Os pesquisadores concluíram que, embora esses modelos sejam poderosos, ainda não estão prontos para trabalhar sozinhos em um ambiente clínico. Eles são melhor vistos como assistentes que podem ajudar a organizar o fluxo de dados médicos, desde que um especialista humano esteja sempre presente para verificar o trabalho deles.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.