← Últimos artigos
💬 NLP

Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

Este artigo avalia a capacidade de doze modelos de linguagem de grande escala de gerar respostas clínicas verificáveis ao anexar citações literais a afirmações fatuais, revelando que, embora a maioria dos modelos consiga anexar citações a mais de 90% das afirmações, essas citações frequentemente falham em substanciar plenamente os detalhes das afirmações que acompanham.

Autores originais: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

Publicado 2026-09-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo de alto risco da medicina moderna, o tempo é frequentemente o recurso mais escasso. Quando um médico enfrenta um caso clínico complexo, ele precisa de respostas que sejam não apenas precisas, mas também instantaneamente confiáveis. Durante anos, a inteligência artificial prometeu ajudar, oferecendo sintetizar vastas quantidades de literatura médica em conselhos claros e legíveis. No entanto, um problema persistente tem assombrado essas ferramentas: a tendência de inventar fatos, uma falha conhecida como "alucinação". Em um campo onde um único erro pode prejudicar um paciente, um médico não pode simplesmente confiar na palavra de um computador. Ele deve ser capaz de verificar a fonte de cada afirmação. Tradicionalmente, quando uma IA fornece uma resposta com uma citação, essa citação geralmente aponta para um documento amplo, como uma diretriz médica inteira ou um artigo de pesquisa. Isso força o clínico ocupado a vasculhar centenas de páginas para encontrar a frase específica que sustenta a afirmação, um processo que anula o propósito de ter um assistente eficiente. O objetivo, então, é construir sistemas que não apenas apontem para uma fonte, mas que provem seu trabalho mostrando as palavras exatas dessa fonte logo ao lado da resposta.

Uma equipe de pesquisadores da Universidade Johns Hopkins partiu para testar se os modelos atuais de inteligência artificial poderiam realmente fazer isso. Eles construíram um sistema especializado projetado para responder a questões clínicas usando quatro grandes diretrizes médicas que abrangem doenças cardíacas, pressão arterial, colesterol e diabetes. Em vez de deixar os modelos simplesmente resumirem informações, os pesquisadores instruíram-nos a construir suas respostas frase por frase, anexando uma citação direta, palavra por palavra, da diretriz original a cada afirmação factual que fizessem. Para ver se isso funcionava, eles criaram uma estrutura de teste rigorosa que atuava como um auditor digital. Este sistema decompunha cada resposta em seus componentes de afirmação e as verificava contra três padrões específicos: primeiro, o modelo anexou uma citação à afirmação? Segundo, a citação anexada era uma cópia exata e literal do texto na diretriz original, sem alterações ou paráfrases? E terceiro, aquela citação específica continha informação suficiente para provar que a afirmação era verdadeira, sem que o leitor precisasse procurar em outro lugar?

Os pesquisadores testaram doze modelos de linguagem de grande escala diferentes, variando de sistemas poderosos e complexos a outros menores e mais rápidos, utilizando 222 questões clínicas sintéticas derivadas das diretrizes. Os resultados revelaram uma lacuna significativa entre o que esses modelos podem fazer e o que é exigido para uma confiabilidade real. A maioria dos modelos avançados foi surpreendentemente boa nos dois primeiros passos. Eles conseguiram anexar citações a mais de 90 por cento de suas afirmações e, em muitos casos, as citações fornecidas eram correspondências exatas ao texto da fonte. No entanto, o sistema falhou dramaticamente no passo final, o mais crítico: provar a afirmação. Embora um modelo possa fornecer uma citação perfeita, essa citação frequentemente falhava em sustentar todo o peso da declaração feita pelo modelo. Por exemplo, um modelo pode citar uma frase dizendo que um medicamento é "preferível" para um grupo específico, mas então usar essa citação para apoiar uma afirmação mais ampla de que o medicamento é "obrigatório" para todos. Em um caso notável, um modelo de alto nível chamado Claude Opus 5 conseguiu anexar uma citação literal a 98 por cento de suas afirmações, mas apenas 37,1 por cento dessas afirmações foram totalmente substanciadas pelas citações isoladamente. As citações estavam lá, e eram precisas, mas eram insuficientes para provar o ponto.

O estudo também destacou que o tamanho e o tipo do modelo importavam muito. Modelos menores e leves frequentemente falhavam em anexar citações às suas afirmações ou forneciam citações que não eram cópias exatas do texto original, fazendo com que suas taxas de verificação despencassem. Um dos menores modelos testados, o Claude Haiku, conseguiu sustentar plenamente apenas cerca de 25 por cento de suas afirmações. Em contraste, os maiores modelos tiveram um desempenho muito melhor, com os melhores sistemas sustentando cerca de 75 por cento de suas afirmações com evidências exatas e suficientes. Os pesquisadores descobriram que a razão principal para a falha não era que os modelos estavam mentindo ou inventando coisas, mas sim que estavam lutando para selecionar a evidência correta. Eles frequentemente pegavam uma citação que era relacionada ao tópico, mas que não continha os detalhes específicos necessários para respaldar toda a frase. Para testar se a evidência estava de fato disponível, os pesquisadores pediram a uma IA separada que buscasse nos documentos originais as citações que teriam apoiado plenamente as afirmações. Eles descobriram que, para muitos modelos, a evidência ausente estava ali mesmo no texto que eles já haviam lido; os modelos simplesmente falharam em extrair e anexar as peças corretas.

Em última análise, este trabalho demonstra que, embora a inteligência artificial esteja se tornando cada vez mais capaz de recuperar e formatar informações médicas, ela ainda não está pronta para ser totalmente confiada sem supervisão humana em um ambiente clínico. A capacidade de gerar uma resposta fluente é distinta da capacidade de construir uma resposta verificável. O estudo mostra que os modelos atuais podem frequentemente fornecer a matéria-prima para a verificação, mas frequentemente falham em montá-las em uma prova completa e autossuficiente. O caminho a seguir exige sistemas que não apenas citem fontes, mas que garantam que cada palavra de seu conselho seja respaldada por uma peça de evidência específica, suficiente e inalterada das diretrizes originais. Até que os modelos possam consistentemente preencher a lacuna entre ter uma citação e provar um ponto, a responsabilidade pela verificação permanecerá firmemente nas mãos do clínico humano.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →