← Últimos artigos
📄 health informatics

Citation reliability of frontier large language models in medical writing and its automated verification

Este estudo revela que, embora os modelos de linguagem de grande escala de fronteira gerem uma proporção significativa de citações médicas não confiáveis — principalmente por meio de má atribuição em vez de fabricação —, um sistema automatizado de Cadeia de Verificação pode detectar esses erros com precisão de nível especialista, oferecendo uma solução viável para garantir a integridade das citações na escrita médica assistida por IA.

Autores originais: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

Publicado 2026-09-04
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Shin, R., Lee, J.-M., Park, J., Kwun, J.-S., Cho, H.-W., Kang, S.-H., Jeon, K.-H.

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

Na prática moderna da medicina, escrever um artigo de pesquisa ou um artigo de revisão é um processo rigoroso que exige precisão absoluta. Os autores devem não apenas sintetizar o conhecimento médico complexo, mas também ancorar cada afirmação a uma fonte específica e existente de evidência. Essas fontes são as citações, que atuam como as pegadas da descoberta científica, apontando os leitores de volta aos estudos originais que sustentam uma nova ideia. Por décadas, esse processo foi um esforio humano, exigindo a verificação cuidadosa de nomes, datas e títulos de periódicos para garantir que uma referência realmente existe e diz o que o autor afirma dizer. No entanto, uma nova ferramenta entrou no laboratório e na biblioteca: o modelo de linguagem de grande escala. Estes são programas de computador poderosos treinados em vastas quantidades de texto que podem redigir artigos, resumir descobertas e gerar listas de referências em segundos. Embora ofereçam uma promessa de velocidade e eficiência, uma questão crítica surgiu: essas máquinas podem ser confiadas para encontrar as pegadas certas, ou elas às vezes as inventam?

Esta questão não é meramente acadêmica; ela atinge o cerne da integridade médica. Se um computador escrever uma revisão médica e incluir uma citação que parece real, mas aponta para o estudo errado, ou pior, para um estudo que nunca existiu, todo o argumento poderá colapsar. Este fenômeno, conhecido como alucinação, tem sido uma fraqueza conhecida de modelos computacionais anteriores. Mas à medida que essas ferramentas evoluíram, tornando-se mais rápidas e equipadas com a capacidade de pesquisar na internet em tempo real, tornou-se incerto se elas finalmente aprenderam a citar corretamente. A comunidade médica precisa saber se esses novos e avançados modelos são confiáveis o suficiente para serem usados em pesquisas sérias e, se não forem, se existe uma maneira prática de detectar seus erros antes que sejam publicados.

Uma equipe de pesquisadores partiu para responder a essas perguntas submetendo três dos modelos de computador mais avançados a um teste rigoroso. Eles pediram a cada modelo que escrevesse uma série de curtas revisões médicas sobre nove tópicos diferentes dentro do campo da cardiologia, o estudo do coração e dos vasos sanguíneos. Os tópicos variavam de condições comuns a procedimentos raros, garantindo uma mistura de assuntos com muitos estudos publicados e assuntos com muito poucos. Cada modelo foi instruído a escrever uma revisão de cerca de 600 a 900 palavras e a incluir exatamente trinta referências para cada artigo, totalizando 270 revisões e mais de 8.000 citações. Crucialmente, os pesquisadores permitiram que os modelos usassem suas ferramentas de busca na web integradas, simulando como um usuário os empregaria de fato em um cenário do mundo real. O objetivo era ver quantas dessas milhares de citações eram realmente corretas.

Os resultados revelaram um cenário de variação significativa e erro persistente. Quando os pesquisadores verificaram cada citação individual contra o banco de dados médico oficial, descobriram que os modelos não eram perfeitos. Um modelo, o GPT-5.5, teve o melhor desempenho, produzindo citações problemáticas em cerca de 11,5 por cento dos casos. No entanto, os outros dois modelos, Claude Opus 4.8 e Gemini 3.5 Flash, cometeram erros em quase 30 por cento de suas citações. Isso significa que, para cada dez referências geradas pelos modelos menos precisos, aproximadamente três eram falhas. Os pesquisadores também investigaram se os modelos tinham mais dificuldades com tópicos que possuíam menos estudos publicados, temendo que a falta de informações disponíveis pudesse confundir o computador. Eles descobriram que, embora as taxas de erro fossem ligeiramente menores para tópicos com mais literatura, a diferença não era forte o suficiente para ser considerada uma regra definitiva. Os modelos cometiam erros em toda parte, independentemente de quanta informação estivesse disponível sobre o assunto.

Talvez a descoberta mais reveladora tenha sido a natureza dos próprios erros. Os pesquisadores esperavam encontrar muitos casos onde o computador simplesmente inventava um artigo falso, uma forma clássica de alucinação. Em vez disso, descobriram que a vasta maioria dos erros era muito mais sutil. Cerca de 77 por cento das citações problemáticas foram casos de erro de atribuição. Nesses casos, o computador fornecia um identificador real e válido para um artigo médico real, mas esse artigo não era aquele que o modelo alegava ser. Era como se o computador tivesse encontrado um livro real em uma biblioteca, mas o tivesse colocado na prateleira errada, rotulando-o com o título de um livro diferente. Este tipo de erro é particularmente perigoso porque parece correto à primeira vista; um leitor humano pode ver um número válido e assumir que a referência é confiável, apenas para descobrir mais tarde que a fonte não sustenta o ponto que está sendo defendido. A verdadeira fabricação, onde o computador inventava um artigo que não existe de forma alguma, foi surpreendentemente rara, representando menos de 1 por cento dos erros.

Reconhecendo que esses erros sutis são difíceis de serem detectados por humanos sem uma verificação sistemática, os pesquisadores testaram um novo método de verificação chamado Cadeia de Verificação (Chain-of-Verification). Esta abordagem utiliza o próprio modelo de computador, mas de uma maneira diferente. Em vez de pedir ao modelo que simplesmente liste referências, o sistema decompõe a tarefa em uma série de perguntas pequenas e independentes. Ele pede ao modelo para encontrar o artigo com base em seu título e autor, depois para verificar se o periódico e o ano coincidem e, finalmente, para confirmar se o identificador aponta para o documento correto. Ao forçar o modelo a verificar cada peça de informação separadamente contra o banco de dados, em vez de confiar em sua memória, o sistema consegue detectar seus próprios erros. Quando os pesquisadores testaram este método contra um conjunto de referências que haviam sido cuidadosamente verificadas por um especialista humano, o sistema automatizado provou ser notavelmente eficaz. Ele identificou corretamente 96,8 por cento das citações problemáticas, incluindo todos os casos de erro de atribuição e fabricação, enquanto raramente sinalizava uma citação correta como erro.

O estudo conclui que, embora a geração mais recente de ferramentas de escrita médica seja poderosa, elas ainda não estão prontas para serem confiadas sem supervisão. A falha mais comum não é a invenção de fatos falsos, mas o rotulamento incorreto de fatos reais, um erro que requer um tipo específico de verificação para ser detectado. Os pesquisadores descobriram que um processo de verificação automatizado pode realizar essa checagem com uma precisão comparável à de um especialista humano. Isso sugere que o futuro da escrita médica assistida por IA não será uma escolha entre humano e máquina, mas uma parceria onde a máquina redige o conteúdo e um sistema de verificação especializado garante que cada citação aponte para a verdade. Até que tal verificação se torne uma prática padrão, as citações geradas por esses modelos devem ser tratadas com cautela, pois podem levar os leitores à fonte errada da verdade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →