← Últimos artigos
💻 computer science

Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions

Este estudo avalia cinco modelos de linguagem de grande escala em questões de oftalmologia no estilo OKAP, revelando que modelos de propósito geral, particularmente o Gemini-Pro-3, superaram a ferramenta de IA clínica especializada OpenEvidence em precisão e calibração, ao mesmo tempo em que destacou uma heterogeneidade de desempenho significativa e falhas de raciocínio compartilhadas entre todos os sistemas.

Autores originais: Alon Moore Galindo, Amit Ginsberg, Razan Saadi, Tomer Kerman, David Schwartzman, Anat Loewenstein, Igal Leibovitch

Publicado 2026-07-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Alon Moore Galindo, Amit Ginsberg, Razan Saadi, Tomer Kerman, David Schwartzman, Anat Loewenstein, Igal Leibovitch

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um exame médico de alto nível para médicos oftalmologistas, conhecido como o OKAP. Agora, imagine cinco programas de computador "superinteligentes" diferentes tentando fazer esse teste. O objetivo deste estudo foi ver qual programa de computador é o melhor em responder a essas perguntas complicadas de médicos de olhos e, tão importante quanto isso, qual deles sabe quando pode estar errado.

Aqui está o detalhamento do que aconteceu, usando algumas analogias do cotidiano:

Os Competidores

Os pesquisadores alinharam cinco diferentes "alunos" de IA:

  1. OpenEvidence: Um aluno especializado que estuda apenas livros didáticos de medicina e tem uma linha direta com revistas médicas famosas. Pense nisso como um bibliotecário médico que memorizou a biblioteca, mas não tem um cérebro geral para todo o resto.
  2. Gemini-Pro-3, Claude-Opus-4.6, ChatGPT-5.4-Pro e DeepSeek-v3.2: Estes são alunos de "propósito geral". Eles leem de tudo, desde receitas de culinária até artigos de física. Pense neles como polímatas — pessoas que sabem um pouco sobre muita coisa.

O Teste

O teste consistiu em 659 questões de múltipla escolha sobre saúde ocular. Não eram curiosidades fáceis; elas variavam desde fatos simples (como "Qual é o nome desta parte do olho?") até cenários complexos que exigiam raciocínio profundo (como "Se um paciente tem o sintoma X e o histórico Y, qual é o melhor tratamento?").

Os Resultados: Quem Venceu?

Os resultados foram surpreendentes para alguns especialistas:

  • O Campeão: Gemini-Pro-3 (um aluno de propósito geral) obteve a pontuação mais alta, respondendo corretamente 95,8% das questões. Ele foi tão bom que superou todos os outros por uma margem significativa.
  • O Vice-Campeão: Claude-Opus-4.6 (outro aluno de propósito geral) ficou em segundo lugar.
  • O Especialista: OpenEvidence (o bibliotecário médico) ficou em terceiro. Ele foi muito bem (88%), mas não venceu os alunos de propósito geral. Na verdade, os alunos gerais superaram o especialista.
  • O Resto: ChatGPT e DeepSeek seguiram o ranking, com o DeepSeek obtendo a pontuação mais baixa (73,7%).

A Grande Conclusão: Ter uma ferramenta construída especificamente para a medicina não garantiu que ela seria a mais inteligente ao responder perguntas médicas. A IA de propósito geral foi, na verdade, melhor neste teste específico.

O Teste de "Confiança"

Os pesquisadores também perguntaram à IA: "O quanto você tem certeza de que sua resposta está correta?" (Em uma escala de 0 a 100). Isso é como pedir a um aluno que levante a mão se estiver 100% confiante.

  • O Aluno com Melhor "Autoconsciência": Gemini-Pro-3 foi o mais honesto. Quando dizia que estava confiante, geralmente estava certo. Sua confiança correspondia perfeitamente ao seu desempenho real.
  • O "Excesso de Confiança" vs. "Falta de Confiança": Alguns outros modelos foram bons em saber quando estavam certos (discriminação), mas não tão bons em combinar seu nível de confiança com sua precisão real (calibração).
  • O Sinal de Alerta: Um modelo, o DeepSeek, foi terrível nisso. Ele frequentemente dizia que estava confiante quando estava errado, ou inseguro quando estava certo. Isso é perigoso porque, se um médico confiar em uma resposta confiante, porém errada, isso pode levar a erros.

Onde Todos Falharam?

Os pesquisadores observaram as 9 questões que todos os IAs erraram. Eles tentaram descobrir o porquê.

  • O que acertaram: Eles entenderam as palavras e o tópico básico.
  • Onde falharam: Eles falharam no raciocínio complexo e na verificação de suas fontes.
    • Analogia: Imagine um aluno que consegue ler uma pergunta perfeitamente, mas se perde quando precisa conectar três fatos diferentes para resolver um quebra-cabeça. Ou, eles podem adivinhar uma resposta sem realmente verificar se o livro de regras a suporta.
    • A IA teve mais dificuldade com questões que exigiam "etapas de pensamento" em vez de apenas memorizar um fato.

As Limitações (A Letra Miúda)

Os autores foram cuidadosos ao dizer o que este estudo não provou:

  • Sem Imagens: O teste foi apenas de texto. Na atenção oftalmológica real, os médicos olham para fotos de olhos. Nenhuma dessas IAs foi testada na análise de imagens durante este estudo.
  • Não São Pacientes Reais: Eram questões de exame, não pacientes reais com históricos complicados e desorganizados.
  • Teste Único: A IA fez o teste uma única vez. Se você a questionasse novamente, ela poderia dar uma resposta diferente.

Resumo

Em termos simples: A IA de propósito geral está atualmente vencendo a IA médica especializada em responder perguntas de exames de oftalmologia. No entanto, a IA ainda tem dificuldades com as tarefas de raciocínio mais difíceis e complexas. Além disso, só porque uma IA apresenta uma pontuação alta, não significa que ela seja segura para uso imediato; você precisa verificar se ela sabe quando não tem certeza. O estudo sugere que, por enquanto, devemos ser cautelosos ao usar essas ferramentas para decisões médicas reais até que saibamos mais sobre como elas lidam com a complexidade do mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →