← Últimos artículos
💻 computer science

Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions

Este estudio evalúa cinco modelos de lenguaje de gran tamaño en preguntas de oftalmología al estilo del OKAP, revelando que los modelos de propósito general, particularmente Gemini-Pro-3, superaron a la herramienta de IA clínica especializada OpenEvidence en precisión y calibración, al tiempo que resaltan una heterogeneidad de rendimiento significativa y fallos de razonamiento compartidos en todos los sistemas.

Autores originales: Alon Moore Galindo, Amit Ginsberg, Razan Saadi, Tomer Kerman, David Schwartzman, Anat Loewenstein, Igal Leibovitch

Publicado 2026-07-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Alon Moore Galindo, Amit Ginsberg, Razan Saadi, Tomer Kerman, David Schwartzman, Anat Loewenstein, Igal Leibovitch

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un examen médico de alto nivel para doctores de ojos, conocido como el OKAP. Ahora, imagina a cinco diferentes programas informáticos "superinteligentes" intentando realizar este examen. El objetivo de este estudio era ver qué programa informático es el mejor respondiendo estas complicadas preguntas de doctores de ojos y, de manera igual de importante, cuál sabe cuándo podría estar equivocado.

Aquí está el desglose de lo que sucedió, utilizando algunas analogías de la vida cotidiana:

Los Concursantes

Los investigadores alinearon a cinco diferentes estudiantes de IA:

  1. OpenEvidence: Un estudiante especializado que solo estudia libros de texto médicos y tiene una línea directa con las famosas revistas médicas. Piensa en esto como un bibliotecario médico que se ha memorizado la biblioteca, pero no tiene un cerebro general para todo lo demás.
  2. Gemini-Pro-3, Claude-Opus-4.6, ChatGPT-5.4-Pro y DeepSeek-v3.2: Estos son estudiantes de "propósito general". Leen desde recetas de cocina hasta artículos de física. Piensa en ellos como polímatas: personas que saben un poco de muchas cosas.

La Prueba

La prueba consistió en 659 preguntas de opción múltiple sobre salud ocular. No eran simples datos curiosos; variaban desde hechos sencillos (como "¿Cuál es el nombre de esta parte del ojo?") hasta escenarios complejos que requerían un razonamiento profundo (como "Si un paciente tiene el síntoma X y el historial Y, ¿cuál es el mejor tratamiento?").

Los Resultados: ¿Quién Ganó?

Los resultados fueron sorprendentes para algunos expertos:

  • El Campeón: Gemini-Pro-3 (el estudiante de propósito general) obtuvo la puntuación más alta, respondiendo correctamente el 95.8% de las preguntas. Fue tan bueno que superó a todos los demás por un margen significativo.
  • El Segundo Lugar: Claude-Opus-4.6 (otro estudiante de propósito general) quedó en segundo lugar.
  • El Especialista: OpenEvidence (el bibliotecario médico) quedó en tercer lugar. Lo hizo muy bien (88%), pero no venció a los estudiantes de propósito general. De hecho, los estudiantes generales superaron al especialista.
  • El Resto: ChatGPT y DeepSeek siguieron después, siendo DeepSeek el que obtuvo la puntuación más baja (73.7%).

La Gran Conclusión: Tener una herramienta construida específicamente para la medicina no garantizó que fuera la más inteligente al responder preguntas médicas. La IA de propósito general fue en realidad mejor en este examen específico.

La Verificación de la "Confianza"

Los investigadores también le preguntaron a la IA: "¿Qué tan seguro estás de que tu respuesta es correcta?" (En una escala de 0 a 100). Esto es como pedirle a un estudiante que levante la mano si tiene un 100% de confianza.

  • El Estudiante con Mejor "Autoconciencia": Gemini-Pro-3 fue el más honesto. Cuando decía que estaba seguro, generalmente tenía razón. Su confianza coincidía perfectamente con su desempeño real.
  • El "Excesivamente Confiado" vs. el "Poco Confiado": Algunos otros modelos fueron buenos para saber cuándo estaban en lo cierto (discriminación), pero no tan buenos para hacer que su nivel de confianza coincidiera con su precisión real (calibración).
  • La Señal de Alerta: Un modelo, DeepSeek, fue terrible en esto. A menudo decía que estaba seguro cuando en realidad estaba equivocado, o inseguro cuando estaba en lo cierto. Esto es peligroso porque si un médico confía en una respuesta segura pero errónea, podría conducir a errores.

¿Dónde Fallaron Todos?

Los investigadores analizaron las 9 preguntas que todos los modelos de IA respondieron mal. Intentaron averiguar por qué.

  • Lo que hicieron bien: Entendieron las palabras y el tema básico.
  • Donde fallaron: Fallaron en el razonamiento complejo y en verificar sus fuentes.
    • Analogía: Imagina a un estudiante que puede leer una pregunta perfectamente, pero se pierde cuando tiene que conectar tres hechos diferentes para resolver un rompecabezas. O bien, pueden adivinar una respuesta sin realmente verificar si el libro de reglas la respalda.
    • La IA tuvo más dificultades con preguntas que requerían "pasos de pensamiento" en lugar de simplemente recordar un dato.

Las Limitaciones (La Letra Pequeña)

Los autores fueron cuidadosos al decir lo que este estudio no demostró:

  • Sin Imágenes: La prueba fue solo de texto. En el cuidado ocular real, los doctores miran fotos de los ojos. Ninguna de estas IA fue probada analizando imágenes durante este estudio.
  • No Son Pacientes Reales: Estos eran preguntas de examen, no pacientes de la vida real con historiales complicados y desordenados.
  • Prueba de Una Sola Vez: La IA tomó el examen una vez. Si se le preguntara de nuevo, podría dar una respuesta diferente.

Resumen

En términos simples: La IA de propósito general está superando actualmente a la IA médica especializada al responder preguntas de exámenes para doctores de ojos. Sin embargo, la IA todavía tiene dificultades con las tareas de razonamiento más difíciles y complejas. Además, el hecho de que una IA dé una puntuación alta no significa que sea segura para usarse a ciegas; es necesario verificar si sabe cuándo no está segura. El estudio sugiere que, por ahora, debemos ser cuidadosos al usar estas herramientas para decisiones médicas reales hasta que sepamos más sobre cómo manejan la complejidad del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →