← Últimos artículos
💻 computer science

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

Este estudio evalúa seis modelos de visión y lenguaje en imágenes reales de heridas y encuentra que los sistemas de propósito general como ChatGPT y Claude superan significativamente a los modelos especializados médicamente en la evaluación clínica de heridas, aunque todos los modelos aún enfrentan limitaciones sustanciales en su fiabilidad autónoma.

Autores originales: Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

Publicado 2026-06-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un grupo de seis diferentes "detectives digitales". Su trabajo es observar fotos de 20 tipos diferentes de heridas abiertas (como cortes, llagas o sitios quirúrgicos) y responder 12 preguntas específicas sobre ellas, tales como: "¿Está infectada?", "¿Necesitamos cirugía?" o "¿Qué tipo de vendaje deberíamos usar?".

Los investigadores querían ver qué detective era el mejor resolviendo estos acertijos médicos. Enfrentaron a dos tipos de detectives entre sí:

  1. Los Generalistas: Chatbots de IA famosos y poderosos (como ChatGPT y Claude) que saben un poco de todo, incluyendo medicina.
  2. Los Especialistas: Modelos de IA creados específicamente para médicos (como HuluMed y MedGemma) que fueron entrenados únicamente con libros de texto y datos médicos.

Esto es lo que pasó cuando realizaron la prueba:

Los Resultados de la Carrera

Los Generalistas ganaron la carrera por una diferencia abrumadora.

  • ChatGPT fue el mejor puntuado, acertando aproximadamente el 73% de las respuestas.
  • Claude quedó en segundo lugar con aproximadamente un 62%.

Los Especialistas tuvieron dificultades significativas.

  • HuluMed (el mejor del grupo de especialistas) solo acertó el 40%.
  • Las otras IA médicas (MedGemma y Gemma 3) puntuaron incluso más bajo, con una de ellas obteniendo menos del 18% de aciertos.

El "Porqué" de las Puntuaciones

El artículo explica este sorprendente resultado con algunas ideas clave:

1. El "Aprendiz de todo" frente al "Experto limitado"
Piensa en las IA Generalistas como una navaja suiza. Han visto millones de imágenes y conversaciones diferentes. Cuando miran una herida, utilizan su experiencia masiva y amplia para comprender el contexto.
Las IA Especialistas son como un destornillador diseñado solo para un tipo específico de tornillo. Aunque conocen muchos términos médicos, parecen confundirse cuando tienen que mirar una foto real y desordenada y decidir qué hacer al respecto. El artículo sugiere que ser entrenado con una gran variedad de datos ayuda a estos modelos a entender mejor el "panorama general" que el ser entrenado solo con datos médicos.

2. Ver frente a Decidir
Los detectives eran buenos viendo cosas. La mayoría podía identificar correctamente si una herida se veía roja (infectada) o si tenía tejido muerto (necrosis).
Sin embargo, eran terribles decidiendo. Cuando se les preguntaba: "¿Deberíamos cortar esto?" o "¿Necesitamos una resonancia magnética?", las IA Especialistas a menudo daban respuestas vagas y vacilantes o sugerían el procedimiento incorrecto.

  • Analogía: Es como un estudiante que puede describir perfectamente el motor de un coche, pero falla cuando se le pide que realmente conduzca el coche hasta su destino.

3. El Problema de la "Indecisión" (Waffling)
Los investigadores dieron a las IA una regla de calificación estricta: Debes dar una respuesta clara de "Sí" o "No". Si dices: "Podría estar infectada, pero tal vez no", obtienes cero puntos.
Las IA Especialistas amaban la "indecisión". Decían cosas como: "Es posible que se necesite una intervención, dependiendo de los signos clínicos". Aunque esto suena cuidadoso y seguro, la prueba lo marcó como incorrecto porque no era una decisión clara. Las IA Generalistas eran más directas y seguras en sus respuestas.

La Gran Conclusión

El artículo concluye que, en este momento, si necesitas que una IA observe la foto de una herida y ayude a un médico a trazar un plan, los chatbots de propósito general son actualmente mejores que los de uso médico específico.

Sin embargo, hay una gran etiqueta de advertencia adjunta a este resultado. El artículo dice que estas herramientas de IA no están listas para trabajar solas. Son como un pasante muy inteligente que puede ayudar a un médico a organizar sus pensamientos, pero todavía cometen errores. Los médicos siempre deben verificar el trabajo de la IA antes de tomar cualquier decisión médica real.

En resumen: Las IA de "conocimiento general" son actualmente mejores resolviendo acertijos de heridas que las IA de "escuela de medicina", pero ninguna es lo suficientemente perfecta como para reemplazar a un médico humano todavía.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →