← Últimos artículos
💬 NLP

Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models

Este estudio revela que, aunque los modelos de lenguaje grandes más avanzados muestran un rendimiento superior en preguntas de gastroenterología, todos exhiben una tendencia consistente a la sobreconfianza, lo que plantea un desafío crítico para su aplicación segura en el ámbito sanitario.

Autores originales: Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage, Zahra Atf, Peter Lewis, Girish Nadkarni, Ali Soroush

Publicado 2026-04-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage, Zahra Atf, Peter Lewis, Girish Nadkarni, Ali Soroush

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

🩺 El Examen de Gastroenterología: ¿Cuánto se creen los "chicos inteligentes"?

Imagina que tienes un grupo de estudiantes geniales (los Modelos de Lenguaje o IA) que han leído casi todo internet. Ahora, los ponemos a un examen de medicina muy difícil, específicamente sobre el sistema digestivo (gastroenterología), con 300 preguntas de opción múltiple que suelen usar los doctores para certificarse.

El objetivo del estudio no era solo ver qué tan bien respondían las preguntas, sino algo más importante: ¿Se dan cuenta de cuándo no saben la respuesta?

1. La Trampa de la "Seguridad Exagerada"

En este examen, a cada estudiante se le pidió que, después de responder, dijera: "¿Qué tan seguro estás de tu respuesta?" en una escala del 0 al 10.

  • Lo que esperábamos: Que si un estudiante acertaba, dijera "¡Estoy muy seguro (10/10)!" y si fallaba, dijera "Bueno, no estoy muy seguro (3/10)".
  • Lo que pasó: ¡Todos los estudiantes, incluso los más inteligentes, mintieron sobre su seguridad!
    • Cuando acertaban, decían "¡Estoy 100% seguro!".
    • Pero cuando fallaban (daban una respuesta incorrecta), ¡también decían "¡Estoy 100% seguro!" con la misma voz firme!

Es como si un estudiante que no sabe nada de matemáticas levantara la mano y gritara con total confianza: "¡La respuesta es 5!", cuando en realidad la respuesta es 7. En medicina, esto es peligroso porque un doctor podría confiar ciegamente en una IA que está equivocada pero suena muy segura.

2. Los "Estudiantes" Analizados

Los investigadores probaron a 48 estudiantes diferentes. Algunos eran los más famosos y caros (como GPT-4 o Claude), otros eran de código abierto (como Llama o Mistral) y algunos eran versiones más pequeñas y rápidas.

  • Los mejores: Los modelos más nuevos y potentes (como GPT-o1 o Claude 3.5) acertaron más preguntas (hasta un 81% de aciertos). ¡Fueron los mejores del salón!
  • El problema: Aunque acertaron más, siguieron siendo igual de arrogantes. Incluso cuando se equivocaron, seguían diciendo que estaban muy seguros. Ninguno de ellos logró ser un "buen juez" de sus propios errores.

3. La Analogía del "GPS Confundido"

Imagina que usas un GPS para llegar a un hospital.

  • Un buen GPS: Si se equivoca de ruta, te dice: "Oye, creo que me equivoqué, hay tráfico, mejor toma otra calle".
  • La IA de este estudio: Es como un GPS que, aunque te está llevando al desierto en lugar del hospital, sigue gritando con voz de locutor de radio: "¡Estamos en la ruta perfecta! ¡Sigue recto con total confianza!".

El estudio descubrió que, aunque los modelos han mejorado mucho en saber qué decir, siguen siendo pésimos en saber cuándo callarse o pedir ayuda.

4. ¿Por qué es importante esto?

Si un médico usa esta IA para diagnosticar a un paciente y la IA dice: "Estoy 100% seguro de que es una úlcera" (cuando en realidad es algo más grave), el médico podría confiar en ella y cometer un error grave.

La conclusión del estudio es clara: Hasta ahora, la IA médica es como un actor muy talentoso que sabe recitar el guion perfecto, pero no sabe cuándo el guion está mal escrito.

5. El Futuro

Los investigadores dicen que no debemos usar estas IAs para tomar decisiones médicas críticas todavía, a menos que aprendan a decir: "No estoy seguro, por favor consulta a un humano".

Es como si estuviéramos entrenando a estos robots para que, en lugar de presumir de lo que saben, aprendan a reconocer sus propios límites. Mientras tanto, la mejor regla es: Confía en la IA, pero siempre verifica con un doctor real.


En resumen:
Las IAs son muy listas para responder preguntas de medicina, pero son demasiado seguras de sí mismas, incluso cuando se equivocan. Necesitan aprender a dudar un poco más para poder ser verdaderamente útiles y seguras en los hospitales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →