← Últimos artículos
💻 computer science

Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison

Este estudio demuestra que la utilización de la inferencia de razonamiento extendido mejora significativamente la precisión de GPT-5 en las preguntas del Examen de Entrenamiento en Ortopedia en comparación con el modo estándar, aunque la persistencia de errores confiables sugiere que estos modelos deberían servir como adjuntos supervisados en lugar de recursos de estudio primarios para los residentes.

Autores originales: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

Publicado 2026-09-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Cada año, miles de residentes de cirugía ortopédica en los Estados Unidos se enfrentan a un riguroso examen para medir sus conocimientos sobre huesos, articulaciones y músculos. Esta prueba, conocida como el Examen de Entrenamiento Interno de Ortopedia, es un punto de control crítico en su formación, ayudando a los directores de programas a decidir si un residente está listo para convertirse en un cirujano certificado por la junta. En años recientes, estos estudiantes han recurrido cada vez más a herramientas de inteligencia artificial para ayudarles a estudiar. Estas herramientas, llamadas modelos de lenguaje extensos, son programas informáticos entrenados con vastas cantidades de texto que pueden responder preguntas, explicar ideas complejas e incluso imitar el estilo de un libro de texto médico. Se han vuelto tan capaces que a menudo pueden aprobar exámenes médicos ellos mismos. Sin embargo, una pregunta crucial permanecía sin respuesta: ¿cambia la forma en que un estudiante le pide a la computadora que piense la calidad de la respuesta? Específicamente, ¿producir mejores resultados el forzar a la computadora a hacer una pausa y razonar un problema paso a paso antes de hablar que pedirle que responda inmediatamente?

Un equipo de investigadores se propuso encontrar la respuesta sometiendo a un único y avanzado modelo de inteligencia artificial a una serie de pruebas utilizando las preguntas reales del examen de ortopedia de 2024. No compararon diferentes marcas de programas informáticos entre sí. En su lugar, utilizaron el mismo programa dos veces para cada pregunta. Primero, le pidieron al modelo que respondiera en su modo estándar, donde genera una respuesta rápidamente. Luego, le hicieron al mismo modelo exactamente la misma pregunta, pero esta vez lo cambiaron a un modo de "razonamiento extendido". En este segundo ajuste, se le instruye a la computadora a dedicar más tiempo a desglosar internamente el problema, sopesar la evidencia y reflexionar sobre la lógica antes de que siquiera escriba una respuesta final. Los investigadores querían ver si este esfuerzo mental adicional, que toma aproximadamente un minuto más por pregunta, realmente haría a la computadora más inteligente.

Los resultados fueron impactantes. Cuando el modelo respondió en su modo estándar y rápido, acertó el 79 por ciento de las preguntas. Esta puntuación ya era impresionante, situando el rendimiento de la computadora aproximadamente al nivel de un residente sénior que ha estado en formación durante cinco años. Pero cuando los investigadores cambiaron el modelo al modo de razonamiento extendido, la precisión saltó al 93 por ciento. Este no fue un caso de la computadora teniendo suerte en algunas preguntas y mala suerte en otras. Los datos mostraron un patrón claro: cada pregunta que la computadora acertó en el modo rápido, también la acertó en el modo lento. La mejora provino enteramente de las preguntas que anteriormente había fallado; en el modo extendido, corrigió casi todos sus errores. Los investigadores encontraron que este aumento en el rendimiento ocurrió en casi todas las áreas de la cirugía ortopédica, desde lesiones de mano hasta afecciones de la columna, y no importaba si la pregunta incluía una imagen de una radiografía o era solo texto.

A pesar de esta mejora dramática, el estudio reveló una advertencia sutil pero importante para cualquiera que utilice estas herramientas. Incluso cuando la computadora se equivocaba, sonaba igual de segura de sí misma que cuando acertaba. En los pocos casos donde el modelo todavía daba una respuesta incorrecta, incluso después de pensar profundamente, no dudaba ni expresaba duda. Proporcionaba una explicación detallada e incluso citaba literatura médica para respaldar su elección errónea, haciendo que el error sonara autoritario. Los investigadores señalaron que si un estudiante no sabe ya la respuesta correcta, podría ser fácilmente engañado por esta falsa confianza. La computadora también es capaz de ser engañada; si un usuario sugiere una idea errónea, el modelo a menudo la aceptará y construirá una explicación detallada y segura alrededor de ese error.

El estudio concluye que, si bien estas herramientas de inteligencia artificial son poderosas, no son reemplazos perfectos para los maestros humanos o los materiales de estudio verificados. Los investigadores sugieren que, para los estudiantes que utilizan estas herramientas, el mejor enfoque es usar siempre el ajuste de razonamiento extendido, ya que el minuto adicional de tiempo de pensamiento aumenta significamente la probabilidad de una respuesta correcta. Sin embargo, el resultado debe tratarse siempre como un borrador que necesita verificación. La computadora es una asistente útil para organizar planes de estudio o resumir conceptos, pero aún no puede ser confiada para juzgar su propia exactitud. Los hallazgos muestran que la forma en que interactuamos con estas máquinas importa tanto como las máquinas mismas; un simple cambio en la configuración puede convertir una buena respuesta en una gran respuesta, pero no puede eliminar la necesidad de la supervisión humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →