← Últimos artículos
🤖 AI

AdaR: A Framework for Equipping LLMs with Adaptive Reasoning

El marco de trabajo AdaR mejora la robustez y la generalización del razonamiento matemático de los modelos de lenguaje extensos mediante el entrenamiento con Aprendizaje por Refuerzo sobre consultas sintéticas automáticas y lógicamente equivalentes para penalizar las correlaciones espurias y fomentar el razonamiento adaptativo.

Autores originales: Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

Publicado 2026-08-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto paisaje de la inteligencia artificial, los grandes modelos de lenguaje han emergido como herramientas poderosas capaces de resolver problemas complejos, desde escribir poesía hasta depurar código. Entre sus logros más impresionantes se encuentra el razonamiento matemático, donde estos sistemas descomponen una pregunta en una serie de pasos lógicos para alcanzar una solución. Durante años, los investigadores han celebrado esta capacidad, asumiendo que cuando un modelo resuelve un problema correctamente, realmente comprende la lógica que hay detrás de él. Sin embargo, una mirada más cercana revela un fallo preocupante: muchos de estos modelos no están razonando realmente a través del problema. En su lugar, a menudo están memorizando patrones de sus datos de entrenamiento. Aprenden a asociar números o frases específicas con ciertas respuestas, de forma muy similar a un estudiante que memoriza la clave de respuestas de un examen de práctica sin comprender la matemática subyacente. Cuando el examen cambia ligeramente —cuando los números son diferentes o la redacción se modifica— estos modelos suelen tropezar, fallando al no poder adaptarse porque su "razonamiento" nunca fue real para empezar.

Este es el desafío central abordado por un nuevo estudio de investigadores de la Universidad de Nanjing y Meituan, quienes han desarrollado un marco llamado AdaR para enseñar a las máquinas a pensar de forma adaptativa. El equipo descubrió que la raíz del problema reside en lo que llaman "razonamiento espurio". Esto ocurre cuando un modelo depende de conexiones superficiales, como el valor específico de un número en una pregunta, en lugar de la lógica estructural del problema en sí. Para ilustrarlo, imagine un modelo entrenado para resolver un problema donde un número se eleva al cubo. Si los datos de entrenamiento siempre usaron el número 3, el modelo podría aprender a simplemente emitir "cubo" cada vez que ve un problema de multiplicación, independientemente de los números reales involucrados. Si el problema cambia para involucrar un número diferente, el modelo falla porque nunca aprendió la regla de elevar al cubo; solo aprendió a reconocer el patrón del número 3. Los investigadores descubrieron que incluso los modelos avanzados, que se desempeñan brillantemente en pruebas estándar, sufren de esta fragilidad, siendo incapaces de generalizar sus habilidades a escenarios nuevos y ligeramente diferentes.

Para solucionar esto, los investigadores crearon un sistema que obliga al modelo a aprender la lógica en lugar de los números. Comenzaron tomando problemas matemáticos existentes y despojándolos hasta su estructura central, o plantilla. Luego, utilizaron un programa informático para generar automáticamente miles de nuevas versiones de estos problemas, cambiando los números específicos pero manteniendo los pasos lógicos exactamente iguales. Crucialmente, no se limitaron a pedirle a un modelo de lenguaje que adivinara las nuevas respuestas; escribieron código ejecutable para calcular las respuestas correctas con absoluta certeza. Esto aseguró que cada nuevo problema creado fuera válido y tuviera una solución verificada. Luego, sometieron a sus modelos a un proceso de entrenamiento riguroso utilizando estos nuevos y variados problemas. En lugar de simplemente mostrarle al modelo la respuesta correcta, utilizaron un método que recompensaba al modelo solo cuando podía resolver el conjunto completo de problemas variados correctamente. Si el modelo dependía de patrones memorizados, fallaría en los nuevos números y recibiría una penalización. Si aprendía la lógica real, tendría éxito en todas las variaciones y recibiría una recompensa.

Los resultados de este enfoque fueron sorprendentes. Al ser probados tanto en tipos de problemas matemáticos familiares como completamente nuevos, los modelos entrenados con este marco adaptativo mostraron mejoras significativas. En promedio, su rendimiento aumentó más de ocho puntos en comparación con otros métodos, una ganancia sustancial en el mundo de la inteligencia artificial. Más importante aún, los modelos se volvieron mucho más robustos. Podían manejar cambios en los números de un problema sin desmoronarse, demostrando que habían aprendido las reglas subyacentes en lugar de solo memorizar ejemplos específicos. Los investigadores también observaron un cambio en cómo los modelos "pensaban". Antes de este entrenamiento, los modelos tendían a enfocarse en los números específicos de una pregunta, ignorando la estructura. Después del entrenamiento, su atención se desplazó hacia la estructura del problema mismo, permitiéndoles tratar las variables desconocidas con el mismo cuidado lógico que los números conocidos. Este cambio sugiere que los modelos estaban desarrollando una forma de pensamiento algebraico, tratando los problemas como sistemas de relaciones en lugar de listas de hechos para ser recordados.

El estudio también exploró cómo diferentes tipos de cambios afectaban el proceso de aprendizaje. Encontraron que cambiar los números en los problemas era mucho más efectivo para enseñar al modelo a razonar que simplemente reescribir las preguntas con diferentes palabras. Esto indica que la clave del razonamiento adaptativo es exponer al modelo a una amplia variedad de escenarios numéricos, forzándolo a confiar en la lógica para navegar las diferencias. Los investigadores notaron que, si bien el método funcionaba bien, tenía límites; requería que los problemas fueran resolubles por un programa informático, lo que significaba que era más adecuado para tareas de matemáticas y lógica en lugar de campos más abstractos como la demostración de teoremas complejos. Además, el éxito del método dependía de que el modelo ya tuviera una base sólida de conocimiento matemático. El sistema no podía enseñar el razonamiento desde cero a un modelo que no sabía nada; solo podía refinar el razonamiento de un modelo que ya poseía los componentes básicos.

En última instancia, este trabajo ofrece un camino claro hacia la creación de una inteligencia artificial más confiable. Al alejarse de la simple memorización y avanzar hacia el razonamiento adaptativo, los investigadores han demostrado que es posible construir modelos que puedan manejar lo inesperado. Los hallazgos sugieren que el futuro de los sistemas inteligentes no radica solo en hacerlos más grandes o más rápidos, sino en enseñarles a comprender las reglas que gobiernan el mundo, en lugar de solo los ejemplos específicos que han visto antes. A medida que estos modelos se integren más en nuestra vida diaria, desde resolver ecuaciones financieras hasta planificar logística compleja, la capacidad de adaptarse a nueva información sin fallar será esencial. El marco AdaR proporciona un plano para lograr esto, convirtiendo a las máquinas frágiles de reconocimiento de patrones en pensadores lógicos y flexibles capaces de navegar en un mundo que cambia constantemente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →