← Últimos artículos
🤖 AI

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

El artículo presenta CEDAR-GRPO, un marco de aprendizaje por refuerzo consciente del proceso que mejora el razonamiento abductivo general en modelos de lenguaje de gran tamaño al combinar la corrección de la respuesta final con recompensas abductivas, logrando mejoras significativas de rendimiento en 11 tareas no vistas en comparación tanto con los modelos base como con el entrenamiento basado únicamente en la corrección.

Autores originales: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto paisaje de la inteligencia artificial, los investigadores intentan constantemente enseñar a las máquinas cómo pensar como los humanos, no solo cómo predecir la siguiente palabra en una oración. Una de las formas más humanas de pensar se llama razonamiento abductivo. Este es el proceso mental de observar un conjunto de pistas u observaciones y trabajar hacia atrás para encontrar la explicación más probable para ellas. Es cómo un médico descubre qué le sucede a un paciente basándose en unos pocos síntomas, cómo un detective reconstruye un crimen a partir de evidencia dispersa, o cómo un ingeniero diagnostica una máquina que ha dejado de funcionar repentinamente. Durante mucho tiempo, los científicos han luchado para lograr que los grandes modelos de lenguaje hagan esto bien. Si bien estos modelos son excelentes para recordar hechos o seguir reglas lógicas estrictas, a menudo tropiezan cuando se les pide que infieran causas ocultas a partir de información incompleta. Tienden a adivinar la respuesta correcta por las razones equivocadas, o inventan hechos que suenan plausibles pero que en realidad no encajan con la evidencia proporcionada.

Un equipo de investigadores de la Universidad Tecnológica de Sharif y la Universidad de Teherán se propuso resolver este problema. Querían saber si podían entrenar a estos modelos de IA para que fueran mejores en el razonamiento abductivo de una manera que les ayudara a resolver problemas nuevos y no vistos, en lugar de simplemente memorizar los acertijos específicos con los que fueron entrenados. Desarrollaron un nuevo método de entrenamiento llamado CEDAR-GRPO. En lugar de simplemente recompensar al modelo por acert la respuesta final correctamente, diseñaron un sistema que también recompensa al modelo por cómo llegó a ella. El sistema verifica dos cosas específicas sobre el proceso de pensamiento del modelo: primero, si el modelo realmente observó y explicó cada uno de los detalles en la evidencia proporcionada, y segundo, si el modelo movió su razonamiento en la dirección correcta, comenzando desde las observaciones y construyendo hacia una conclusión, en lugar de comenzar con una conclusión e intentar forzar la evidencia para que encajara con ella.

Para probar esto, los investigadores tomaron cuatro modelos de lenguaje de código abierto diferentes y los entrenaron en un conjunto de tareas cuidadosamente mezcladas. Estas tareas incluían desde elegir la mejor explicación para una historia corta hasta escribir código que explique un patrón en los datos. Crucialmente, no solo les mostraron a los modelos las respuestas; utilizaron una técnica de aprendizaje por refuerzo que actuaba como un entrenador, dando a los modelos retroalimentación sobre sus pasos de razonamiento. Los modelos aprendieron que una respuesta correcta no era suficiente si habían ignorado un detalle clave o si su lógica era hacia atrás. Después de este entrenamiento, los investigadores probaron los modelos en once tareas completamente diferentes que nunca habían visto antes. Estas nuevas tareas variaban desde diagnosticar condiciones médicas y depurar código de computadora hasta resolver misterios complejos y comprender historias largas y complicadas.

Los resultados mostraron una mejora clara en todos los ámbitos. Los modelos entrenados con el nuevo método superaron tanto a sus versiones originales como a los modelos que fueron entrenados solo para acert la respuesta final correctamente. En promedio, el nuevo método mejoró el rendimiento en 7.4 puntos porcentuales sobre los modelos originales y en 2.7 puntos sobre los modelos entrenados solo para la corrección. En algunos casos específicos, la mejora fue tan alta como 30.8 puntos. Más importante aún, los investigadores analizaron el texto real que los modelos escribieron mientras pensaban. Encontraron que los modelos entrenados se comportaban más como investigadores cuidadosos. Eran más propensos a explorar diferentes posibilidades antes de establecer una respuesta, a descartar explícitamente ideas erróneas y a admitir cuando tenían incertidumbre. También mostraron un hábito mucho más fuerte de vincular sus conclusiones directamente de vuelta a los hechos específicos que se les dieron, en lugar de confiar en suposiciones vagas.

El estudio también descartó varias explicaciones alternativas para este éxito. Los investigadores demostraron que la mejora no provino simplemente de que los modelos vieran más ejemplos o de un aumento general en la capacidad de razonamiento. Cuando entrenaron los modelos con una cantidad similar de datos de razonamiento general que no se centraban en tareas abductivas, los modelos no mostraron el mismo nivel de mejora en las pruebas específicas. Esto sugiere que la forma específica en que los modelos fueron recompensados por su proceso de razonamiento fue el factor clave. Los hallazgos indican que el razonamiento abductivo puede fortalecerse como una habilidad general que se transfiere a través de diferentes campos, en lugar de ser un truco estrecho que solo funciona en tipos específicos de acertijos. Al enseñar a los modelos a respetar la evidencia y seguir un camino lógico desde la observación hacia la explicación, los investigadores han dado un paso significativo hacia la creación de una inteligencia artificial que realmente pueda entender y explicar el mundo que la rodea.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →