← Últimos artículos
🤖 AI

Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models

El artículo propone DiScO, un marco de trabajo que mejora el razonamiento de los modelos de lenguaje de gran tamaño mediante la definición explícita y la optimización de esquemas de pensamiento diversos —que comprenden transiciones de razonamiento y candidatos de respuesta— a través de un proceso de tres etapas de conciencia de esquemas, aprendizaje por refuerzo e inferencia diversa, lo que resulta en un rendimiento superior en evaluaciones matemáticas y una mejor recuperación de errores en comparación con los métodos estándar.

Autores originales: Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xinyue Liang, Yizhe Yang, Yu Bai, Bin Xu, Jiawei Li, Yang Gao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: No solo pienses más duro, piensa diferente

Imagina que estás intentando resolver un laberinto muy complicado. La mayoría de los modelos de IA (Modelos de Razonamiento Grande) son como un corredor solitario que corre por un camino, choca con una pared, da media vuelta e intenta correr por ese mismo camino otra vez, solo que un poco más rápido. Se quedan atrapados en bucles o se rinden porque están demasiado concentrados en su primera idea.

Este artículo sostiene que, para resolver problemas complejos, la IA no debería limitarse a correr más rápido; necesita ser un mejor explorador. Los autores introducen un concepto llamado "Esquemas de Pensamiento" (Thinking Schemata). Piensa en esto como el estilo de "creación de mapas" interno de la IA.

Descubrieron que la IA funciona mejor cuando su estilo de creación de mapas es diverso. Específicamente, analizaron dos cosas:

  1. Transiciones de Razonamiento: Qué tan seguido la IA cambia de opinión o cambia de estrategia (por ejemplo, "Espera, esa matemática no funcionó, intentemos dibujar un diagrama en su lugar").
  2. Candidatos de Respuesta: Cuántas respuestas posibles diferentes considera la IA a lo largo del camino antes de elegir la definitiva.

El artículo afirma: Cuanto más cambie de opinión la IA y pruebe diferentes ángulos, más probable será que encuentre la respuesta correcta.


El Problema: El "Corredor Terco"

Los modelos de IA actuales suelen quedarse estancados en una rutina. Si comienzan a resolver un problema matemático de cierta manera, tienden a seguir haciéndolo así, incluso si se dan cuenta a mitad del proceso de que cometieron un error. Pueden decir: "Creo que la respuesta es 12", luego darse cuenta de que 12 es incorrecto, pero en lugar de intentar un enfoque totalmente nuevo, simplemente ajustan el 12 ligeramente y dicen: "Está bien, ¿quizás sea 12.1?".

Carecen de la flexibilidad para decir: "Vale, me equivoqué. Vamos a tirar toda esta idea a la basura y a empezar de cero desde un ángulo diferente".

La Solución: DiScO (Optimización de Políticas de Esquemas Diversos)

Los autores crearon un nuevo método de entrenamiento llamado DiScO. Puedes pensar en DiScO como un entrenador que le enseña a la IA a ser un explorador flexible. Funciona en tres pasos:

1. Enseñar a la IA a "Etiquetar sus Pensamientos" (SFT Consciente de Esquemas)

Primero, se le enseña a la IA a usar un "gorro de pensar" que la ayude a ver su propio proceso de pensamiento. Aprende a etiquetar su propio razonamiento con etiquetas especiales:

  • \AnswerCandidate: "Creo que la respuesta podría ser X".
  • \ReasoningTransition: "Espera, estoy cambiando mi estrategia ahora".

Es como enseñarle a un estudiante a escribir "Estoy trabado" o "Intentemos un método diferente" en los márgenes de su tarea. Esto hace que la IA sea consciente de cómo está pensando, no solo de qué está pensando.

2. Recompensar el "Cambio de Opinión" (RL Orientado a la Diversidad)

Después, la IA juega un juego donde recibe puntos no solo por obtener la respuesta correcta, sino por ser diversa.

  • Si la IA intenta tres formas diferentes de resolver el problema, recibe un bono.
  • Si cambia de "hacer matemáticas" a "dibujar un diagrama", recibe un bono.
  • Si sigue repitiendo la misma frase una y otra vez, no recibe puntos.

Esto es como decirle a un entrenador de un corredor: "Si solo corres la misma vuelta, sacas una C. Pero si intentas correr por el bosque, luego por el río, luego por las colinas, sacas un A+". La IA aprende que explorar diferentes caminos es valioso.

3. El Truco del "Comienzo de Cero" (Diversidad en el Tiempo de Inferencia)

Finalmente, cuando la IA está realizando un examen (tiempo de inferencia), el sistema tiene una red de seguridad. Si la IA empieza a divagar o a quedarse atrapada en un bucle (repitiéndose a sí misma), el sistema corta el inicio de su proceso de pensamiento y dice: "Vale, olvida el primer 20% de lo que acabas de decir. Empieza de nuevo con lo que te queda".

Esto obliga a la IA a "reiniciarse" y mirar el problema con ojos frescos, evitando que se quede atrapada en un callejón sin salida mental.


¿Qué Pasó? (Los Resultados)

Los investigadores probaron esto en problemas matemáticos difíciles (como los que se encuentran en competencias de alto nivel).

  • Mejores Puntajes: La IA entrenada con DiScO obtuvo puntajes significativamente más altos que los modelos de IA estándar, especialmente en los problemas más difíciles.
  • Mejor Recuperación: Cuando la IA cometía un error al principio, el modelo entrenado con DiScO era mucho mejor al darse cuenta de: "Oh no, me fui por el camino equivocado", y cambiar a un nuevo camino para corregirlo. Los modelos estándar a menudo simplemente seguían caminando por el camino equivocado.
  • Más Opciones: Los modelos DiScO no solo adivinaban una respuesta; exploraron muchos "Candidatos de Respuesta" diferentes antes de decidirse por la correcta.

La Conclusión Fundamental

El artículo concluye que la diversidad es la clave. Al igual que un humano que resuelve un rompecabezas difícil se beneficia de probar diferentes estrategias, cambiar de perspectiva y no aferrarse a la primera idea, los modelos de IA funcionan mucho mejor cuando se les incentiva a pensar de formas variadas y flexibles.

Los autores sugieren que el futuro del razonamiento de la IA no se trata solo de hacer los modelos más grandes o más rápidos, sino de hacerlos pensadores más diversos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →