← Últimos artículos
💬 NLP

InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning

InftyThink+ es un marco de aprendizaje por refuerzo de extremo a extremo que optimiza el razonamiento iterativo mediante la síntesis estratégica y los límites de iteración controlados por el modelo, mejorando significamente la precisión, la eficiencia y la generalización en comparación con los métodos convencionales de cadena de pensamiento larga.

Autores originales: Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

Publicado 2026-06-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas masivo e increíblemente difícil. Tienes un asistente brillante (la IA) que es muy inteligente pero tiene una memoria muy corta y se cansa si intenta mantener demasiadas piezas en su cabeza a la vez.

Aquí está el problema que aborda el artículo:

  • La forma antigua (Razonamiento Vanilla): Le pides al asistente que resuelva todo el rompecabezas de una sola vez. Comienza a pensar: "Paso 1, Paso 2, Paso 3..." y continúa. Pero debido a que su memoria es limitada, eventualmente olvida lo que hizo en el Paso 1 mientras trabaja en el Paso 100. Además, cuanto más tiempo piensa, más lento y costoso resulta para la computadora procesar sus pensamientos. Podría quedarse sin memoria antes de terminar, o podría confundirse con su propia larga lista de pensamientos.
  • La nueva forma (InftyThink+): En lugar de un pensamiento largo e ininterrumpido, el asistente divide el rompecabezas en pequeños capítulos. Después de cada pocos pasos, se detiene, escribe un resumen de lo que ha descubierto hasta ahora, y luego desecha las notas desordenadas y detalladas. Luego comienza el siguiente capítulo usando solo el resumen y el rompecabezas original. Esto mantiene su memoria fresca y la computadora rápida.

La gran innovación: Enseñar al asistente a decidir cuándo detenerse

El artículo presenta un nuevo sistema llamado InftyThink+.

Los intentos previos de este método de "capítulos" eran como un profesor que obligaba al asistente a dejar de escribir cada 500 palabras, sin importar nada. A veces, el asistente estaba en medio de una idea brillante y era interrumpido; otras veces, se detenía demasiado pronto. Además, no sabían cómo escribir un buen resumen.

InftyThink+ utiliza el Aprendizaje por Refuerzo (RL) para enseñar al asistente tres habilidades críticas mediante el ensayo y error, como entrenar a un perro con premios:

  1. Cuándo resumir: ¿Debo detenerme ahora para escribir un resumen, o seguir adelante? La IA aprende a detenerse exactamente cuando ha capturado la información más importante, no solo cuando suena un temporizador.
  2. Qué preservar: ¿Qué detalles son importantes para el siguiente paso? La IA aprende a escribir un resumen que conserve las pistas cruciales y deseche lo irrelevante.
  3. Cómo continuar: ¿Cómo retomo la historia desde el resumen? La IA aprende a leer su propio resumen y a continuar la lógica de manera fluida sin perderse.

Cómo funciona (El proceso de entrenamiento)

El artículo describe una receta de entrenamiento de dos pasos:

  1. El "Arranque en Frío" (Aprendiendo el formato): Primero, le enseñan a la IA las reglas básicas del juego. Le muestran ejemplos de cómo plantear un rompecabezas, detenerse, escribir un resumen y luego comenzar de nuevo. Esto es como enseñarle a un estudiante el formato de un ensayo antes de pedirle que escriba una obra maestra.
  2. El "Aprendizaje por Refuerzo" (Aprendiendo la estrategia): Una vez que la IA conoce el formato, la dejan actuar.
    • Si la IA resuelve el rompecabezas correctamente, recibe un "premio" (recompensa).
    • Si lo resuelve de forma rápida y eficiente, recibe un premio extra.
    • Si escribe un resumen terrible o se detiene en el momento equivocado, no recibe ningún premio.
    • A través de miles de intentos, la IA descubre la estrategia perfecta: "Debo detenerme aquí, escribir un resumen como este, y luego continuar de esa manera para obtener la mayor cantidad de premios".

Los resultados: Más rápido, más inteligente y más fuerte

El artículo probó esto con problemas matemáticos difíciles (como la competencia AIME). Esto es lo que encontraron:

  • Más inteligente: La IA mejoró significamente su capacidad para resolver problemas. En una prueba difícil, la precisión aumentó un 21% en comparación con el método antiguo. Resolvió problemas que el método anterior no pudo terminar en absoluto.
  • Más rápido: Debido a que la IA no estaba tratando de recordar una historia de 100 páginas, resolvió los problemas mucho más rápido. En algunos casos, fue entre un 30% y un 40% más rápida que el método estándar.
  • Más eficiente: El propio entrenamiento fue más rápido. La computadora no tuvo que realizar tanto trabajo pesado para enseñar a la IA, lo que significa que los investigadores pudieron entrenar mejores modelos con menos energía y tiempo.

La conclusión fundamental

Piensa en InftyThink+ como enseñar a una IA a ser un mejor gerente de proyectos. En lugar de intentar tener toda la historia de un proyecto en su cabeza (lo que causa que colapse o que olvide cosas), aprende a hacer una pausa, escribir un "informe de estado" claro (resumen) y luego avanzar basándose en ese informe. Al aprender cuándo escribir ese informe y qué poner en él, la IA se convierte tanto en un genio para resolver problemas como en un trabajador altamente eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →