← Últimos artículos
💻 computer science

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

El artículo propone REVES, un marco iterativo de dos etapas que aumenta el entrenamiento convirtiendo los pasos intermedios de "fallo cercano" de las trayectorias de recuperación exitosas en prompts de revisión y verificación desacoplados, permitiendo así un aprendizaje fuera de la política eficiente que supera significativamente a los métodos estándar de RL multiturno y de búsqueda evolutiva en tareas de codificación, matemáticas y satisfacción de restricciones.

Autores originales: Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

Publicado 2026-06-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: Por qué el "primer intento" no es suficiente

Imagina que estás realizando un examen difícil. La mayoría de las personas no aciertan la respuesta al primer intento. En su lugar, piensan: "Espera, esto no parece correcto", revisan su trabajo, encuentran un error e intentan de nuevo.

Los modelos de IA actuales (Modelos de Lenguaje Extensos) son excelentes para responder preguntas, pero a menudo están entrenados para ser pensadores de "un solo paso" (one-shot). Se les enseña a dar su mejor respuesta inmediatamente y detenerse. El problema es que, cuando estos modelos se despliegan en el mundo real, a menudo necesitan revisar sus respuestas basándose en la retroalimentación (como un error de compilación en programación o una verificación lógica en matemáticas).

Los autores de este artículo argumentan que entrenar a un modelo para ser un "genio de un solo paso" no lo convierte en un buen "revisor". No puedes enseñar a alguien a ser un gran editor dándole solo un examen donde tenga que escribir el ensayo perfectamente de una sola vez.

El problema: El entrenador "ciego"

El artículo señala una falla en la forma en que entrenamos actualmente a la IA para revisar su trabajo.

La analogía: El corredor de maratón
Imagina entrenar a un corredor para un maratón.

  • Entrenamiento estándar: Dejas que el corredor corra los 26 miles completos. Si termina, le das un trofeo. Si tropieza en la milla 10, continúa y termina, aún así le das el trofeo.
  • La falla: El corredor piensa: "¡Genial! Tropezar en la milla 10 fue parte de la estrategia ganadora". No aprende que tropezar fue un error. Solo sabe que el resultado final fue bueno.

En términos de IA, esto se llama crédito a nivel de trayectoria. Si un modelo comete tres errores y luego obtiene la respuesta correcta en el cuarto intento, el entrenamiento estándar otorga "crédito" a los tres errores previos porque formaron parte del camino hacia el éxito. Esto confunde al modelo.

La solución: REVES (El enfoque del "Sargento de Instrucciones")

Los autores proponen un nuevo método llamado REVES. En lugar de mirar toda la carrera, dividen el proceso en pasos individuales.

La analogía: El ejercicio deportivo
REVES cambia el entrenamiento de "Correr toda la carrera" a "Practicar ejercicios específicos".

  1. Capturar el error: La IA intenta resolver un problema. Se queda estancada o comete un error de "casi acierto" (estuvo casi bien, pero mal).
  2. Detenerse y aislar: En lugar de dejar que la IA siga adelante para ver si eventualmente tiene suerte, REVES detiene el proceso justo ahí.
  3. El ejercicio de dos partes:
    • El ejercicio de revisión: Se le muestra el error a la IA y se le pregunta: "¿Cómo corriges este error específico?".
    • El ejercicio de verificación: Se le muestra el error a la IA y se le pregunta: "¿Es esta respuesta correcta o incorrecta? ¿Por qué?".

Al hacer esto, la IA aprende dos habilidades distintas:

  1. Cómo corregir un error específico (Revisión).
  2. Cómo detectar un error (Verificación).

Cómo funciona (El ciclo de dos etapas)

El artículo describe un ciclo que ocurre una y otra vez:

  • Etapa 1: La simulación (Aumento de datos)
    La IA intenta resolver muchos problemas. Cuando tiene éxito tras varios intentos, el sistema guarda los momentos de "casi acierto". Convierte esos momentos en nuevas preguntas de práctica: "Aquí hay una respuesta incorrecta; corrígela", y "Aquí hay una respuesta incorrecta; dime que es errónea".
  • Etapa 2: El entrenamiento (Aprendizaje por refuerzo de un solo turno)
    La IA es entrenada con estas nuevas preguntas de práctica utilizando métodos de entrenamiento estándar y simples. Aprende a corregir errores y a detectarlos.
  • Repetir: La IA mejora, por lo que los errores de "casi acierto" se vuelven más difíciles. El sistema genera nuevos ejercicios más complejos, y el ciclo continúa.

Los resultados: ¿Qué encontraron?

Los autores probaron esto en tres tipos principales de desafíos:

  1. Programación: La IA tenía que escribir programas informáticos. REVES ayudó a corregir errores de programación mucho mejor que los métodos anteriores, obteniendo puntuaciones significativamente más altas en las pruebas estándar de codificación.
  2. Matemáticas: La IA resolvió problemas matemáticos complejos. Aprendió a corregir sus propios errores de lógica de manera efectiva.
  3. Puzles y "Empaquetamiento de Círculos": Probaron a la IA con un problema de geometría muy difícil llamado "empaquetamiento de círculos" (encajar círculos en un cuadrado).
    • La sorpresa: Un modelo de IA relativamente pequeño (4 mil millones de parámetros) entrenado con REVES funcionó tan bien como sistemas masivos y supercomplejos que utilizan enormes métodos de búsqueda evolutiva (que prueban miles de variaciones aleatorias).
    • Generalización: Aunque la IA solo fue entrenada en matemáticas y programación, mejoró significamente su capacidad para resolver acertijos lógicos (como Sudoku y N-Queens) que nunca había visto antes. Esto sugiere que la habilidad de "corregir errores" es un superpoder general, no solo para las matemáticas.

La idea central

El artículo afirma que mejorar la capacidad de un modelo para revisar un solo paso mejora automáticamente su capacidad para utilizar cualquier estrategia compleja que involucre verificar y corregir el trabajo (como búsquedas en árbol o algoritmos evolutivos).

En resumen: No te limites a enseñarle a la IA a obtener la respuesta correcta. Enséñale cómo detectar cuándo está equivocada y cómo corregirlo. Al convertir los fallos de "casi acierto" en ejercicios de práctica específicos, la IA se convierte en un pensador mucho más inteligente y capaz de autocorregirse.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →