← Últimos artículos
🤖 AI

Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning

Este artículo propone un marco de "amplitud-profundidad" libre de verificadores que mejora el razonamiento de los LLM mediante el uso de cómputo en tiempo de prueba para refinar iterativamente diversos despliegues muestreados a través de la autocrítica y la autocorrección, logrando un rendimiento superior en múltiples evaluaciones matemáticas en comparación con los métodos tradicionales de muestreo y selección basados en verificadores.

Autores originales: Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Lena Trigg, Ali Subhan, Muhammad Ali, Dean F. Hougen

Publicado 2026-08-07
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Lena Trigg, Ali Subhan, Muhammad Ali, Dean F. Hougen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un acertijo matemático realmente difícil, como un enigma que requiere una larga cadena de lógica para descifrarlo. Tienes un amigo superinteligente (un Modelo de Lenguaje Grande, o LLM) con el que puedes hablar. Normalmente, cuando le haces una pregunta a este amigo, te da una respuesta de inmediato. Pero a veces, se queda atascado en el primer paso y sigue cometiendo el mismo error hasta el final.

Para solucionar esto, los científicos han probado dos trucos principales. El primero es el "remuestreo" (resampling): pedirle a tu amigo que intente resolver el acertijo diez veces y elegir la respuesta que aparezca con más frecuencia. Es como pedirle a diez personas diferentes que resuelvan el mismo enigma y ver en quién coinciden. El segundo truco es usar un "verificador": un profesor separado y superestricto que califica cada respuesta para ver cuál es la mejor. Pero aquí está el problema: pedirle a diez personas a menudo solo te da diez versiones ligeramente diferentes de la misma idea errónea, y confiar en un profesor significa que tienes que confiar en que el profesor no esté confundido o sesgado.

Este artículo, titulado "Refining Over Resampling", sugiere una tercera vía. En lugar de solo pedir más conjetras o contratar a un profesor, los autores proponen enseñar a la IA a ser su propio editor. Permiten que la IA genere algunas ideas iniciales diferentes y luego, para cada idea, permiten que la IA haga una pausa, critique su propio trabajo, encuentre sus propios errores y los corrija antes de dar la respuesta final. Es como darle a tu amigo una segunda oportunidad para pensar, no pidiéndole que empiece de nuevo, sino diciéndole: "Oye, espera, cometiste un pequeño error en el paso tres; corrijamos eso y sigamos adelante".

El Problema: La "Cámara de Eco" y el "Suelo de Alucinación"

Los investigadores notaron algo extraño que sucedía cuando pedían a los modelos de IA resolver problemas matemáticos simplemente generando más y más respuestas. Llamaron a esto "saturación de diversidad". Imagina que le preguntas a un grupo de amigos cuántas gomitas hay en un frasco. Si le preguntas a diez personas, podrías obtener diez conjeturas diferentes. Pero si le preguntas a cien personas, podrías encontrar que noventa de ellas están simplemente adivinando números que están muy cerca unos de otros porque todas vieron la misma pista "obvia" (pero errónea). La IA estaba haciendo lo mismo: seguía generando variaciones de las mismas pocas rutas erróneas, desperdiciando su capacidad cerebral en la repetición en lugar de encontrar nuevas soluciones.

Además, existía el "suelo de alucinación". Incluso si la IA sabía la respuesta correcta en el fondo, podría tropezar accidentalmente con un pequeño error aritmético o un desliz lógico mientras la escribía. Como cada conjetura se hacía de forma independiente, cada conjetura era igualmente propensa a tropezar con ese mismo tipo de error. Pedir más conjeturas no ayudaba porque no arreglaba el tropiezo; solo te daba más tropiezos.

La Solución: Amplitud y Profundidad

Los autores idearon una estrategia que llaman "Refinamiento de Amplitud-Profundidad" (Breadth-Depth Refinement). Piensa en esto como explorar un laberinto.

La Amplitud (Breadth) trata de lanzar una red amplia. En lugar de caminar por un solo camino, la IA genera varias rutas de inicio diferentes (llamadas "rollouts"). Esto asegura que no se queden todos atrapados en la misma "cámara de eco" de ideas erróneas.

La Profundidad (Depth) es la verdadera magia. Una vez que tienen estas diferentes rutas, no solo eligen la mejor de inmediato. En su lugar, toman cada ruta y la pasan por un ciclo de automejora.

  1. El Generador: La IA escribe la siguiente parte de la solución.
  2. El Crítico: La IA se detiene y actúa como un editor estricto, leyendo lo que acaba de escribir y diciendo: "Espera, esa matemática no cuadra" o "Esa lógica no tiene sentido".
  3. El Corrector: La IA escucha al crítico y reescribe esa parte específica para corregir el error.

Realizan este ciclo algunas veces (llamado "profundidad") para cada una de las rutas. Finalmente, toman todas las respuestas ahora pulidas y autocorregidas y dejan que voten. La respuesta que gana la votación es la respuesta final.

Lo que Encontraron

El equipo probó esta idea en algunos problemas matemáticos muy difíciles, como el AIME (Examen de Invitación Americana de Matemáticas) y el conjunto de datos MATH500. Compararon su método con las formas antiguas: simplemente adivinar una vez (Greedy), adivinar ocho veces y votar (Majority Voting), o adivinar ocho veces y dejar que una IA "profesora" elija al ganador (Verifier-based Best-of-N).

Los resultados fueron bastante prometedores. Su método superó consistentemente a los demás. Por ejemplo, cuando usaron un modelo de IA más pequeño y menos potente llamado Qwen2.5-1.5B, el antiguo método del "profesor" acertó aproximadamente el 29.6% de las preguntas de MATH500. Pero con su nuevo método de "autoedición", ese mismo modelo saltó a una precisión del 58.0%. ¡Eso es casi el doble! En el examen AMC (American Mathematics Competitions), el mismo modelo pequeño pasó del 25.0% al 32.5%.

Incluso con modelos más grandes y más inteligentes, su método mejoró las puntuaciones, aunque las ganancias fueron un poco menores porque los modelos inteligentes ya estaban haciendo un trabajo decente por su cuenta.

Por qué Funciona (y por qué es Diferente)

La idea clave aquí es que la IA no necesita un profesor externo que le diga qué está mal. Puede aprender a detectar sus propios errores si se le da la estructura adecuada. Los autores sugieren que el paso del "crítico" es crucial; cuando eliminaron la parte donde la IA critica explícitamente su propio trabajo, las puntuaciones bajaron. Resulta que solo pedirle a la IA que "lo intente de nuevo" no es suficiente; necesita que se le diga qué corregir.

Además, este método no requiere entrenamiento ("training-free"). No tuvieron que enseñarle nada nuevo a la IA ni mostrarle miles de ejemplos de cómo corregirse a sí misma. Simplemente utilizaron la capacidad cerebral existente de la IA de una manera más inteligente durante la prueba.

El Intercambio (Trade-off)

Hay un costo, sin embargo. Este método requiere más potencia de cómputo y tiempo. Debido a que la IA tiene que generar, criticar y reescribir múltiples veces para cada problema, utiliza más "compute" (el término elegante para la capacidad de procesamiento de la computadora) que simplemente adivinar una vez. Sin embargo, los autores calcularon que, por la cantidad de trabajo adicional que realiza, la mejora en la precisión vale la pena, especialmente para los modelos más pequeños que luchan por obtener la respuesta correcta en su primer intento.

Al final, el artículo sugiere que cuando queremos que la IA sea más inteligente, no debemos simplemente pedirle que se esfuerce más o pedir más conjeturas. Debemos darle el tiempo y la estructura para pensar, revisar su trabajo y corregir sus propios errores antes de entregarnos la respuesta final. Es un cambio de "más es mejor" a "mejor es mejor".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →