← Últimos artículos
📊 statistics

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

Este artículo presenta Reset-and-Discard (ReD), una estrategia de consulta que optimiza la cobertura de preguntas únicas resueltas por modelos de lenguaje de gran tamaño dentro de un presupuesto fijo mediante la mitigación de los rendimientos decrecientes del muestreo pass@k tradicional a través de una asignación basada en la ley de potencia.

Autores originales: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El panorama general: El problema del "Juego de las adivinanzas"

Imagina que tienes una gran bolsa de acertijos (preguntas) y una cantidad limitada de dinero para comprar intentos (intentos de respuesta) de un amigo inteligente pero a veces testarudo (un Modelo de Lenguaje Grande o LLM). Tu objetivo no es solo resolver un acertijo realmente difícil; tu objetivo es resolver tantos acertijos diferentes como sea posible antes de que se te acabe el dinero.

El artículo aborda un error común que comete la gente al jugar este juego.

La forma antigua: "El jugador obstinado" (Resolver hasta completar)

Actualmente, la mayoría de la gente utiliza una estrategia que los autores llaman "Resolver hasta completar" (Solve-to-Completion).

  • Cómo funciona: Eliges el Acertijo #1. Le pides una respuesta a tu amigo. Si se equivoca, le preguntas de nuevo. Y de nuevo. Y de nuevo. Sigues preguntando por el Acertijo #1 hasta que finalmente lo resuelve correctamente. Solo entonces pasas al Acertijo #2.
  • El Problema: Algunos acertijos son simplemente muy, muy difíciles. Tu amigo podría quedarse estancado en el Acertijo #1 durante 50 intentos. Para cuando finalmente resuelve el Acertijo #1, ya has gastado 50 intentos. Te quedan cero intentos para los Acertijos #2 al #100. Resolviste una cosa difícil, pero te perdiste 99 cosas fáciles.
  • El Resultado: A medida que gastas más dinero, el número de nuevos acertijos que resuelves crece cada vez más lento. Es como intentar llenar un cubo con una manguera que tiene fugas; cuanto más fuerte empujas, menos agua entra realmente.

La nueva forma: "El explorador de amplitud primero" (Reiniciar y Descartar / ReD)

Los autores proponen una nueva estrategia llamada Reiniciar y Descartar (Reset-and-Discard / ReD).

  • Cómo funciona:
    1. Eliges el Acertijo #1 y le haces una pregunta a tu amigo una vez.
    2. Si acierta, celebras, tiras el acertijo (Descartar) y pasas al Acertijo #2.
    3. Si se equivoca, no sigues preguntando. Te detienes inmediatamente, dejas ese acertijo de lado por ahora y pasas al Acertijo #2.
    4. Recorres toda la lista de acertijos, preguntando por cada uno exactamente una vez (o unas pocas veces).
    5. Una vez que hayas recorrido toda la lista, vuelves al principio y pruebas los que aún no se han resuelto.
  • La Analogía: Imagina que eres un bombero que intenta apagar muchos fuegos pequeños. En lugar de pararte frente a un fuego obstinado y rociar agua sobre él hasta que se apague (ignorando los otros fuegos que se propagan cerca), rocías un poco de agua en cada fuego. Si un fuego se apaga, lo dejas en paz. Si todavía está ardiendo, vuelves a él más tarde.
  • El Resultado: Resuelves una enorme cantidad de acertijos muy rápidamente. Incluso si no resuelves los más difíciles de inmediato, resuelves todos los fáciles y medianos primero. Esto te da un mucho mejor "rendimiento por tu dinero".

La ciencia detrás de la magia

El artículo utiliza las matemáticas para demostrar por qué esto funciona tan bien.

  1. La Ley de Potencia: Los autores notaron que para estos modelos de IA, la probabilidad de resolver un problema cae en un patrón matemático específico (una "ley de potencia"). Básicamente, cuanto más difícil es el problema, exponencialmente más difícil resulta de resolver.
  2. La trampa de los "Rendimientos Decrecientes": Bajo el método antiguo del "Jugador Obstinado", esta matemática significa que, a medida que gastas más dinero, obtienes cada vez menos problemas resueltos nuevos.
  3. La Solución: El método de "Reiniciar y Descartar" rompe esta trampa. Las matemáticas muestran que, al reiniciar después de cada intento (o de unos pocos), conviertes ese crecimiento lento y decreciente en un crecimiento constante y lineal. Obtienes un flujo constante de problemas resueltos sin importar cuántos intentos realices.

Hallazgos clave de los experimentos

Los autores probaron esto en modelos de IA reales (como Llama y GPT) utilizando tres tipos de desafíos:

  • Programación: Escribir programas informáticos.
  • Matemáticas: Resolver problemas matemáticos de palabras.
  • Razonamiento: Responder preguntas complejas de opción múltiple.

Lo que encontraron:

  • Más soluciones: Con la misma cantidad de dinero (presupuesto), ReD resolvió significativamente más problemas únicos que el método antiguo.
  • Más barato: Para alcanzar un objetivo específico (como resolver el 80% de los problemas), ReD requirió menos intentos, menos tokens de computadora y menos dinero real.
  • Funciona con verificadores imperfectos: Incluso si el sistema que comprueba las respuestas comete errores (a veces diciendo "incorrecto" cuando es correcto, o viceversa), ReD sigue ganando.
  • Prediciendo el futuro: Los autores también demostraron que, al usar ReD, puedes averiguar realmente qué tan inteligente es la IA (su "exponente de la ley de potencia") sin tener que realizar miles de pruebas costosas. Es como poder adivinar la velocidad de un coche con solo verlo conducir durante unos segundos, en lugar de cronometrar una carrera completa.

La conclusión

Si tienes un presupuesto fijo para lograr que una IA resuelva una lista de problemas, no sigas golpeando a los difíciles. En su lugar, intenta cada problema una vez, descarta los que resolviste y vuelve a los que fallaste. Esta estrategia de "Reiniciar y Descartar" te permite resolver muchos más problemas por el mismo precio, convirtiendo un proceso lento y frustrante en una máquina eficiente y de alta velocidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →