← Últimos artículos
🤖 machine learning

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

Este artículo propone un marco sistemático para el escalado en tiempo de prueba en LLMs de razonamiento que distingue tres regímenes estructurales de inferencia, establece principios de evaluación para separar el rendimiento del sistema de los diagnósticos candidatos, y define estándares de reproducibilidad para abordar la actual falta de comparabilidad entre diversos algoritmos de inferencia.

Autores originales: Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipi
Publicado 2026-08-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de resolver un acertijo realmente difícil, como un problema matemático complejo o un truco de lógica. Tienes un amigo súper inteligente (un Modelo de Lenguaje Grande, o LLM) que conoce muchos datos pero que a veces se queda trabado o comete un error tonto cuando piensa demasiado rápido. En el mundo de la inteligencia artificial, existe una idea creciente llamada "escalado en tiempo de prueba" (test-time scaling). Piensa en esto como darle a tu amigo más tiempo, más papel o más oportunidades para pensar antes de que te dé la respuesta final. En lugar de simplemente hacerle la pregunta una vez y aceptar la primera respuesta que le viene a la mente, podrías pedirle que piense en voz alta, que intente resolver el problema de tres maneras diferentes o incluso que revise su propio trabajo. La gran pregunta que los investigadores se plantean es: ¿el hecho de darle a la computadora más "tiempo de pensamiento" realmente la hace más inteligente, o solo hace que hable más?

Durante mucho tiempo, los científicos han estado probando esto dejando que los modelos de IA generen múltiples respuestas y elijan la mejor, o permitiéndoles buscar a través de diferentes caminos hacia una solución. Pero aquí está el detalle: todo el mundo está jugando con reglas ligeramente diferentes. Algunos investigadores dejan que la IA intente 100 respuestas diferentes y elija al ganador; otros dejan que la IA cambie de opinión a mitad de una frase; y otros dejan que busque como un detective buscando pistas. Debido a que todos están usando diferentes "libros de jugadas", ha sido muy difícil comparar quién lo está haciendo mejor. Es como intentar comparar la velocidad de un coche de carreras, una bicicleta y un cohete solo mirando qué tan lejos llegaron, sin saber cuánto combustible usaron o qué tipo de pista recorrieron. Este artículo interviene para decir: "Un momento, necesitamos dejar de mezclar estas cosas y empezar a medirlas adecuadamente".

Los autores de este artículo, un equipo de la Universidad Case Western Reserve, están esencialmente construyendo un nuevo libro de reglas para cómo probar estas máquinas de pensamiento. Argumentan que el "escalado en tiempo de prueba" no es solo una cosa; es en realidad tres estrategias muy diferentes, y debemos tratarlas por separado. Primero, está el método de "Vía Única" (Single-Track), donde la IA piensa en un camino largo, tal vez corrigiéndose a sí misma mientras avanza, como un excursionista que sigue el mismo sendero pero se detiene para corregir un giro equivocado. Segundo, está el método de "Nivel de Hoja" (Leaf-Level), donde la IA genera un montón de respuestas terminadas completamente diferentes (como un panadero haciendo 100 hogazas de pan) y luego elige la mejor al final. Tercero, está el método de "Nivel de Prefijo" (Prefix-Level), que es más como un explorador de ramas; la IA se ramifica en muchas direcciones diferentes, comprueba qué ramas parecen prometedoras y corta los callejones sin salida incluso antes de terminar el viaje.

El artículo encuentra que tratar todos estos métodos como si fueran lo mismo es un error. Si simplemente dices "usamos más potencia de cómputo", no sabes cómo se usó esa potencia. Los autores muestran que la forma en que se cuenta el costo (el "presupuesto") y la forma en que se elige la respuesta final importan tanto como el modelo mismo. Por ejemplo, descubrieron que a veces, el solo hecho de que una IA genere más respuestas no significa que la respuesta final que elijas sea mejor. De hecho, si el método utilizado para elegir al ganador es defectuoso, añadir más respuestas puede en realidad empeorar el resultado final, un poco como tener a cien personas votando por una película pero usando una máquina de votación rota que elige la peor.

Para solucionar esta confusión, el equipo no solo habló de ello; hicieron el trabajo pesado. Crearon una nueva y masiva biblioteca de más de 2 millones de trazas de razonamiento (piensa en esto como una biblioteca gigante de cada paso que la IA tomó mientras resolvía problemas) que cubre matemáticas, ciencia y acertijos de lógica. Utilizaron esta biblioteca para probar 27 modelos de IA de código abierto diferentes. Sus resultados sugieren que, si bien darle a la IA más tiempo para pensar puede ayudarla a encontrar la respuesta correcta con más frecuencia (lo que llaman "descubrimiento"), esto no siempre significa que la IA sabrá cómo elegir esa respuesta correcta de entre el montón (esto es la "selección"). Descubrieron que para algunos modelos, la probabilidad de encontrar una respuesta correcta aumentó de aproximadamente un 56% a un 82% simplemente al dejar que lo intentaran más veces, pero la probabilidad de que cada uno de esos intentos fuera correcto disminuyó significativamente. Esto significa que la IA está mejorando en encontrar el tesoro, pero se está volviendo más difícil saber qué mapa es el real.

El artículo también enfatiza que no podemos simplemente mirar la puntuación final y dar el tema por concluido. Para entender realmente si una IA se está volviendo más inteligente, necesitamos saber exactamente cómo fue probada: qué prompts se usaron, cuántas veces lo intentó, cómo se eligió la respuesta final e incluso los detalles minúsculos de cómo se estaba ejecutando la computadora. Argumentan que, sin estos detalles, comparar diferentes modelos de IA es como comparar manzanas con naranjas. Al proporcionar un marco claro para medir estos "presupuestos de pensamiento" y liberar su masiva base de datos para que todos la usen, esperan detener la confusión y ayudar a todo el campo a avanzar con resultados claros, justos y reproducibles. En resumen, les están diciendo que para construir una IA verdaderamente inteligente, debemos dejar de adivinar cómo piensan y empezar a medirlo con una regla, no con una suposición.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →