← Últimos artículos
🤖 AI

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

Este artículo desafía la suposición de clasificaciones estables de los modelos de lenguaje de gran tamaño al demostrar que la variación de los presupuestos de tokens de inferencia altera significativamente el rendimiento y el orden de los modelos, revelando comportamientos no monotónicos, reversiones de clasificación y complementariedad de modelos que requieren protocolos de evaluación condicionados al presupuesto.

Autores originales: Rodrigo Guedes de Souza, Alison R. Panisson

Publicado 2026-08-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Rodrigo Guedes de Souza, Alison R. Panisson

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás en una biblioteca gigante donde los libros están escritos por robots superinteligentes llamados Modelos de Lenguaje Extensos (LLM). Estos robots pueden leer casi todo y responder preguntas sobre matemáticas, ciencia e historia. Durante mucho tiempo, las personas que intentaban elegir al "mejor" robot simplemente le hacían una pregunta y veían quién obtenía la respuesta correcta primero. Asumían que si el Robot A era mejor que el Robot B en una prueba, siempre sería mejor, sin importar qué. Era como juzgar una carrera mirando solo quién cruzaba la meta primero, sin importar cuánto tiempo se les permitía correr.

Pero aquí está el giro: estos robots no solo "piensan" instantáneamente. Escriben sus respuestas palabra por palabra, como una larga cadena de pensamientos. El límite de cuántas palabras se les permite escribir se llama "presupuesto de tokens". Piensa en esto como darle a un estudiante diferentes cantidades de tiempo para tomar un examen. Algunos estudiantes pueden necesitar mucho tiempo para resolver un rompecabezas difícil, mientras que otros podrían confundirse si tienen demasiado tiempo y empiezan a sobrepensar. El gran interrogante para los científicos es: ¿El "mejor" robot sigue siendo el mejor si cambiamos el límite de tiempo? ¿O el ganador cambia dependiendo de cuánto tiempo les dejemos pensar? Esto es exactamente lo que los investigadores querían averiguar.


El problema del "sobrepensar": Por qué más tiempo no siempre es mejor

En este estudio, los investigadores organizaron un experimento masivo para ver cómo se desempeñaban cuatro modelos de IA diferentes en tres pruebas complicadas: matemáticas de nivel escolar, matemáticas de nivel de competición y preguntas de ciencia de nivel de posgrado. No solo dejaron que los modelos funcionaran; los obligaron a detenerse después de cantidades específicas de "pensamiento" (medido en tokens). Probaron siete límites diferentes, que iban desde unos diminutos 64 tokens (muy poco tiempo de pensamiento) hasta unos enormes 4,096 tokens (mucho tiempo de pensamiento).

Lo que descubrieron es que la idea de un único "mejor" modelo es un mito. Las clasificaciones de los modelos cambiaron y se invirtieron dependiendo enteramente de cuánto tiempo se les dio.

La sorpresa del "sobrepensar"
Podrías pensar que darle a un robot más tiempo para pensar siempre le ayudaría a obtener la respuesta correcta. Pero los investigadores descubrieron algo extraño: a veces, dar a un modelo más tokens hacía que obtuviera la respuesta incorrecta. A esto lo llaman "sobrepensar" (overthinking).

Imagina a un estudiante que sabe la respuesta a un problema matemático. Si le das 10 minutos, la escribe correctamente. Pero si le das 30 minutos, podría empezar a dudar de sí mismo, cambiar su respuesta y terminar con la equivocada. El estudio encontró que esto sucedió en aproximadamente el 3% al 19% de las preguntas. Peor aún, esto no era un problema de las preguntas en sí mismas; era específico de cada robot. Una pregunta que hacía que un modelo "sobrepensara" y fallara podía ser perfectamente adecuada para otro modelo. Es como cómo una persona puede ponerse nerviosa si tiene demasiado tiempo para preparar un discurso, mientras que otra persona prospera con ello.

Los grandes cambios de clasificación
Debido a esto, el "ganador" de la carrera no dejaba de cambiar.

  • En la prueba de matemáticas más fácil (GSM8K), un modelo enorme (LLaMA-3.3 70B) fue el campeón cuando se le dio una cantidad media de tiempo (256 tokens). Pero tan pronto como les dieron a los modelos más tiempo (hasta 4,096 tokens), un modelo más pequeño (GPT-OSS 20B) tomó el liderazgo y se mantuvo ahí.
  • En la prueba de ciencia más difícil (GPQA), el modelo más pequeño (LLaMA-3 8B) fue en realidad el mejor cuando el tiempo era ajustado (256–512 tokens). Pero a medida que el tiempo aumentaba, los modelos más grandes alcanzaron el ritmo y finalmente empataron en el primer puesto.

Esto significa que si ves una tabla de clasificación hoy que dice "El Modelo X es el mejor", esa afirmación solo es cierta para una cantidad específica de tiempo. Si cambias el límite de tiempo, el Modelo X podría convertirse repentinamente en el peor de todos.

La brecha del "Oráculo": Por qué necesitamos un interruptor inteligente
Los investigadores también se preguntaron: "Si pudiéramos elegir mágicamente el modelo perfecto para cada pregunta, ¿qué tan bien lo haríamos?". Construyeron un "Oráculo" teórico (un selector perfecto) que elegía el mejor modelo para cada pregunta y límite de tiempo específicos.

Los resultados fueron impactantes. En la prueba de ciencia más difícil, este selector perfecto podía obtener 27.8 puntos porcentuales más respuestas correctas que el mejor modelo funcionando por sí solo. Incluso en las pruebas de matemáticas más fáciles, la brecha fue significativa (hasta 16.9 puntos). Esto demuestra que ningún robot es bueno en todo. A veces el robot pequeño es el mejor, a veces el grande, y a veces, todos están equivocados.

¿Podemos construir un interruptor inteligente?
El equipo intentó construir un "enrutador" (router): un sistema inteligente que observa una pregunta y el límite de tiempo, y luego decide qué robot debe responderla.

  • Dentro del mismo tipo de prueba: Cuando entrenaron al enrutador con problemas de matemáticas y lo probaron con problemas de matemáticas, funcionó de maravilla. Usar el "límite de tiempo" como una pista ayudó a elegir el robot correcto, mejorando la precisión entre 1.6 y 5.7 puntos.
  • A través de diferentes pruebas: Pero cuando intentaron usar el mismo enrutador para pasar de preguntas de matemáticas a preguntas de ciencia, este se confundió. Las pistas de "límite de tiempo" que funcionaban para las matemáticas no funcionaron para la ciencia. De hecho, usar esas pistas hizo que el enrutador funcionara peor por 1.2 puntos al cambiar de dominio. Esto sugiere que la relación entre "cuánto tiempo tienes" y "obtener la respuesta correcta" es diferente para cada materia.

La conclusión

La lección principal de este artículo es simple pero poderosa: No existe un único "mejor" modelo de IA. La respuesta a "¿qué modelo es el mejor?" depende enteramente de "cuánto tiempo dejas que piense".

Si estás construyendo una aplicación para un teléfono donde solo puedes darle a la IA un poco de tiempo, un modelo pequeño y rápido puede ser tu campeón. Si estás operando un servidor donde puedes darle a la IA horas para pensar, un modelo diferente y más grande podría ganar. La forma antigua de clasificar los modelos —simplemente eligiendo un ganador para todos— está rota. En su lugar, debemos decir: "El Modelo A es el mejor para respuestas cortas, el Modelo B es el mejor para respuestas largas y, a veces, si les das demasiado tiempo, podrían simplemente arruinarlo todo".

Los investigadores sugieren que, en el futuro, deberíamos dejar de pedir una puntuación única y empezar a reportar cómo rinden los modelos en diferentes límites de tiempo. Y si queremos usar estos modelos de manera efectiva, necesitamos sistemas inteligentes que sepan cuándo llamar al pensador pequeño y rápido, y cuándo llamar al pensador grande y lento, porque el ganador cambia en el momento en que el reloj empieza a correr.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →