← Últimos artículos
🤖 AI

How Inference Compute Shapes Frontier LLM Evaluation

Este artículo demuestra que el rendimiento de los modelos de lenguaje de gran tamaño (LLM) de vanguardia es altamente sensible a los presupuestos de cómputo en tiempo de inferencia y a los protocolos de evaluación, argumentando que los benchmarks deberían reportar las capacidades como una función del cómputo disponible en lugar de depender de presupuestos fijos restrictivos que pueden subestimar el potencial del modelo.

Autores originales: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

Publicado 2026-06-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás poniendo a prueba a un equipo de detectives brillantes para ver quién es el mejor resolviendo misterios complejos. En el pasado, podrías haberles dado una regla estricta: "Tienen 10 minutos y una sola oportunidad para escribir su respuesta". Si fallaban, dirías: "Este detective no es lo suficientemente bueno".

Pero este artículo argumenta que este método es injusto. Sugiere que algunos detectives solo necesitaban más tiempo, una segunda oportunidad para revisar su trabajo o una pista de que su primer intento era erróneo. Si les hubieras dado esas cosas, podrían haber resuelto el misterio perfectamente.

Los investigadores probaron esta idea utilizando los modelos de IA más avanzados del mundo (los "detectives") en siete desafíos muy difíciles, que van desde escribir código de computadora hasta resolver problemas matemáticos avanzados, diagnosticar casos médicos y hackear sistemas de ciberseguridad.

Aquí está lo que encontraron, explicado de forma sencilla:

1. La trampa del "Límite de Tiempo"

La mayoría de las pruebas de IA imponen a los modelos un límite estricto de cuánto "tiempo de pensamiento" (tokens) pueden utilizar. Los investigadores descubrieron que, para muchas tareas difíciles, este límite corta la capacidad de la IA justo cuando está a punto de comprenderlo todo.

  • La analogía: Imagina a un estudiante tomando un examen de matemáticas. El estudiante sabe cómo resolver el problema, pero el profesor detiene el examen después de 10 minutos. El estudiante reprueba, no porque no sepa matemáticas, sino porque se quedó sin tiempo.
  • El resultado: Cuando los investigadores dieron a los modelos de IA mucho más tiempo (hasta 30 veces más de lo habitual), sus puntuaciones aumentaron significamente en tareas difíciles como matemáticas avanzadas y ciberseguridad. Sin embargo, en algunas tareas (como ciertos problemas de ingeniería de software), los modelos ya habían resuelto todo lo que podían dentro del límite de tiempo normal, por lo que darles más tiempo no ayudó mucho.

2. El efecto de la "Segunda Oportunidad"

Los investigadores también probaron qué sucede si dejan que la IA intente de nuevo tras un intento fallido.

  • La analogía: Piensa en un videojuego. Si mueres, ¿simplemente pierdes? ¿O tienes la oportunidad de reiniciar e intentar una estrategia diferente?
  • El resultado: Permitir que la IA "reinicie" o envíe una nueva respuesta mejoró las puntuaciones en casi todas las pruebas.
    • Con una pista: Si se le decía a la IA: "Esa respuesta fue incorrecta, inténtalo de nuevo", esta mejoraba mucho en encontrar la solución correcta, especialmente en tareas largas y complejas.
    • Sin una pista: Si la IA simplemente tenía que adivinar por su cuenta sin saber si estaba en lo cierto o no, también mejoraba, pero no tanto.
    • El inconveniente: En algunas pruebas, la IA solo necesitaba uno o dos intentos para lograrlo. En otras, necesitaba intentarlo 10 o 15 veces para finalmente tener éxito.

3. Un solo tamaño no sirve para todos

El hallazgo más importante es que diferentes tipos de problemas necesitan diferentes tipos de "ayuda".

  • La analogía: Imagina que tienes una caja de herramientas. Un martillo es excelente para clavos, pero inútil para tornillos. No puedes usar un martillo para todo y esperar que funcione.
  • El resultado:
    • Ciberseguridad y Matemáticas: Estas tareas amaban tener más tiempo y más intentos. La IA seguía mejorando cuanto más trabajaba en ellas.
    • Diagnóstico Médico: Esta tarea no mejoró mucho con más tiempo. Parecía que la IA chocaba contra un muro donde pensar más no ayudaba.
    • Ingeniería de Software: Estas tareas mejoraron un poco con más tiempo, pero principalmente solo necesitaban que se les permitiera intentarlo de nuevo.

4. Los modelos más nuevos son diferentes

Los investigadores probaron modelos de diferentes años (generaciones antiguas vs. nuevas).

  • La analogía: Piensa en los modelos antiguos como detectives novatos que necesitan mucho tiempo y muchas pistas para resolver un caso. Los modelos nuevos son como detectives veteranos; pueden resolver casos más difíciles y son más confiables, pero no necesariamente se vuelven más rápidos al usar su tiempo.
  • El resultado: Los modelos más nuevos no solo se volvieron "más rápidos" al usar su tiempo. En cambio, mejoraron en:
    1. Desbloquear tareas más difíciles: Podían resolver problemas que los modelos antiguos no podían ni tocar.
    2. Ser más confiables: Cuando resolvían un problema, eran menos propensos a cometer un error en el segundo intento.
    • Curiosamente, los modelos más nuevos a veces no necesitaban tantos "segundos intentos" porque acertaban la respuesta a la primera con más frecuencia.

La Gran Conclusión

El artículo argumenta que no podemos juzgar la verdadera inteligencia de una IA mediante una sola puntuación de una única prueba con un límite de tiempo estricto.

  • La puntuación depende de las reglas: La puntuación de una IA cambia dependiendo de cuánto tiempo le des, si le permites intentarlo de nuevo y si le dices si es correcto o no.
  • La recomendación: En lugar de decir "El Modelo X obtuvo un 80%", deberíamos decir "El Modelo X obtiene un 80% con 1 minuto, pero un 95% con 10 minutos". Esto ofrece una imagen mucho más clara de lo que la IA es realmente capaz de hacer, especialmente para decisiones de seguridad y políticas donde necesitamos conocer el potencial máximo de estos sistemas, no solo su rendimiento bajo presión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →