← Últimos artículos
🤖 AI

Stop Comparing LLM Agents Without Disclosing the Harness

Este documento de posición sostiene que, para tareas de horizonte largo, el mecanismo de ejecución del agente es a menudo un determinante más fuerte del rendimiento que el modelo de lenguaje subyacente, instando a la comunidad a adoptar protocolos de evaluación conscientes del mecanismo para evitar la atribución sistemática de las mejoras de infraestructura a avances en los modelos.

Autores originales: Yunbei Zhang, Janet Wang, Yingqiang Ge, Weijie Xu, Jihun Hamm, Chandan K. Reddy

Publicado 2026-05-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yunbei Zhang, Janet Wang, Yingqiang Ge, Weijie Xu, Jihun Hamm, Chandan K. Reddy

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Idea Central: No Es Solo el Motor, Es el Coche

Imagina que estás tratando de juzgar qué motor de coche es el mejor. Pones un motor de Ferrari en un sedán oxidado y averiado, con neumáticos planos y un volante que no funciona. Luego, pones un motor ligeramente menos potente en un coche de carreras nuevo y de alta tecnología, con neumáticos perfectos y un sistema de navegación GPS.

Si el segundo coche gana la carrera, ¿ganó porque el motor era mejor? No. Ganó porque el coche (el chasis, los neumáticos, la navegación) era mejor.

Este documento argumenta que actualmente estamos cometiendo exactamente ese error con la IA.

Cuando probamos "agentes" de IA (programas de IA que pueden realizar tareas como escribir código o corregir errores de software), usualmente miramos una sola puntuación y decimos: "¡Guau, el Modelo A es mejor que el Modelo B!". Los autores dicen que esto es engañoso. Argumentan que, para tareas complejas y a largo plazo, la puntuación depende mucho más del "arnés" (la infraestructura de software que rodea a la IA) que del modelo de IA en sí mismo.

El "Arnés": El Cuerpo y el Sistema Nervioso de la IA

El documento llama a esta infraestructura el "arnés". Imagina que el modelo de IA (el "cerebro") es un piloto. El arnés es la cabina, el sistema de piloto automático, el medidor de combustible y la radio de comunicación.

  • El Modelo (El Cerebro): Es solo la parte que piensa y genera texto. Es "de lazo abierto", lo que significa que simplemente arroja una respuesta y espera el siguiente prompt. No sabe si cometió un error hasta que alguien se lo dice.
  • El Arnés (El Controlador): Esta es la capa de software que:
    • Decide qué información mostrar a la IA (Contexto).
    • Verifica si la respuesta de la IA tiene sentido (Verificación).
    • Le dice a la IA que intente de nuevo si falla (Lógica de reintento).
    • Evita que la IA se confunda con demasiada información (Gestión de memoria).

El documento afirma que, para tareas largas y difíciles, el arnés es la "restricción vinculante". Esto significa que el arnés es el cuello de botella. Si el arnés es malo, incluso la IA más inteligente fallará. Si el arnés es excelente, una IA ligeramente menos inteligente puede tener éxito.

La "Tesis de la Restricción Vinculante"

Los autores proponen una teoría llamada la Tesis de la Restricción Vinculante. En español llano, dice:

"Cuando comparamos modelos de IA de primer nivel en tareas difíciles y largas, la diferencia en sus puntuaciones es causada más por cómo se construye el arnés que por qué modelo se utiliza".

Descubrieron que cambiar el arnés puede hacer oscilar una puntuación en 15 puntos porcentuales, mientras que cambiar el modelo usualmente solo mueve la puntuación en 2 a 4 puntos.

La Analogía: Imagina a dos corredores. Uno es un velocista olímpico (Modelo A) y el otro es un aficionado muy en forma (Modelo B).

  • Si pones al velocista olímpico con botas de barro y le das una mochila pesada (Mal Arnes), podría perder contra el aficionado que corre con zapatos perfectos (Buen Arnes).
  • El documento dice que las tablas de clasificación actuales son como una carrera donde todos llevan zapatos diferentes, pero solo informamos quién ganó, ignorando los zapatos.

Por Qué las Tablas de Clasificación Actuales son "Incompletas"

Ahora mismo, las pruebas de referencia (como SWE-bench o Terminal-Bench) actúan como si estuvieran probando solo el "cerebro". Pero en realidad, están probando el Cerebro + El Arnés.

Dado que los investigadores rara vez publican exactamente cómo construyeron su arnés (la "receta" de la cabina), no podemos decir si un modelo es realmente más inteligente o si el equipo simplemente construyó un arnés mejor a su alrededor.

La Evidencia del Documento:

  1. Ejemplos del mundo real: Mostraron que el mismo modelo de IA (Claude Opus) obtuvo una puntuación del 45,9 % con un arnés y del 55,4 % con otro. Eso es un salto enorme solo cambiando el envoltorio de software, no el modelo.
  2. Experimento Controlado: Tomaron tres modelos de primer nivel diferentes y los ejecutaron a través de tres arneses diferentes (Mínimo, Mejorado y Completo).
    • Resultado: Cambiar el arnés cambió las puntuaciones mucho más que cambiar el modelo.
    • El Giro: A veces, un modelo "peor" con un arnés "mejor" venció a un modelo "mejor" con un arnés "peor". ¡Las clasificaciones se invirtieron!

La Solución: "Divulgación" y "Descomposición de la Varianza"

El documento no dice que debamos dejar de usar modelos. Dice que necesitamos dejar de fingir que el arnés no existe. Proponen una nueva forma de evaluar la IA:

  1. La "Tarjeta de Arnés": Al igual que las etiquetas de los alimentos listan los ingredientes, cada presentación de una prueba de referencia de IA debe listar su "Tarjeta de Arnés". Esta tarjeta detalla exactamente cómo se construye el contexto, cómo se manejan los errores y cómo se verifica la IA.
  2. Descomposición de la Varianza: En lugar de dar solo una puntuación, los investigadores deberían informar:
    • ¿Cuánto de la diferencia en la puntuación se debe al Modelo?
    • ¿Cuánto se debe al Arnés?
    • ¿Cuánto se debe a la Interacción entre ambos?

La Conclusión

Si eres un investigador, inversionista o usuario que mira las tablas de clasificación de IA, el documento te advierte: No confíes ciegamente en las clasificaciones.

Hasta que veamos la "Tarjeta de Arnés", una clasificación en una tabla de referencia es como juzgar una carrera sin saber quién conducía qué coche. El "ganador" podría simplemente haber tenido un coche mejor, no un conductor mejor. Para comprender verdaderamente el progreso de la IA, necesitamos dejar de comparar solo los cerebros y empezar a comparar todo el sistema: el cerebro y el cuerpo en el que vive.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →