ContractBench: Can LLM Agents Preserve Observation Contracts?
Este artículo presenta ContractBench, una evaluación determinista que revela que los agentes de modelos de lenguaje grandes (LLM) de vanguardia actuales a menudo no logran preservar la validez temporal y la integridad a nivel de bytes de los contratos de observación (como los tokens de sesión y las URL), una capacidad que no escala de forma monótona con el tamaño del modelo y que requiere un entrenamiento específico consciente de los fallos para mejorar.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La Gran Idea: El Problema del "Traspaso Digital"
Imagina que contratas a un asistente robot muy inteligente, pero un poco torpe, para que haga recados por ti. Le dices al robot: "Ve al banco, consigue una llave temporal y usa esa llave para abrir la caja fuerte".
En el mundo real, si el robot deja caer la llave, cambia la forma de la llave o intenta usar la llave después de que ha expirado, la caja fuerte no se abrirá. El robot falló, no porque no supiera qué hacer, sino porque no logró manejar los detalles específicos del traspaso.
Este artículo llama a estos detalles "Contratos de Observación".
- El Contrato: Cuando una herramienta (como una API bancaria) le da al robot un fragmento de datos (como una contraseña temporal o un enlace firmado), esos datos vienen con dos reglas invisibles:
- La Fecha de Expiración: Debes usarlo ahora, o se volverá inútil.
- La Regla de "No Tocar": Debes copiarlo exactamente, letra por letra. Si cambias incluso una coma o un espacio, se rompe.
Los autores descubrieron que incluso los agentes de IA más inteligentes de hoy son terribles siguiendo estas reglas. A menudo dejan caer la llave, la derriten o intentan usarla al día siguiente.
La Nueva Prueba: CONTRACTBENCH
Para demostrar esto, los investigadores crearon una nueva prueba llamada CONTRACTBENCH. Piensa en ella como un "examen de conducir" para agentes de IA, pero en lugar de conducir un coche, deben navegar por un circuito de obstáculos digital donde cada paso requiere pasar un paquete frágil y sensible al tiempo a la siguiente persona.
- El Circuito: Tiene 33 escenarios diferentes (como descargar un archivo con un enlace que muere en 10 segundos, o iniciar sesión con un código que debe escribirse perfectamente).
- Las Reglas: La prueba es ejecutada por un programa informático estricto (sin jueces humanos). Utiliza un "reloj virtual" para ver si el agente es demasiado lento, y un "escáner de huellas digitales digitales" para ver si el agente cambió una sola letra en el código.
- La Puntuación: Si el agente rompe el límite de tiempo o se equivoca en la ortografía del código, reprueba.
Lo Que Descubrieron (Los Hallazgos)
Los investigadores probaron 38 modelos de IA diferentes (incluyendo los más nuevos y famosos de OpenAI, Anthropic, Google y equipos de código abierto). Esto es lo que encontraron, traducido a términos cotidianos:
1. Incluso los Robots "Más Inteligentes" Fallan
El Hallazgo: Ningún modelo aprobó el 80% de la prueba. El mejor (Claude Opus 4.6) obtuvo solo alrededor del 78%.
La Analogía: Imagina al estudiante más inteligente del mundo tomando un examen de matemáticas. Puede resolver problemas complejos de cálculo, pero si le pides que copie un número de 10 dígitos perfectamente sin cometer un error tipográfico, aún lo falla el 22% de las veces. Ser "inteligente" no significa ser "cuidadoso".
2. El "Acantilado Mágico" (Qwen 3.5)
El Hallazgo: En una familia específica de modelos (Qwen 3.5), hubo un salto repentino en la capacidad. El modelo pequeño de 4 mil millones de parámetros obtuvo 0% de aciertos. El modelo ligeramente más grande de 9 mil millones saltó al 56%.
La Analogía: Es como un personaje de videojuego que es inútil hasta que alcanza el Nivel 9. En el Nivel 8, ni siquiera puede sostener la llave. En el Nivel 9, de repente aprende a sostenerla con suavidad. Esto no fue una mejora lenta; fue un "despertar" repentino de una habilidad específica llamada restricción (saber no cambiar los datos).
3. Más Grande No Siempre Es Mejor (La Montaña Rusa de GPT-5)
El Hallazgo: A medida que evolucionó la familia de modelos GPT-5, su rendimiento subió, luego se desplomó y luego volvió a subir.
La Analogía: Imagina a un chef que recibe un nuevo libro de recetas.
- Chef A (GPT-5): Hace un pastel perfecto.
- Chef B (GPT-5.1): Obtiene una versión "más inteligente" del libro, pero empieza a añadir demasiado azúcar y arruina la receta (específicamente, empezaron a cambiar los ingredientes en lugar de copiarlos).
- Chef C (GPT-5.2): Arregla la receta y vuelve a hacer pasteles perfectos.
El artículo sugiere que hacer que una IA sea "más inteligente" o "más conversacional" puede hacerla a veces peor para seguir reglas estrictas y aburridas.
4. Los Modelos "Base" No Pueden Hacerlo
El Hallazgo: Los modelos que no han sido "entrenados" para chatear o seguir instrucciones (modelos Base) obtuvieron 0% en la prueba. Solo los modelos que habían sido enseñados a seguir instrucciones (modelos Instruct) podían aprobar.
La Analogía: Un trozo de arcilla cruda (modelo Base) no puede mantener una forma. Tienes que esculpirlo (post-entrenamiento) para que pueda sostener una taza de agua. La capacidad de seguir estos contratos no es natural; tiene que ser enseñada.
5. La "Pista" Funciona
El Hallazgo: Cuando los investigadores le dijeron a la IA exactamente qué hizo mal (por ejemplo, "Cambiaste una letra en el código"), la IA pudo corregir su error y aprobar la prueba.
La Analogía: Si le dices a un niño: "Dejaste caer la pelota", podría intentarlo de nuevo y atraparla. Pero si solo dices: "Inténtalo de nuevo", podría dejarla caer otra vez. La retroalimentación específica fue la clave para corregir el error.
Por Qué Esto Importa (Según el Artículo)
El artículo argumenta que hemos estado probando la IA para ver si pueden "resolver un rompecabezas" o "escribir una historia". Pero en el mundo real, los agentes de IA a menudo se utilizan para realizar trabajos donde la precisión lo es todo.
Si un agente de IA está gestionando tu cuenta bancaria, no puede permitirse cambiar un solo dígito en un código de transacción. Si está gestionando un servidor, no puede permitirse usar una contraseña expirada.
La Conclusión: Los agentes de IA actuales son como becarios brillantes pero torpes. Entienden el panorama general, pero siguen dejando caer las herramientas frágiles que se les entregan. Para hacerlos fiables para trabajos del mundo real, necesitamos dejar de hacerlos simplemente "más inteligentes" y empezar a enseñarles a ser más cuidadosos y más precisos con los contratos digitales que reciben.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.