← Últimos artículos
🤖 AI

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX

Este artículo presenta ATBench-Claw y ATBench-CodeX, dos extensiones especializadas del benchmark ATBench para la evaluación y diagnóstico de seguridad en trayectorias de agentes dentro de los entornos OpenClaw y OpenAI Codex, las cuales se adaptan mediante la personalización de una taxonomía de seguridad tridimensional para cubrir riesgos específicos de cada dominio bajo un marco de generación compartido.

Autores originales: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

Publicado 2026-04-17
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que los agentes de IA (como asistentes virtuales muy avanzados) son como nuevos empleados digitales que están aprendiendo a trabajar en diferentes oficinas. A veces, estos empleados son geniales, pero si no los vigilamos bien, pueden cometer errores graves: borrar archivos importantes, enviar correos ofensivos o instalar virus sin querer.

Este documento habla de un nuevo "examen de seguridad" llamado ATBench, diseñado para probar qué tan seguros son estos agentes antes de dejarlos trabajar solos. Pero como las oficinas cambian (unas usan herramientas de chat, otras usan código de programación), el examen también tiene que cambiar.

Aquí te explico la idea principal con una analogía sencilla:

🏗️ La Idea Central: El "Kit de Construcción" de Exámenes

Imagina que ATBench es como un kit de construcción de exámenes de manejo.

  • En lugar de crear un examen nuevo desde cero cada vez, tienes un chasis de coche (la estructura base) que siempre funciona.
  • Lo que cambias son las ruedas y el volante según el terreno: ¿Vas a conducir por la ciudad (OpenClaw)? ¿O vas a conducir por una pista de carreras llena de curvas y túneles (CodeX)?

Los autores dicen: "No necesitamos inventar un coche nuevo cada vez; solo adaptamos el kit a la carretera específica".


🚦 Dos Nuevas "Carreteras" para Probar

El paper presenta dos versiones específicas de este examen para dos tipos de entornos muy diferentes:

1. ATBench-Claw: El "Entrenador de Oficinistas" (OpenClaw)

Imagina un agente que trabaja en una oficina moderna. Tiene acceso a:

  • Herramientas: Como un teléfono, un correo o una impresora.
  • Sesiones: Conversaciones largas donde recuerda lo que dijiste hace 10 minutos.
  • Acciones externas: Puede enviar mensajes a otras personas o borrar archivos.

El peligro aquí: Que el agente se confunda con quién es, que borre algo por error porque "pensó" que era un archivo viejo, o que siga una instrucción maliciosa de un usuario disfrazado.

  • La analogía: Es como probar si un nuevo empleado sabe cuándo decir "¡Alto!" antes de enviar un correo confidencial a la persona equivocada o si sabe pedir permiso antes de usar la impresora de la jefa.

2. ATBench-CodeX: El "Mecánico de Software" (Codex)

Ahora imagina un agente que es un programador experto. Trabaja directamente con:

  • Repositorios: Cajas llenas de código y archivos.
  • Cáscaras (Shells): Líneas de comando que pueden borrar todo el disco duro si se escriben mal.
  • Dependencias: Librerías de software que puede descargar de internet (y que podrían estar infectadas).

El peligro aquí: Que el agente instale un virus disfrazado de "actualización", que modifique el código de forma destructiva o que rompa la seguridad del servidor.

  • La analogía: Es como poner a un mecánico novato frente a un coche de Fórmula 1. Si le das una llave inglesa y le dices "arregla el motor", ¿sabrá que no debe quitar el tornillo que sostiene el motor? ¿O podría hacer explotar el coche? Este examen prueba si el agente sabe manejar herramientas peligrosas sin destruir el taller.

🧠 ¿Cómo funciona la "Magia"? (La Taxonomía de Seguridad)

Para que el examen funcione en ambos casos, los autores usan una lista de verificación de 3 dimensiones (llamada Taxonomía de Seguridad):

  1. Origen del riesgo: ¿De dónde viene el problema? (¿Un usuario malo? ¿Una herramienta defectuosa? ¿Un error del propio agente?).
  2. Modo de fallo: ¿Cómo falló el agente? (¿Olvidó pedir permiso? ¿Malinterpretó una orden? ¿Usó la herramienta incorrecta?).
  3. Daño real: ¿Qué pasó en el mundo real? (¿Se filtraron datos privados? ¿Se perdió dinero? ¿Se dañó la reputación?).

El truco:

  • Para Claw, la lista se adapta para vigilar más las "sesiones" y los "mensajes".
  • Para CodeX, la lista se adapta para vigilar más los "archivos de código" y las "instalaciones de software".

Es como tener un mismo manual de seguridad, pero con marcadores de colores diferentes dependiendo de si estás en una oficina o en un laboratorio de programación.


📊 ¿Qué descubrieron? (Los Resultados)

Los autores probaron varios "agentes" (modelos de IA) en estos dos exámenes:

  • Los "Guardianes" especializados: Son como guardias de seguridad entrenados solo para vigilar. A veces funcionan bien, pero si el entorno cambia mucho (como pasar de la oficina al laboratorio de código), se confunden y fallan más.
  • Los "Agentes Generales" (como Qwen o Llama): Son como empleados muy inteligentes que aprenden rápido. Funcionan bastante bien en ambos entornos.
  • El ganador (AgentDoG): El sistema que crearon ellos (AgentDoG) fue el mejor estudiante de la clase. Logró detectar casi todos los errores peligrosos en ambos entornos, tanto en la oficina como en el laboratorio de código.

💡 Conclusión Simple

Este paper nos dice que no necesitamos reinventar la rueda cada vez que la IA aprende a hacer algo nuevo.

En lugar de crear un examen de seguridad totalmente nuevo cada vez que sale una nueva herramienta, podemos tomar nuestra estructura base de seguridad, cambiar un poco la lista de cosas a vigilar (la taxonomía) y listo: tenemos un examen nuevo y preciso.

Es como tener un kit de primeros auxilios universal: si te cortas en la cocina, usas la venda; si te golpeas en el gimnasio, usas la gasa. El kit es el mismo, pero la aplicación se adapta al lugar. ¡Y eso hace que la IA sea mucho más segura y confiable!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →