← Últimos artículos
🤖 AI

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

Este artículo presenta HarnessSafe, un benchmark integral y un marco de evaluación multietapa que evalúa cómo los entornos de agentes modernos (harnesses) mitigan los riesgos de seguridad retardados causados por contenido influenciado por atacantes que persiste a través de diversos portadores y límites del sistema, revelando que la efectividad de la contención depende altamente de tipos de portadores específicos y de las configuraciones de modelo y entorno.

Autores originales: Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

Publicado 2026-08-10
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico superinteligente que no solo responde preguntas, sino que realmente hace cosas por ti. Puede escribir código, reservar vuelos u organizar tus archivos digitales. Para hacer esto, el robot necesita un "cerebro" (el modelo de IA) y una "mochila" (el sistema de software que contiene sus memorias, herramientas y habilidades). Esta mochila es crucial porque le permite recordar lo que hizo ayer para poder terminar un gran proyecto hoy. Pero aquí está la parte difícil: ¿qué pasa si alguien infiltra un virus diminuto e invisible en esa mochila? Podría no hacer nada de inmediato. En su lugar, espera, escondiéndose en una nota o en la configuración de una herramienta, hasta que el robot recoge una tarea completamente inocente semanas después. De repente, esa tarea inocente activa el virus y el robot accidentalmente borra tus archivos o envía un mensaje secreto. Este es el mundo del "riesgo persistente" en los agentes de IA: peligros que sobreviven a través del tiempo y diferentes tareas, esperando el momento adecuado para atacar.

Este artículo, titulado HarnessSafe, es como una prueba de esfuerzo masiva y de alta tecnología para estas mochilas de robots. Los investigadores querían ver si los sistemas de IA actuales podrían detectar estos ataques "durmientes" antes de que despertaran y causaran problemas. Construyeron un patio de recreo con 328 escenarios diferentes donde intentaron plantar estos virus ocultos en siete tipos diferentes de "mochilas" (como memoria, habilidades y herramientas compartidas) a través de siete sistemas robóticos populares. En lugar de solo preguntar "¿Se hackeó el robot? Sí o no", rastrearon el ataque paso a paso. Observaron si el virus era detectado en el momento en que se plantaba, si sobrevivía a un cruce de fronteras (como un nuevo día o un nuevo usuario), o si finalmente lograba causar un desastre.

Los resultados fueron un poco un llamado de atención. Los investigadores descubrieron que la seguridad no se trata solo del cerebro del robot o de la mochila por sí sola; se trata de la combinación específica de ambos. Algunos sistemas robóticos eran excelentes detectando virus en su memoria pero pésimos detectándolos en sus herramientas. Otros eran lo opuesto. De hecho, dos sistemas podrían tener la misma "tasa de fallo" (qué tan seguido fueron hackeados), pero uno podría haber detenido el ataque temprano, mientras que el otro dejó que vagara durante días antes de fallar finalmente. Esto significa que simplemente contar cuántas veces se hackea un sistema no es suficiente; necesitamos saber dónde y cuándo falló la defensa. El estudio demuestra que estos ataques ocultos y retardados son reales y peligrosos, y que solucionarlos requiere mirar todo el viaje del riesgo, no solo la explosión final.

La historia del "Espía Durmiente"

Para entender lo que hicieron los investigadores, imaginemos que el agente de IA es un pasante superorganizado trabajando en una oficina gigante. Este pasante tiene una mochila (el "harness") donde guarda sus listas de tareas pendientes, sus herramientas (como una calculadora o una carpeta de archivos) y sus notas sobre lo que ha hecho.

Normalmente, este pasante es servicial. Pero imagina que un espía (el atacante) quiere sabotear la oficina. El espía no solo grita "¡Haz algo malo!" porque el pasante diría que no. En su lugar, el espía infiltra una instrucción durmiente en la mochila del pasante. Tal vez escribe una nota extraña en la sección de "Memoria", o altera un archivo de "Habilidad" para que parezca normal pero contenga una trampa oculta.

El espía se va. El pasante sigue con su día, realizando tareas normales y aburridas. Nada sucede. Esta es la parte de la "persistencia": lo malo simplemente está ahí sentado, esperando.

Entonces, días después, el jefe (un usuario) le pide al pasante que haga algo completamente inocente, como "Resumir este informe". Este es el "disparador benigno". Pero debido a que la mochila del pasante aún contiene esa instrucción durmiente del espía, en el momento en que el pasante abre el informe, la trampa se activa. El pasante podría accidentalmente borrar los archivos del jefe o enviar un correo electrónico secreto, todo mientras piensa que solo está haciendo un trabajo normal.

La Gran Prueba de Esfuerzo de la Mochila

Los autores de este artículo decidieron jugar el papel del espía para ver qué sistemas de oficina eran seguros. Crearon HarnessSafe, un kit de prueba gigante con 328 formas diferentes de plantar estos espías durmientes. Probaron estos espías en siete tipos diferentes de mochilas:

  1. Memoria: Escondido en las notas del pasante.
  2. Habilidades: Escondido en las instrucciones de cómo realizar una tarea.
  3. Herramientas/MCP: Escondido en la configuración de las herramientas que usa el pasante.
  4. Memoria-a-Habilidad: Convirtiendo una nota en una nueva habilidad.
  5. Delegación de Subagentes: Pasando el espía a un robot ayudante.
  6. Resumen de Sesión: Escondido en el resumen de una conversación pasada.
  7. Artefactos Compartidos: Escondido en un archivo compartido entre diferentes trabajadores.

Realizaron estas pruebas en siete sistemas robóticos del mundo real diferentes (como Claude Code, Codex CLI y otros) para ver cómo manejaban los ataques.

El Puntaje de "Etapa": No es solo Sí o No

Aquí es donde el artículo es realmente ingenioso. La mayoría de las pruebas de seguridad solo dicen: "¿Se hackeó el robot? Sí/No". Pero los investigadores se dieron cuenta de que eso es como decir que un choque de auto es el mismo si los frenos fallaron a 10 mph o a 100 mph.

En su lugar, crearon un marcador de 7 etapas (llamado N0 a N5b) para rastrear exactamente qué tan lejos llegó el espía:

  • N0: El espía ni siquiera fue visto. La mochila estaba cerrada herméticamente.
  • N1: El espía fue detectado tan pronto como intentó entrar.
  • N2: El espía entró y cambió algo, pero fue atrapado antes de que pudiera causar un daño real.
  • N3: El espía sobrevivió a la "noche" (una nueva sesión) y fue vuelto a leer por el pasante.
  • N4: El espía intentó hacer algo malo, pero el sistema detuvo la acción.
  • N5a/N5b: ¡El espía tuvo éxito! El daño fue hecho.

Al usar este marcador, pudieron ver que algunos sistemas eran buenos deteniendo a los espías en la puerta (N1) pero malos deteniéndolos una vez que estaban dentro (N3). Otros eran lo opuesto.

Lo que Encontraron: Todo Depende de la Pareja

El gran descubrimiento fue que la seguridad depende de la combinación específica entre el cerebro del robot (el modelo de IA) y su mochila (el harness).

  • Nadie es Perfecto: No hubo un solo sistema que fuera el mejor en todo. Por ejemplo, un sistema (Codex CLI) era increíble detectando espías en sus herramientas y memoria, pero era en realidad el peor detectándolos en sus "Habilidades". Otro sistema (Claude Code) era excelente en habilidades pero más débil en otras áreas.
  • El Cerebro También Importa: Si tomas la misma mochila y pones un cerebro de IA diferente dentro de ella, la puntuación de seguridad cambia drásticamente. Un cerebro puede ser muy cuidadoso y atrapar al espía, mientras que otro puede ser demasiado confiado y dejarlo pasar.
  • La Trampa del "Mismo Puntaje": Dos sistemas pueden tener la misma "Tasa de Éxito de Ataque" (lo que significa que ambos fallaron el mismo número de veces). Pero cuando miras las etapas, uno puede haber fallado temprano (N1), mientras que el otro dejó al espía vagando durante días (N3) antes de fallar. Esto significa que un simple puntaje de "pasa/falla" oculta muchos detalles peligrosos.

La Conclusión

El artículo concluye que no podemos simplemente mirar a un robot y decir "Es seguro" o "Es inseguro". La seguridad es una danza compleja entre el software que contiene la memoria y la IA que piensa. Si queremos detener estos ataques de "espía durmiente", necesitamos construir sistemas que vigilen todo el viaje del riesgo, no solo el resultado final. Necesitamos saber exactamente dónde se rompió la defensa para poder arreglar esa parte específica de la mochila.

En resumen, los investigadores demostraron que, en el mundo de los agentes de IA, un peligro oculto puede dormir durante mucho tiempo, y atraparlo requiere una mirada mucho más detallada que simplemente verificar si el robot sigue funcionando. Proporcionaron el mapa y el marcador para ayudarnos a encontrar exactamente dónde están las grietas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →