← Últimos artículos
🤖 AI

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

Este artículo presenta SRE-Bench, el primer benchmark realista y libre de contaminación para evaluar las capacidades de ingeniería inversa agéntica en código binario, revelando que incluso los modelos de lenguaje de gran tamaño más fuertes y de vanguardia luchan por igualar el rendimiento de nivel humano debido a los desafíos únicos de analizar binarios no vistos y protegidos.

Autores originales: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

Publicado 2026-08-13
📖 3 min de lectura☕ Lectura para el café

Autores originales: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio. Normalmente, cuando investigas un crimen, puedes leer el diario del sospechoso, sus notas manuscritas y sus correos electrónicos. Esto es como mirar el código fuente: las instrucciones originales, legibles para los humanos, que le dicen a una computadora qué hacer. Pero en el mundo real de la ciberseguridad, los malos no dejan sus diarios a la vista de todos. Te entregan una caja cerrada y sellada sin instrucciones en el exterior. Esto es un binario: un archivo hecho de bytes puros de computadora que parece un jeroglífico para los humanos. Para descubrir qué hay dentro, tienes que realizar ingeniería inversa: desarmar la caja pieza por pieza para adivinar cómo funciona la cerradura y cuáles son su contenido.

Ahora, imagina que hemos construido detectives de IA superinteligentes (llamados agentes de IA) que son increíbles leyendo esos diarios. Pueden detectar mentiras y encontrar pistas en el texto más rápido que un humano. Pero, ¿pueden estos detectives de IA abrir las cajas cerradas? Esa es la gran pregunta. Si la IA solo puede leer el diario pero no puede abrir la caja, no es una verdadera heroína de la ciberseguridad. Necesitamos saber si estos detectives digitales pueden realmente hacer el trabajo duro de la ingeniería inversa, o si solo están dependiendo de patrones de los datos que vieron en su entrenamiento.

Este artículo presenta un test completamente nuevo y superdifícil llamado SRE-Bench para averiguarlo. Los investigadores crearon 19 programas completamente nuevos y secretos desde cero —como crear 19 videojuegos y sistemas de seguridad únicos y complejos que ninguna IA ha visto antes—. Luego, encerraron estos programas con 44 tipos diferentes de guardias de seguridad de alta tecnología (técnicas de ofuscación) para hacerlos increíblemente difíciles de descifrar. Probaron cinco de los modelos de IA más inteligentes del mundo contra estas cajas cerradas, incluyendo versiones futuras como GPT-5.6-sol y Claude-Opus-5 de una evaluación de 2026.

Los resultados fueron una llamada de atención. Incluso la IA más fuerte en este estudio, GPT-5.6-sol, solo logró resolver completamente cerca del 31.5% de los casos (obteniendo una puntuación perfecta en 80 de 262 instancias). Las otras IA lo hicieron incluso peor, y algunas no lograron resolver ni uno solo. El estudio encontró que estos agentes de IA se comportan de manera muy diferente a los expertos humanos. Mientras que los humanos tienen dificultades con cosas como la optimización de código (que hace que el código sea eficiente pero desordenado), las IA apenas notaron esos obstáculos. En su lugar, las IA dependieron fuertemente de ver nombres y etiquetas en el código; cuando los investigadores eliminaron esos nombres, el rendimiento de la IA se desplomó. Lo más importante es que el estudio demuestra que ser bueno leyendo código fuente no significa que una IA sea buena descifrando binarios. La "caja cerrada" sigue siendo un desafío masivo y sin resolver, y SRE-Bench es la primera prueba realista y justa para medir qué tan lejos estamos realmente de resolverlo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →