← Últimos artículos
🤖 machine learning

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

Este artículo presenta SEC-bench Pro, un riguroso conjunto de pruebas que incluye 183 vulnerabilidades del mundo real en V8 y SpiderMonkey y que revela que los agentes de codificación basados en modelos de lenguaje actuales tienen dificultades con tareas de seguridad de software de largo alcance, logrando como máximo una tasa de éxito del 38,8% incluso con modelos de vanguardia.

Autores originales: Hwiwon Lee, Jiawei Liu, Dongjun Kim, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

Publicado 2026-05-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hwiwon Lee, Jiawei Liu, Dongjun Kim, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un equipo de detectives superinteligentes, potenciados por IA, para encontrar trampas ocultas en un motor de videojuegos masivo y complejo. Estos motores (llamados motores de JavaScript) ejecutan el código que hace que las páginas web y las aplicaciones funcionen. Si un detective encuentra una trampa, debe mostrar exactamente cómo activarla (un "Prueba de Concepto" o PoC) para que los desarrolladores del juego puedan solucionarla.

Este artículo presenta una nueva prueba muy rigurosa llamada SEC-bench Pro para evaluar qué tan buenos son realmente estos detectives de IA a la hora de encontrar estas trampas en el mundo real.

El Problema con las Pruebas Antiguas

Las pruebas anteriores eran como darle al detective un mapa del tesoro que ya marcaba la "X" donde estaba el tesoro. Podrían haber dicho: "Ve a la línea 500 y presiona este botón para romper el juego".

  • El Problema: La caza real de errores no funciona así. Los detectives reales deben examinar todo el código, deducir dónde podría estar la trampa y luego intentar activarla sin saber exactamente dónde se encuentra. Las pruebas antiguas no medían esta habilidad real; solo medían si la IA podía seguir un mapa.

La Nueva Prueba: SEC-bench Pro

Los autores crearon una prueba más difícil utilizando dos motores de juego famosos: V8 (utilizado por Google Chrome) y SpiderMonkey (utilizado por Firefox).

  1. La Configuración: Tomaron 183 trampas reales y confirmadas que humanos habían encontrado anteriormente.
  2. El Entorno: Recrearon la versión exacta de "máquina del tiempo" del software donde existía la trampa, además de la versión donde fue corregida.
  3. Las Reglas: Se proporcionó a los agentes de IA el código sin procesar y una descripción vaga de un problema. Debían:
    • Determinar la ruta específica del código hacia la trampa.
    • Escribir un script (el PoC) para provocar el fallo.
    • Demostrar que el script solo rompe la versión antigua y está corregido en la nueva versión.

El Juez de "Tres Imágenes"

Esta es la parte más importante de su nueva prueba. En el pasado, si una IA provocaba cualquier fallo, obtenía un punto. Pero una IA podría romper accidentalmente algo más en el juego que no fuera la trampa específica que estaban buscando.

SEC-bench Pro utiliza un Juez de Tres Imágenes (un árbitro de IA sofisticado):

  • Imagen 1 (La Trampa): ¿Rompe el script la versión antigua?
  • Imagen 2 (La Solución): ¿El script deja de romper la versión nueva (donde se aplicó el parche)?
  • Imagen 3 (La Más Reciente): ¿El script rompe la versión más reciente (donde podrían haber ocurrido otras correcciones)?

Si la IA provoca un fallo en la versión antigua pero también falla la versión corregida, el Juez dice: "No encontraste la trampa específica; simplemente rompiste el juego en general". Esto evita que la IA obtenga puntos por errores afortunados e irrelevantes.

Los Resultados: Los Detectives de IA Luchan

El artículo probó a tres detectives de IA de primer nivel (potenciados por modelos como GPT-5.4, Opus 4.6 y Kimi-K2.6). Esto es lo que sucedió:

  • La Puntuación: Incluso la IA más inteligente solo pudo resolver aproximadamente entre el 32% y el 39% de las trampas. Eso significa que fallaron en más del 60% de los casos.
  • El Novato de "Peso Abierto": Una IA más barata y de código abierto (Kimi-K2.6) solo resolvió aproximadamente el 11.7% de las trampas de V8.
  • El Efecto del Trabajo en Equipo: Curiosamente, los detectives de IA encontraron trampas diferentes. Cuando se combinaron los resultados de las dos mejores IAs, resolvieron aproximadamente el 48% de las trampas de SpiderMonkey juntas, pero ninguna pudo hacerlo sola. Son como dos detectives con especialidades diferentes; uno es bueno encontrando un tipo de pista, el otro un tipo diferente.

¿Por Qué Fallaron?

El artículo encontró dos razones principales por las que las IAs tuvieron dificultades:

  1. Demasiadas Suposiciones (El enfoque de "Disparar y Rezar"): Una IA (Claude) intentó generar miles de scripts. La mayoría no rompían realmente nada, o rompían lo incorrecto. Era como lanzar un millón de dardos a un tablero y esperar que uno diera en el centro.
  2. Demasiada Cautela (El enfoque del "Sobre-pensador"): Otra IA (Codex) fue muy cuidadosa. Analizaba el código, decidía que una trampa podría estar allí, pero si no podía probarlo al 100% antes de enviarlo, se rendía y decía: "No puedo hacerlo". Se perdió muchas trampas porque tenía demasiado miedo a equivocarse.

La Gran Conclusión

El artículo concluye que, aunque la IA está mejorando en la escritura de código, aún no es muy buena en el largo y difícil proceso de cazar errores de seguridad en software complejo y del mundo real.

La mejor IA actual puede encontrar algunas trampas, pero se pierde la mayoría. El nuevo punto de referencia (SEC-bench Pro) demuestra que necesitamos mejores herramientas para ayudar a estas IAs a conectar los puntos entre el código y las trampas ocultas, en lugar de simplemente esperar que tengan suerte con un fallo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →