← Últimos artículos
💻 computer science

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

Este artículo sostiene que las evaluaciones futuras de los agentes autónomos de pruebas de penetración deben establecer líneas de base de agentes simples controlados y emparejados con el modelo para distinguir con precisión las mejoras de rendimiento derivadas de innovaciones arquitectónicas de aquellas atribuibles a las mejoras del modelo subyacente.

Autores originales: Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

Publicado 2026-07-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una ciudad gigante y en constante cambio de edificios digitales. Algunos de estos edificios tienen trampas ocultas y cerraduras rotas: agujeros de seguridad que los actores malintencionados podrían usar para colarse. Durante décadas, el trabajo de encontrar estos agujeros perteneció a expertos humanos, como cerrajeros digitales que recorren cada habitación, probando puertas y ventanas. Pero la ciudad está creciendo demasiado rápido; nuevos edificios aparecen cada segundo y los cerrajeros no pueden seguir el ritmo. Así que los científicos empezaron a construir "cerrajeros robóticos" utilizando Inteligencia Artificial. Estos robots están impulsados por Modelos de Lenguaje Extensos (LLM), que son como cerebros superinteligentes que han leído casi todo en internet y pueden escribir código, razonar a través de problemas y seguir instrucciones.

La gran pregunta en este campo no es solo "¿Puede el robot encontrar la cerradura?", sino "¿Qué parte del éxito del robot proviene de su cerebro y qué parte proviene de las herramientas sofisticadas que le dimos?". Imagina que tienes a un estudiante genio. Si le das un cuaderno sencillo y un bolígrafo, podría resolver un problema matemático. Si le das una calculadora de alta tecnología, un equipo de tutores y un mapa especial, podría resolverlo más rápido. Pero, ¿el calculador lo hizo más inteligente o solo le ayudó? En el mundo de la seguridad de la IA, los investigadores han estado construyendo "arneses" complejos —equipos de agentes de IA, sistemas de memoria especiales y herramientas de búsqueda— para ayudar a la IA a hackear sitios web. Pero debido a que siguen cambiando el cerebro de la IA y las herramientas al mismo la vez, nadie sabía si las herramientas sofisticadas estaban haciendo realmente el trabajo pesado, o si la IA simplemente estaba mejorando por su cuenta.

Este artículo, titulado "Baselines Before Architecture" (Líneas de base antes de la arquitectura), interviene para zanjar la disputa con un experimento muy cuidadoso. Los investigadores configuraron una prueba controlada utilizando un conjunto estándar de 104 desafíos digitales llamados la marca de referencia XBOW. En lugar de construir un robot nuevo y sofisticado, tomaron tres asistentes de codificación "planos" existentes —llamados Codex, OpenCode y Pi— y les pidieron resolver los desafíos usando un único y poderoso cerebro de IA (GPT-5) y sin herramientas de seguridad especiales. Querían ver qué tan bien podía desempeñarse una IA "desnuda" antes de añadir cualquier accesorio extra.

Los resultados fueron una mezcla de sorpresas y verdades prácticas. Primero, los agentes de codificación planos fueron sorprendentemente fuertes. El agente "Codex", ejecutándose en el modelo GPT-5, resolvió aproximadamente el 67% de los desafíos en su primer intento. Cuando los investigadores permitieron que lo intentara de nuevo (ejecutando la misma prueba dos veces y combinando los resultados), resolvió el 77.9% de los desafíos. Esto es algo importante porque significa que un robot de codificación simple y de propósito general ya puede manejar una gran parte del trabajo sin necesidad de un equipo de seguridad complejo.

El estudio también probó dos ideas específicas que muchos pensaban que eran esenciales. Una fue el "prompting de seguridad", donde le das a la IA una hoja de instrucciones especial diciéndole que piense como un hacker. La otra fue la idea de que las arquitecturas complejas de múltiples agentes (donde diferentes roles de IA hablan entre sí) son necesarias para un rendimiento óptimo. El artículo encontró que las "instrucciones de hacker" especiales en realidad hicieron que la IA funcionara peor, resolviendo menos desafíos y costando más dinero. En cuanto a las arquitecturas complejas, el artículo comparó los resultados de Codex con dos famosos sistemas de alta tecnología llamados MAPTA y PentestGPT V2.

Aquí está el matiz: los sistemas sofisticados todavía tenían una ligera ventaja. Al ser emparejados con el mismo cerebro de IA, el sistema especializado MAPTA resolvió aproximadamente 9.6 puntos porcentuales más desafíos que el Codex plano. Sin embargo, el artículo mostró que esta brecha no era tan grande como parecía. Cuando los investigadores actualizaron el agente Codex plano a un cerebro más nuevo y más inteligente (GPT-5.5), resolvió el 92.3% de los desafíos en su primer intento y el 95.2% al combinar dos ejecuciones. Este nuevo agente plano de hecho superó las puntuaciones principales de los sistemas complejos más antiguos, incluso sin ninguna de sus herramientas sofisticadas.

La principal conclusión es una advertencia para la comunidad científica: No asumas que una nueva arquitectura compleja es la heroína solo porque obtiene una puntuación alta. A menudo, la puntuación proviene de que el modelo de IA se vuelve más inteligente, no de que las herramientas se vuelven más sofisticadas. El artículo sugiere que antes de afirmar que un nuevo "arnés de seguridad" es un avance, los investigadores deben primero mostrar cuánto mejor es en comparación con un agente de codificación simple y plano utilizando exactamente el mismo cerebro de IA. Si bien las herramientas especializadas aún pueden ayudar a ahorrar dinero y tiempo, la IA "plana" ya está realizando la mayor parte del trabajo pesado, y simplemente esperar a la siguiente generación de modelos de IA podría ser tan efectivo como construir un robot más complicado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →