← Últimos artículos
💻 computer science

Can Developers rely on LLMs for Secure IaC Development?

Este estudio evalúa GPT-4o y Gemini 2.0 Flash para el desarrollo seguro de Infraestructura como Código, encontrando que si bien los prompts guiados mejoran la detección de olores de seguridad tanto en fragmentos simplificados como en repositorios del mundo real, los modelos aún tienen dificultades para generar código seguro, con solo una pequeña fracción de las salidas cumpliendo con los estándares de seguridad incluso cuando se les instruye explícitamente.

Autores originales: Ehsan Firouzi, Shardul Bhatt, Mohammad Ghafari

Publicado 2026-02-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ehsan Firouzi, Shardul Bhatt, Mohammad Ghafari

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás construyendo una casa, pero en lugar de usar ladrillos y mortero, estás usando código para ensamblar automáticamente tus paredes, ventanas y sistemas de seguridad. Esto se llama Infraestructura como Código (IaC). Es como tener un robot que construye tu infraestructura digital por ti.

El problema es que, si le das al robot un mal plano, podría construir una casa con puertas sin llave, ventanas mirando hacia la calle o una caja fuerte donde la llave está pegada a la puerta principal. Estos errores se llaman "olores de seguridad" (security smells).

Los autores de este artículo se hicieron una gran pregunta: ¿Podemos confiar en los chatbots de IA (como GPT-4o y Gemini) para ayudarnos a escribir estos planos de forma segura, o para detectar los errores en ellos?

Esto es lo que encontraron, desglosado en historias sencillas:

1. La prueba de "Detectar el error" (Detección)

Los investigadores le dieron a la IA dos tipos de tareas: encontrar errores en fragmentos de código cortos (como los que se encuentran en Stack Overflow) y encontrar errores en archivos de proyectos reales y completos (de GitHub).

  • El escenario de la "Petición vaga": Imagina preguntarle a un guardia de seguridad: "Mira esta casa y dime si es segura".
    • El resultado: La IA fue capaz de detectar problemas obvios en fragmentos cortos (un éxito del 70-80%). Pero al observar proyectos completos y complejos, la IA pasó por alto más de la mitad de las fallas peligrosas. Era como si el guardia solo notara la puerta principal sin llave, pero pasara por alto una ventana trasera rota.
  • El escenario del "Paso a paso": Los investigadores le dieron entonces a la IA una lista de verificación específica: "Primero, revisa las cerraduras. Segundo, revisa las ventanas. Tercero, busca notas dejadas por el dueño anterior".
    • El resultado: Esto funcionó mucho mejor. La capacidad de la IA para encontrar errores aumentó significamente (alcanzando casi el 90% en un modelo).
    • El problema: Incluso cuando la IA encontraba el error, rara vez ofrecía una solución específica. Era como si el guardia dijera: "Oye, esa ventana está rota", pero no te entregara el vidrio para reemplazarlo.

2. La prueba de "Construir" (Generación)

Después, le pidieron a la IA que creara nuevos planos desde cero basados en peticiones específicas, algunas de las cuales estaban diseñadas para engañar a la IA y hacer que cometiera errores (por ejemplo, "Usa una cerradura débil" o "Deja la contraseña en el código").

  • El resultado: Aquí es donde la IA tuvo más dificultades.
    • Cuando se le pidió que construyera una casa segura, la IA construyó una casa segura solo el 7% de las veces.
    • En el otro 93% de los casos, construyó casas con trampas ocultas (fallas de seguridad) y a menudo ni siquiera te advertía de que las trampas estaban ahí.
    • Incluso cuando los investigadores le gritaban explícitamente: "¡Haz esto SEGURO!", la IA seguía construyendo casas inseguras el 80% de las veces.

3. El efecto "Imitador"

Los investigadores también comprobaron si la IA solo estaba copiando malos ejemplos que había visto antes. Descubrieron que el código que la IA generaba a menudo se parecía más al código generado por otras IA que a las respuestas "correctas" encontradas en los foros escritos por humanos. Es como si la IA hubiera aprendido de un grupo de personas que cometían todos los mismos errores, en lugar de aprender de los expertos.

La conclusión

El artículo concluye que, si bien la IA es una herramienta poderosa, no puedes confiar actualmente en ella por sí sola para mantener segura tu infraestructura digital.

  • Para encontrar errores: Ayuda, pero solo si le das instrucciones muy específicas y paso a paso. Sin esa guía, pasa por alto demasiados peligros.
  • Para escribir código: Actualmente es demasiado arriesgado dejar que escriba código de seguridad desde cero. Con frecuencia construye "casas" con puertas sin llave y no te advierte de ello.

La analogía: Piensa en la IA como un aprendiz de constructor muy rápido y muy seguro de sí mismo. Si le pides que "arregle esto", puede que encuentre algunas grietas. Pero si le pides que "construya una fortaleza", es probable que construya un castillo de cartón con una cerradura de papel, y no te dirá que no es realmente seguro. Todavía necesitas a un experto humano para que lo compruebe todo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →