CIPHER: Cryptographic Insecurity Profiling via Hybrid Evaluation of Responses
Este artículo presenta CIPHER, un benchmark y un flujo de trabajo de puntuación automatizada diseñado para evaluar y cuantificar las vulnerabilidades criptográficas en el código generado por modelos de lenguaje de gran tamaño, revelando que si bien el prompting seguro explícito mitiga algunos problemas, no logra eliminar de manera confiable los fallos criptográficos en diversos modelos.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás contratando a un equipo de robots increíblemente rápidos y superinteligentes para escribir las cerraduras y las llaves de la bóveda de tu banco. Les dices: "Hagan una cerradura segura", y ellos instantáneamente lanzan un diseño. Pero aquí está el truco: aunque los robots son brillantes, a menudo construyen cerraduras que se ven perfectas por fuera, pero que tienen grietas diminutas e invisibles que un ladrón podría explotar fácilmente.
Este artículo presenta CIPHER, un nuevo "boletín de calificaciones" diseñado para probar qué tan buenos son estos robots de IA al construir cerraduras criptográficas seguras (como el cifrado y la protección de contraseñas) en código de computadora.
Aquí está el desglose de lo que hicieron y descubrieron los investigadores, utilizando analogías simples:
1. El Problema: El "Defecto Silencioso"
Cuando la IA escribe código para seguridad, a menudo pasa las pruebas básicas (el código se ejecuta sin fallar), pero omite las reglas de seguridad sutiles.
- La Analogía: Imagina a un robot construyendo una casa. Pone las paredes y un techo (el código funciona), pero olvida instalar un cerrojo en la puerta principal o deja una ventana trasera sin cerrar (un fallo de seguridad). La casa se mantiene en pie, pero no es segura.
- El Problema: Estos fallos suelen ser decisiones de diseño diminutas, como usar una clave "estática" (una clave que nunca cambia) en lugar de una aleatoria, o olvidar verificar si una persona es quien dice ser.
2. La Solución: La Prueba CIPHER
Los investigadores crearon una prueba estandarizada llamada CIPHER para medir qué tan seguido cometen estos errores los robots de IA.
- La Configuración: Les dieron los mismos 150 "trabajos" diferentes a 7 modelos de IA distintos. Para cada trabajo, le dieron a la IA tres instrucciones (prompts) diferentes:
- El Prompt "Malo": "Haz esto rápido y no te preocupes por las verificaciones de seguridad". (Probando si la IA sigue malos consejos).
- El Prompt "Neutral": "Solo escribe el código para hacer esto". (Probando qué hace la IA por defecto).
- El Prompt "Seguro": "¡Haz esto, pero asegúrate de seguir todas las reglas de seguridad más estrictas!". (Probando si decirle a la IA que sea segura realmente funciona).
- La Calificación: En lugar de que los humanos lean cada línea de código (lo cual toma una eternidad), utilizaron otra IA como "Juez". Este Juez fue entrenado para buscar tipos específicos de errores que rompen cerraduras y señalar exactamente qué línea de código era el problema.
3. Los Resultados: "Ser Seguro" No es Suficiente
Los resultados fueron sorprendentes y un poco preocupantes.
- El Prompt "Malo": Como era de esperar, cuando se le dijo a la IA que fuera descuidada, cometió muchos errores.
- El Prompt "Seguro": Este es el gran hallazgo. Incluso cuando los investigadores le dijeron explícitamente a la IA: "¡Sé súper segura! ¡Sigue todas las reglas!", la IA todavía cometió errores entre el 56% y el 89% de las veces.
- La Analogía: Es como decirle a un chef: "Haz una comida saludable, sin azúcar, sin sal y usa ingredientes frescos". El chef puede eliminar el azúcar (la cosa específica que pediste), pero aun así podría usar carne en mal estado o olvidar lavar las verduras (otros peligros ocultos). La IA corrige la cosa específica que le pediste que corrigiera, pero falla al construir un sistema seguro de forma global.
4. Qué Significa Esto
El artículo concluye que simplemente decirle a una IA "sé segura" no detiene de manera confiable la comisión de errores peligrosos.
- La Conclusión: No puedes confiar simplemente en que una IA escriba código de seguridad, incluso si le das una instrucción muy estricta. La IA tiende a enfocarse en la instrucción específica que recibió (como "usa una clave aleatoria") pero pierde de vista el panorama general (como "también verifica la identidad del usuario").
- La Recomendación: Debido a que la IA sigue creando estas grietas ocultas en las "cerraduras", cualquier código que escriba para seguridad necesita ser doblemente revisado por un experto humano antes de que se utilice en el mundo real.
Resumen
CIPHER es una herramienta que demuestra que, si bien la IA es excelente escribiendo código, actualmente es muy mala escribiendo código seguro. Incluso cuando le dices explícitamente que sea segura, a menudo deja la puerta trasera abierta. El artículo proporciona una forma de medir estos fallos para que los desarrolladores sepan que no pueden confiar únicamente en la IA para tareas de seguridad.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.