← Últimos artículos
💻 computer science

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

Este artículo presenta CrypFormBench, un benchmark exhaustivo que comprende 700 instancias a través de 677 esquemas criptográficos y 7 lenguajes de verificación formal para evaluar y revelar las limitaciones actuales de los modelos de lenguaje de gran tamaño al generar y corregir pruebas de seguridad formal, ofreciendo al mismo tiempo estrategias prácticas para mejorar su rendimiento.

Autores originales: Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

Publicado 2026-06-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El panorama general: El problema del "Traductor"

Imagina que eres un maestro arquitecto que diseña bóvedas increíblemente seguras (esquemas criptográficos). Escribes tus planos en inglés sencillo para que cualquiera pueda entender el plan. Sin embargo, para construir y probar realmente estas bóvedas en busca de debilidades, necesitas traducir esos planos en inglés a un lenguaje muy estricto, antiguo y complejo que solo ciertos robots de alta tecnología específicos (herramientas de verificación formal como Scyther o Tamarin) pueden entender.

Esta traducción es difícil. Requiere de un experto humano que conozca tanto el diseño de la bóveda como el estricto lenguaje del robot. Si se te escapa una sola coma diminuta o usas la palabra equivocada, el robot rechaza el plano o, peor aún, construye una bóveda que parece segura pero tiene una puerta trasera oculta.

La pregunta: ¿Pueden los Modelos de Lenguaje Extensos (LLM) —los chatbots de IA que usamos hoy en día— actuar como estos traductores expertos? ¿Pueden tomar una descripción en inglés sencillo de un protocolo de seguridad y escribir instantáneamente el código perfecto y sin errores para los robots de seguridad?

La respuesta (según este artículo): No del todo todavía. Están mejorando en la lectura y la corrección, pero todavía tienen dificultades para escribir desde cero.


La solución: CrypFormBench (El "Gimnasio" para la IA)

Para averiguar exactamente qué tan buenos son estos traductores de IA, los investigadores construyeron un enorme campo de pruebas llamado CrypFormBench (o C.F.B.).

Piensa en esto como un gimnasio con 700 diferentes estaciones de entrenamiento.

  • El equipo: Reunieron 700 protocolos de seguridad del mundo real (como los que se usan en tu teléfono, banca o internet).
  • Los lenguajes: Tradujeron estos protocolos a 7 "lenguajes de robot" diferentes (lenguajes formales como SPDL, HLPSL, EasyCrypt, etc.).
  • Las pruebas: No solo le pidieron a la IA que escribiera código. Probaron cinco habilidades específicas:
    1. Interpretación: "Aquí hay un código de robot; explícamelo en inglés". (Lectura)
    2. Generación: "Aquí hay una descripción en inglés; escribe el código del robot". (Escritura desde cero)
    3. Completado: "Aquí hay un código de robot con huecos; llena los espacios en blanco". (Reparación de trabajo parcial)
    4. Transformación: "Aquí está el código en el Lenguaje A; reescríbelo en el Lenguaje B". (Traducción entre robots)
    5. Corrección: "Este código de robot tiene un error; arréglalo". (Depuración)

Los resultados: La boleta de calificaciones de la IA

Los investigadores probaron 9 de los modelos de IA más inteligentes disponibles (incluyendo GPT-4o, Claude-3.5 y DeepSeek). Esto es lo que encontraron:

1. La habilidad de "Saber leer" (Interpretación y Completado)

  • Analogía: Imagina a un estudiante que es muy bueno leyendo un libro de texto y puede completar las palabras que faltan en una oración porque el contexto ya está ahí.
  • Resultado: Las IA fueron sorprendentemente buenas en esto. Cuando se les dio un fragmento de código con algunas partes faltantes, o se les pidió explicar qué hacía una pieza de código, funcionaron muy bien. Entendieron la "gramática" de los lenguajes de seguridad.

2. La habilidad de "Saber escribir" (Generación y Transformación)

  • Analogía: Ahora imagina pedirle a ese mismo estudiante que escriba un libro de texto completo desde cero, o que traduzca un libro del francés al japonés sin un diccionario. Comienzan a alucinar, inventando reglas o olvidando la gramática estricta.
  • Resultado: Aquí es donde las IA fallaron.
    • Generación: Cuando se les pidió escribir un protocolo de seguridad completo a partir de una descripción en inglés sencillo, la mayoría de las IA produjeron código que los robots ni siquiera podían ejecutar. Era como escribir una oración con una sintaxis rota.
    • Transformación: Cuando se les pidió traducir código de un lenguaje de robot a otro, las IA a menudo se confundieron. Mezclaron las reglas de los dos lenguajes, creando un código "Frankenstein" que no funcionaba en ninguno de los dos.
    • La puntuación: Incluso la mejor IA (Claude-3.5) solo obtuvo 48.7 de 100. Esto significa que menos de la mitad de sus intentos eran realmente utilizables por las herramientas de seguridad.

3. La habilidad de "Corregir" (Corrección)

  • Analogía: Si le das al estudiante una oración con un error tipográfico claro (por ejemplo, "recive" en lugar de "recibe"), puede arreglarlo fácilmente. Pero si la oración es gramaticalmente correcta pero lógicamente errónea (por ejemplo, "La bóveda está abierta para todos, pero es segura"), le costará encontrar el error lógico.
  • Resultado: Las IA fueron buenas corrigiendo errores simples de sintaxis (errores tipográficos). Sin embargo, tuvieron dificultades con los errores "semánticos": corregir la lógica del propio protocolo de seguridad.

¿Por qué es esto tan difícil?

El artículo explica que estos "lenguajes de robot" no son como Python o Java. Son extremadamente estrictos.

  • La regla de "Un solo error": En la programación normal, si te falta un punto y coma, la computadora podría simplemente quejarse. En estos lenguajes de seguridad, una palabra faltante puede cambiar todo el significado de la prueba de seguridad, haciendo que una bóveda segura parezca insegura, o viceversa.
  • El problema del "Contexto": Estos protocolos suelen depender de largas cadenas de eventos (por ejemplo, "Si Alice envía un mensaje en el paso 1, Bob debe responder en el paso 2, pero solo si no ha visto un mensaje del paso 0"). Las IA a menudo pierden el rastro de estas largas cadenas.

¿Qué podemos hacer? (Las "Ruedas de entrenamiento")

El artículo sugiere que, aunque todavía no podemos confiar en las IA para hacer todo el trabajo solas, podemos usarlas como asistentes si les damos la ayuda adecuada:

  • Prompting de pocos disparos (Few-Shot Prompting): En lugar de solo decir "Escribe esto", muéstrale a la IA tres ejemplos de cómo escribirlo primero. Esto actúa como una hoja de trucos.
  • Pass@K: Pide a la IA que intente escribir el código 5 veces, y luego elige la mejor versión. Esto aumenta las probabilidades de obtener una versión que funcione.
  • Humano en el bucle (Human-in-the-Loop): Usa la IA para redactar el código, pero que un experto humano lo revise antes de que el robot de seguridad lo ejecute.

La conclusión final

El artículo concluye que los Modelos de Lenguaje Extensos son actualmente excelentes asistentes de investigación para comprender y corregir código de seguridad, pero aún no son arquitectos confiables para construir nuevos protocolos de seguridad desde cero.

Pueden ayudarte a leer el manual y corregir tus errores tipográficos, pero sigues necesitando a un experto humano para asegurar que la bóveda sea realmente segura antes de entregar las llaves. El benchmark (CrypFormBench) ya está disponible para que otros investigadores prueben nuevos modelos de IA contra estos mismos estándares estrictos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →