← Últimos artículos
🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

Este artículo presenta SmartEval, una evaluación integral que incluye un corpus de 9.000 contratos en Solidity generados por modelos de lenguaje grandes (LLM), una rúbrica de evaluación de cinco dimensiones y una pipeline validada que revela modos de fallo característicos mientras demuestra que los contratos generados por LLM pueden superar a las implementaciones de referencia en cuanto a adherencia funcional.

Autores originales: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un jefe que solo habla inglés llano y quieres contratar a un equipo de robots súper inteligentes pero de pensamiento literal para escribir las reglas de un banco digital (llamado "contrato inteligente"). Le dices a los robots: "Si alguien deposita dinero, entrégales un recibo. Si intentan robar, cierra la puerta".

El problema es que estos robots son excelentes siguiendo instrucciones palabra por palabra, pero a veces pasan por alto el espíritu de las reglas o cometen pequeños errores que podrían hacer que el banco se colapse. En el mundo real, una vez que se construye un banco digital, no puedes simplemente parchearlo; es permanente. Por lo tanto, necesitas una forma de probar si los robots hicieron un buen trabajo antes de dejarlos dirigir el espectáculo.

Este artículo introduce SmartEval, un sistema gigante de "boletín de calificaciones" diseñado para calificar estos contratos digitales escritos por robots.

Así es como el artículo lo desglosa, utilizando analogías simples:

1. La Gran Prueba (El Punto de Referencia)

Los investigadores crearon una prueba masiva que involucró 9,000 contratos digitales diferentes.

  • La Fuente: Tomaron 9,000 conjuntos de instrucciones escritas en inglés llano (como "quiero un acuerdo de alquiler para un apartamento").
  • Los Robots: Alimentaron estas instrucciones a una inteligencia artificial de primer nivel (GPT-4o-mini) para generar el código real.
  • Los Expertos: También tuvieron expertos humanos que escribieron las versiones "perfectas" de estos mismos contratos.
  • El Objetivo: Comparar el trabajo del Robot contra el trabajo del Experto para ver quién lo hizo mejor.

2. El Sistema de Calificación (La Rúbrica)

En lugar de simplemente decir "Aprobado" o "Reprobado", SmartEval utiliza un sistema de calificación de cinco estrellas para evaluar los contratos en cinco aspectos específicos:

  1. ¿Hicieron todo lo que se pidió? (Completitud Funcional)
  2. ¿Usaron los nombres correctos para las cosas? (Fidelidad de Variables)
  3. ¿Fluyó la lógica correctamente? (Correctitud de la Máquina de Estados) — Piensa en esto como asegurarte de que un semáforo vaya de Verde a Amarillo a Rojo, no de Verde a Rojo.
  4. ¿Obtuvieron las reglas de negocio correctas? (Fidelidad de la Lógica de Negocio) — Esta es la parte más importante, como asegurarse de que el alquiler se cobre realmente.
  5. ¿Es el código limpio y bien escrito? (Calidad del Código)

3. La "Red de Seguridad" (Pipeline)

Los investigadores no solo le pidieron a la IA que escribiera el código y esperaran lo mejor. Construyeron una línea de fábrica con un inspector de seguridad:

  • Paso 1: Un "Traductor" convierte tu frase en inglés en un plano estricto.
  • Paso 2: La IA "Constructora" escribe el código basado en ese plano.
  • Paso 3: La IA "Inspectora" busca agujeros de seguridad (como un ladrón intentando forzar la cerradura).
  • La Puerta Mágica: Si el Inspector encuentra un problema grave (un problema de severidad "media" o "alta"), el código no puede salir de la fábrica. Se envía de vuelta a una IA "Refinadora" para corregir el error, y luego se vuelve a verificar. Este bucle ocurre hasta que el código sea seguro.

4. Los Resultados Sorprendentes

Cuando compararon los contratos de los Robots con los contratos de los Expertos Humanos, ocurrió algo interesante:

  • Los Robots Ganaron (en papel): Los contratos generados por IA realmente obtuvieron una puntuación más alta (aproximadamente 8 puntos) que los escritos por humanos.
  • ¿Por qué? Los robots fueron extremadamente literales. Si decías "agrega un botón", agregaban un botón. Siguieron las instrucciones perfectamente.
  • La Ventaja Humana: Los expertos humanos a veces "cortaban esquinas" para hacer el código más rápido o barato (ahorrando tarifas de "gas"), o reorganizaban las cosas para que se viera más limpio. Como la prueba era estricta sobre seguir las instrucciones exactas, los humanos perdieron puntos por ser demasiado creativos o eficientes.
  • El Problema: Los robots tuvieron dificultades con tareas complejas. Cuando las instrucciones se volvieron muy largas y complicadas (como un contrato con 8+ reglas diferentes), los robots comenzaron a cometer errores y el código a menudo falló al compilarse (se rompió).

5. ¿Funcionó el Sistema de Calificación?

Los investigadores estaban preocupados: "¿La IA se está calificando a sí misma?". Para demostrar que no estaban haciendo trampa, realizaron tres verificaciones:

  1. Verificación Humana: Tres expertos con doctorado de la Universidad de Columbia calificaron 30 de los contratos. Sus puntuaciones coincidieron casi perfectamente con las de la IA (dentro de 0.34 puntos).
  2. Verificación de Herramienta: Ejecutaron el código a través de un escáner de seguridad estándar, no basado en IA (llamado Slither). El auditor de IA y la herramienta coincidieron en los problemas de seguridad el 79% de las veces.
  3. La Prueba "Qué pasaría si": Desactivaron partes de su línea de fábrica (como el inspector de seguridad) y vieron que la calidad disminuía. Esto demostró que cada parte de su sistema era realmente necesaria.

La Conclusión

SmartEval es una nueva y confiable forma de probar si la IA puede escribir contratos digitales seguros y funcionales. Descubrió que, aunque la IA es increíble siguiendo instrucciones literalmente, todavía lucha con la lógica compleja y de múltiples pasos. El sistema también demostró que al agregar un "inspector de seguridad" y un "bucle de reparación", puedes convertir una IA desordenada y propensa a errores en un generador de código confiable que es más seguro que un solo experto humano trabajando solo.

Nota Importante: El artículo admite que, aunque el código parece correcto y se compila, no han probado si los contratos se comportan realmente correctamente cuando el dinero real se mueve a través de ellos en un entorno en vivo. También señalan que la IA aún no sabe cómo ahorrar dinero (tarifas de gas) como lo hace un experto humano.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →