← Últimos artículos
💻 computer science

NL2Scratch: An Executable Benchmark and Evaluation for Block-Based Programming

Este artículo presenta NL2Scratch, un benchmark ejecutable a gran escala y la métrica de Consistencia de Alineación Semántica (SAC) para abordar las limitaciones de la evaluación convencional de NL2Code en la programación basada en bloques, revelando que los LLM actuales a menudo logran una alta similitud léxica mientras fallan en capturar la alineación semántica necesaria para generar programas de Scratch correctos.

Autores originales: Heejin Do, Alexandre Ballenghien, Yang Wu, April Yi Wang

Publicado 2026-06-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Heejin Do, Alexandre Ballenghien, Yang Wu, April Yi Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a dibujar un cuadro basándose en tus instrucciones habladas. Si dices: "Dibuja un círculo rojo", el robot necesita entender exactamente qué significan "rojo" y "círculo" y cómo combinarlos.

Este artículo trata sobre una nueva prueba llamada NL2Scratch diseñada para ver qué tan bien puede hacerlo la IA, pero con un giro: en lugar de escribir código de texto (como Python), la IA tiene que construir programas usando bloques de Scratch. Scratch es el lenguaje de programación colorido y de arrastrar y soltar que los niños usan para hacer juegos y animaciones.

Aquí está el desgón de la historia del artículo, utilizando analogías sencillas:

1. El Problema: La trampa del "Se ve bien"

Durante años, los investigadores han probado la IA en la codificación basada en texto. Comprueban si la respuesta de la IA se parece a la respuesta correcta (como comprobar si dos frases comparten las mismas palabras).

Pero Scratch es diferente. Es como un set de LEGO.

  • En la codificación de texto, si te falta una coma, toda la frase podría romperse.
  • En Scratch, puedes tener los tipos de bloques correctos (un bloque de "mover", un bloque de "repetir") y las palabras correctas dentro de ellos, pero si los pones en el orden equivano o los conectas al disparador equivocado, el juego no funcionará.

El artículo argumenta que las pruebas actuales de IA son como juzgar un castillo de LEGO contando solo sus ladrillos. Si la IA usa el número correcto de ladrillos rojos y azules, la prueba dice: "¡Buen trabajo!", incluso si el castillo se cae porque los ladrillos están apilados al revés.

2. La Solución: Una Nueva Prueba y una Nueva Regla

Los autores construyeron NL2Scratch, una biblioteca masiva de 311,000 ejemplos.

  • La Fuente: Tomaron proyectos reales de Scratch hechos por humanos.
  • La Traducción: Utilizaron IA para escribir descripciones en inglés natural para estos proyectos (por ejemplo, "Cuando se hace clic en la bandera verde, haz que el gato se mueva 10 pasos").
  • El Filtro: Se aseguraron de que cada uno de los ejemplos funcione realmente en el motor de Scratch.

La Nueva Regla (SAC):
En lugar de solo contar palabras coincidentes, inventaron un nuevo instrumento de medición llamado Consistencia de Alineación Semántica (SAC).

  • Piensa en esto como una lista de verificación (checklist).
  • ¿Menciona la descripción el disparador correcto (como la bandera verde)?
  • ¿Menciona la acción correcta (como moverse)?
  • ¿Tiene los números correctos (como 10 pasos)?
  • SAC revisa cada elemento de esta lista. Si la IA acierta el "disparador" pero falla en el "número", la lista de verificación muestra una X roja, incluso si el resto de la frase parece perfecta.

3. El Gran Descubrimiento: La IA es buena en la Mímica, mala en el Significado

Los investigadores probaron varios modelos de IA inteligentes (como GPT-4 y modelos de código abierto) en esta nueva prueba. Esto es lo que encontraron:

  • La Ilusión del Éxito: Cuando utilizaban las pruebas de la vieja escuela (contar palabras), la IA parecía increíble. Acertaba entre el 93% y el 97% de las palabras. Sonaba como si supiera exactamente qué hacer.
  • La Prueba de Realidad: Cuando utilizaron la nueva lista de verificación SAC, la puntuación de la IA cayó drásticamente. Solo alrededor del 18% de las respuestas de la IA eran perfectamente correctas en su significado.
  • El Problema del "Juego Largo": Cuanto más largos y complejos eran los proyectos de Scratch, peor se volvía la IA al acertar los detalles, aunque seguía sonando muy similar a la respuesta correcta.

¿Dónde falló la IA?
La IA era buena con la "visión general" (saber que necesita un "bucle" o una "variable"). Pero seguía cometiendo errores en los detalles operativos:

  • Decía "moverse hacia adelante" cuando debería decir "moverse hacia atrás".
  • Decía "repetir 10 veces" cuando debería decir "repetir 5 veces".
  • Erraba en la condición (por ejemplo, "si toca la pared" frente a "si toca al gato").

Es como un estudiante que memorizó perfectamente la lista de vocabulario pero reprobó el problema de matemáticas porque sumó en lugar de restar.

4. El Arreglo: Una "Segunda Opinión"

El artículo también muestra que puedes usar esta nueva lista de verificación (SAC) para corregir los errores de la IA después de que genera una respuesta.

  • Imagina que la IA escribe 10 versiones diferentes del programa.
  • En lugar de elegir la primera, pasas las 10 por la lista de verificación SAC.
  • Eliges la que mejor coincida con la lista de verificación.
  • Resultado: Este simple paso mejoró significamente la precisión de la IA sin necesidad de reentrenar a la IA o enseñarle nada nuevo.

Resumen

El artículo concluye que para la programación basada en bloques (como Scratch), parecer similar no es suficiente. Una IA puede sonar como un programador sin ser realmente uno. Para evaluar verdaderamente a la IA en este campo, necesitamos revisar los "engranajes y ruedas" (las acciones específicas y los números), no solo la "pintura exterior" (las palabras). Han construido las herramientas para hacer exactamente eso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →