← Últimos artículos
💬 NLP

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

El artículo presenta Asuka-Bench, un nuevo benchmark diseñado para evaluar agentes de código en tareas de desarrollo web mediante la simulación de ciclos de refinamiento multironda del mundo real donde los agentes mejoran iterativamente proyectos subespecificados basándose en pruebas de interfaz de usuario automatizadas y retroalimentación en lenguaje natural, revelando brechas de rendimiento significativas entre los modelos actuales.

Autores originales: Xin Wang, Liangtai Sun, Yaoming Zhu, Shuang Zhou, Jiaxing Liu, Fengjiao Chen, Lin Qiu, Xuezhi Cao, Xunliang Cai, Licheng Zhang, Zhendong Mao

Publicado 2026-06-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Xin Wang, Liangtai Sun, Yaoming Zhu, Shuang Zhou, Jiaxing Liu, Fengjiao Chen, Lin Qiu, Xuezhi Cao, Xunliang Cai, Licheng Zhang, Zhendong Mao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un arquitecto brillante pero un poco literal para construir una casa.

La forma antigua (Benchmarks existentes)
En el pasado, probar a estos arquitectos era como darles un plano perfecto de 50 páginas que enumeraba cada clavo, cable y color de pintura. Les decías: "Construye esto", y ellos te entregaban una casa terminada. Si la casa coincidía con el plano, obtenían una A. Si no coincidía, obtenían una F.

El problema es que la vida real no funciona así. Los clientes reales rara vez tienen un plano perfecto de 50 páginas. Normalmente dicen: "Quiero una casa con una cocina y un lugar para dormir", y luego, una vez que ven el primer borrador, se dan cuenta de: "Ah, en realidad quería que la cocina fuera más grande", o "Espera, la puerta abre hacia el lado equivocado".

La nueva forma (Asuka-Bench)
El artículo presenta Asuka-Bench, una nueva forma de probar los "Agentes de Código" (programas de IA que escriben software). En lugar de darle a la IA un plano perfecto, los investigadores le dan una petición vaga y desordenada, como: "Haz un sitio web de compras con una lista de productos y un carrito".

Luego, no solo califican el primer resultado. Configuran un equipo de tres personas para recrear un ciclo de desarrollo del mundo real:

  1. El Constructor (Agente de Código): Esta es la IA que intenta construir el sitio web basándose en la petición vaga.
  2. El Inspector (Agente de UI): Este es un robot que realmente visita el sitio web en un navegador web. No lee el código; actúa como un usuario humano. Hace clic en botones, intenta comprar cosas y comprueba si las páginas cargan. Es como un inspector de control de calidad que camina por la casa para ver si las puertas abren.
  3. El Cliente (LLM de Usuario): Esta es otra IA que observa al Inspector. Si el Inspector encuentra un problema (por ejemplo, "El botón de 'Comprar' no funciona"), el Cliente lo traduce en una nota cortés para el Constructor: "Oye, el botón está roto. Por favor, arréglalo".

El Constructor entonces arregla el sitio web, y el ciclo se repite. Esto sucede hasta por tres rondas.

La analogía del "DAG"
Los investigadores también inventaron una forma inteligente de dar retroalimentación llamada DAG (Grafo Acíclico Dirigido). Piensa en esto como una receta.

  • Si estás intentando hornear un pastel, no puedes decorarlo con glaseado antes de hornearlo.
  • En los métodos de prueba antiguos, si el pastel se quemaba, el inspector también podía quejarse de que faltaba el glaseado, aunque no podías glasear un pastel quemado.
  • En Asuka-Bench, el sistema conoce el orden. Si el paso de "hornear" falla, detiene al inspector de comprobar el paso de "glaseado". Solo le dice al Constructor: "No horneaste el pastel". Esto evita que el Constructor se confunda con quejas sobre cosas que aún no han sucedido.

Lo que descubrieron
Los investigadores probaron 8 modelos de IA diferentes usando este método. Esto es lo que descubrieron:

  • Algunas IA son mejores reparando que otras: El hecho de que una IA sea buena construyendo el primer borrador no significa que sea buena corrigiendo errores. Algunos modelos construyeron una primera versión excelente pero no pudieron entender las notas del "Cliente" para arreglar los errores. Otros empezaron desordenados pero mejoraron con cada ronda de retroalimentación.
  • La brecha es enorme: Los mejores modelos pudieron completar aproximadamente el 52% de los proyectos perfectamente después de tres rondas de corrección. Los peores modelos solo completaron un 8%. Esa es una diferencia masiva.
  • Sigue siendo difícil: Ni siquiera la IA más inteligente pudo terminar todos los proyectos perfectamente. Esto demuestra que, aunque la IA está mejorando, todavía lucha con la naturaleza desordenada y de ida y vuelta de las peticiones humanas reales.

En resumen
Asuka-Bench es un nuevo "examen de conducir" para programadores de IA. En lugar de pedirles que conduzcan un coche en una pista perfectamente recta y vacía (un plano perfecto), se les pide que conduzcan en el tráfico de la ciudad, reciban direcciones de un pasajero cuando toman un camino equivocado y corrijan su curso. Resulta que ser capaz de escuchar y corregir errores es una habilidad completamente diferente a simplemente saber conducir en línea recta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →