← Últimos artículos
💻 computer science

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

El artículo presenta FigmaTrace, un nuevo conjunto de datos que comprende más de 200 horas de flujos de trabajo de diseño humano capturados por expertos y convertidos en trayectorias mediante un método basado en fases, lo cual mejora significamente el rendimiento de los Modelos de Lenguaje de Visión en tareas de diseño creativo para igualar a los modelos cerrados de vanguardia.

Autores originales: Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

Publicado 2026-08-25
📖 1 min de lectura☕ Lectura para el café

Autores originales: Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: FIGMATRACE

Planteamiento del Problema

Los Modelos de Lenguaje y Visión (VLMs) han demostrado una competencia significativa en dominios objetivos y verificables, como la detección de objetos y la comprensión de documentos. Sin embargo, siguen rindiendo por debajo de lo esperado en tareas de diseño subjetivas y creativas. Los autores identifican un cuello de botella principal: la falta de datos de flujo de trabajo humano de alta calidad que capturen las diversas preferencias, decisiones y el "gusto" que distinguen a los expertos humanos. Aunque trabajos previos han intentado generar datos de diseño mediante la anotación automatizada de archivos de Figma existentes o mediante la conversión de HTML a JSON, estos enfoques sufren de una validación ambigua, una falta de directrices de calidad exhaustivas y una incapacidad para capturar los procesos de toma de decisiones matizados de los diseñadores humanos. Además, los conjuntos de datos existentes suelen centrarse en el artefacto final en lugar de en la trayectoria de decisiones requerida para crearlo.

Metodología

1. Taxonomía de Habilidades y Curación de Tareas

Para abordar la brecha de datos, los autores definieron primero una taxonomía única de 10 habilidades de diseño de alto nivel curadas por expertos (p. ej., Percepción Visual, Destreza Estructural en Figma, Experiencia en Accesibilidad, Destreza en Vectores y Activos). Basándose en esta taxonomía, construyeron 126 tareas de horizonte largo, abiertas y subjetivas. Estas tareas se categorizaron en:

  • Tareas Verificables: Replicación píxel a píxel, reparación de fallos y remediación de accesibilidad.
  • Tareas No Verificables: Adaptación de plataforma, tematización, conversión de boceto a Figma y cableado de prototipos, las cuales dependen del juicio y el sesgo de un experto.

2. Recolección y Procesamiento de Datos (FIGMATRACE)

El conjunto de datos, FIGMATRACE, se construyó capturando más de 200 horas de grabaciones de pantalla y acciones de expertos a nivel de sistema operativo mientras los diseñadores completaban estas tareas. Los datos brutos pasaron por un riguroso proceso de procesamiento de múltiples etapas:

  • Filtrado de Acciones: Se filtraron los movimientos de ratón y los desplazamientos aleatorios, reteniendo solo las interacciones significativas (clics, escritura, desplazamiento) mapeadas al conjunto de herramientas Playwright MCP.
  • Extracción de Fotogramas: Se empleó un método de extracción de dos pasadas para identificar estados "asentados" después de las acciones, asegurando que los fotogramas se capturaran solo cuando la interfaz de usuario se hubiera estabilizado, en lugar de en intervalos de tiempo arbitrarios.
  • Filtrado de Efectos: Se analizaron los cambios en los valores de los píxeles para distinguir entre acciones que alteraron el artefacto y aquellas que no lo hicieron.
  • Segmentación Basada en Fases: Una contribución novedosa de este trabajo es la conversión de los datos de video en trayectorias basadas en fases de diseño (p. ej., "Componentización", "Pulido de Refinamiento", "Recopilación de Referencias") en lugar de un simple fragmentado por longitud máxima de contexto. Los autores utilizaron Gemini-3.6-Flash para categorizar los segmentos de video en 11 fases distintas. Este enfoque se eligió para enseñar habilidades e intenciones específicas a los VLMs, evitando el ruido introducido por las pausas aleatorias en el video.

3. Entrenamiento y Evaluación

Los autores entrenaron cuatro VLMs (QWEN3.6-35BA3B, QWEN3.8-27B, GEMMA-4-31B y MUSE-GLIMMER-30B) utilizando el marco ms-swift con 92,472 acciones muestreadas de 35 sesiones. Los modelos fueron evaluados en cuatro entornos de GUI agénticos fuera de la distribución (OOD):

  • GUI-Odyssey: Navegación multi-aplicación y multi-viewport.
  • AndroidControl: Granularidad de instrucción y navegación móvil.
  • Mind2Web: Anclaje de instrucciones en datos abiertos de la web.
  • VideoGUI: Planificación y narración de acciones.

Resultados Clave

Mejoras de Rendimiento

El entrenamiento en FIGMATRACE produjo mejoras significativas de rendimiento en todos los benchmarks evaluados:

  • Dominio de Benchmarks: El modelo ajustado QWEN3.8-27B superó a modelos cerrados de frontera como CLAUDE-OPUS-5 y GPT-5.6-SOL en tareas específicas. Notablemente, logró un aumento absoluto del 6.4% en GUI-Odyssey y un aumento absoluto del 11.8% en AndroidControl en comparación con las líneas base cerradas.
  • Ganancias In-Domain: En la división creativa ScreenSpot-Pro, el modelo ajustado QWEN3.8-27B mostró un aumento absoluto del 7.4% sobre su modelo base (36.7% vs. 29.3%).
  • Generalización: Las mejoras se generalizaron a través de diferentes arquitecturas de modelos, mostrando los cuatro modelos probados ganancias positivas.

Estudio de Ablación: Basado en Fases vs. Basado en Longitud

Los autores realizaron un estudio de ablación crítico comparando su curación de trayectoria basada en fases contra el fragmentado estándar por longitud máxima de contexto.

  • Resultado: El enfoque basado en fases superó al enfoque basado en longitud por un promedio de 7.3 puntos absolutos.
  • Análisis: El análisis cualitativo reveló que el fragmentado basado en longitud a menudo corta las tareas a mitad de una acción, oscureciendo la intención de la tarea. En contraste, la segmentación basada en fases preservó el anclaje basado en habilidades, permitiendo a los modelos comprender mejor las instrucciones de "Continuar el trabajo" y las referencias no dirigidas.

Análisis Cualitativo

La evaluación humana del mejor modelo (QWEN3.8-27B) identificó tres patrones clave que impulsan el éxito:

  1. Precisión de Selección de Elementos: El modelo base seleccionaba frecuentemente elementos de la interfaz de usuario incorrectos (error mediano ~457 px), mientras que el modelo ajustado aterrizaba a ~15 px del objetivo.
  2. Comprensión de Coordenadas: El modelo base a menudo emitía coordenadas de píxeles crudas que excedían los límites de la cuadrícula normalizada (p. ej., y>1000y > 1000), mientras que el modelo ajustado se adhería al sistema de coordenadas norma-1000.
  3. Decisión: El modelo ajustado proporcionaba consistentemente coordenadas incluso en escenarios ambiguos donde el modelo base fallaba al actuar.

Sin embargo, los autores también señalaron modos de fallo introducidos por el conjunto de datos, incluyendo la repetición (predecir el mismo píxel dos veces) y un sesgo de enfoque en el centro de la pantalla, probablemente artefactos de ruido en el procesamiento del video bruto.

Significado y Reivindicaciones

El artículo afirma que FIGMATRACE es el primer conjunto de datos que proporciona pares de secuencias de acción de oro y grabaciones segmentadas por intención de flujos de trabajo de expertos en Figma. Su principal significancia radica en demostrar que:

  1. Calidad de Datos sobre Cantidad: Capturar flujos de trabajo humanos de alta calidad, curados por expertos y con un enfoque en las fases de diseño, es más efectivo para entrenar agentes creativos que simplemente escalar datos brutos o usar anotación automatizada.
  2. Curación Basada en Fases: Estructurar los datos de entrenamiento alrededor de fases de diseño (habilidades) en lugar de ventanas de tiempo arbitrarias mejora significativamente la capacidad de un modelo para comprender intenciones de tareas de largo horizonte.
  3. Generalización: El entrenamiento en flujos de trabajo de diseño específicos (Figma) se transfiere eficazmente a tareas de navegación agéntica más amplias (Android, Web), lo que sugiere que las habilidades subyacentes de análisis visual y razonamiento estructural son transferibles.

Los autores han liberado el conjunto de datos y el mejor modelo (QWEN3.8-27B) para facilitar la investigación adicional en agentes de IA creativa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →