← Derniers articles
💻 computer science

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

L'article introduit FigmaTrace, un nouveau jeu de données comprenant plus de 200 heures de flux de travail de conception humaine capturés par des experts et convertis en trajectoires via une méthode basée sur les phases, ce qui améliore considérablement les performances des modèles de langage visuel sur les tâches de conception créative pour égaler celles des modèles fermés de pointe.

Auteurs originaux : Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

Publié 2026-08-25
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : FIGMATRACE

Énoncé du Problème

Les modèles de langage visuels (VLM) ont démontré une compétence significative dans des domaines objectifs et vérifiables tels que la détection d'objets et la compréhension de documents. Cependant, ils continuent de sous-performer sur les tâches de conception subjectives et créatives. Les auteurs identifient un goulot d'étranglement principal : un manque de données de flux de travail humain de haute qualité capturant la diversité des préférences, des décisions et du « goût » qui distinguent les experts humains. Bien que des travaux antérieurs aient tenté de générer des données de conception via l'annotation automatisée de fichiers Figma existants ou par la conversion de HTML en JSON, ces approches souffrent d'une validation ambiguë, d'un manque de directives de qualité exhaustives et d'une incapacité à capturer les processus de décision nuancés des designers. De plus, les jeux de données existants se concentrent souvent sur l'artefact final plutôt que sur la trajectoire de décisions requise pour le créer.

Méthodologie

1. Taxonomie des Compétences et Curation des Tâches

Pour combler ce déficit de données, les auteurs ont d'abord défini une taxonomie unique, expertisée, de 10 compétences de conception de haut niveau (ex. : Perception Visuelle, Maîtrise Structurelle de Figma, Expertise en Accessibilité, Maîtrise des Vecteurs et des Assets). Sur la base de cette taxonomie, ils ont construit 126 tâches ouvertes, subjectives et à long horizon. Ces tâches ont été catégorisées en :

  • Tâches Vérifiables : Réplication pixel-perfect, réparation de défauts et remédiation d'accessibilité.
  • Tâches Non-Vérifiables : Adaptation de plateforme, thématisation, conversion de croquis vers Figma et câblage de prototypes, qui reposent sur le jugement et le biais d'experts.

2. Collecte et Traitement des Données (FIGMATRACE)

Le jeu de données, FIGMATRACE, a été construit en capturant plus de 200 heures d'enregistrements d'écran et d'actions d'experts au niveau du système d'exploitation pendant que les designers réalisaient ces tâches. Les données brutes ont subi un pipeline de traitement rigoureux en plusieurs étapes :

  • Filtrage des Actions : Les mouvements de souris aléatoires et les survols ont été filtrés, ne conservant que les interactions significatives (clics, frappe, défilement) mappées à l'ensemble d'outils Playwright MCP.
  • Extraction de Frames : Une méthode d'extraction en deux passes a été employée pour identifier les états « stabilisés » après les actions, garantissant que les images n'étaient capturées que lorsque l'interface utilisateur était stable, plutôt qu'à des intervalles de temps arbitraires.
  • Filtrage d'Effet : Les changements de valeurs de pixels ont été analysés pour distinguer les actions qui altéraient l'artefact de celles qui ne le faisaient pas.
  • Segmentation par Phases : Une contribution novatrice de ce travail est la conversion des données vidéo en trajectoires basées sur des phases de conception (ex. : « Composantisation », « Polissage de Raffinement », « Recherche de Références ») plutôt que sur un simple partitionnement par longueur de contexte maximal. Les auteurs ont utilisé Gemini-3.6-Flash pour catégoriser les segments vidéo en 11 phases distinctes. Cette approche a été choisie pour enseigner aux VLM des compétences et des limites d'intention spécifiques, évitant le bruit introduit par les pauses aléatoires dans la vidéo.

3. Entraînement et Évaluation

Les auteurs ont entraîné quatre VLM (QWEN3.6-35BA3B, QWEN3.8-27B, GEMMA-4-31B, et MUSE-GLIMMER-30B) en utilisant le framework ms-swift sur 92 472 actions échantillonnées à partir de 35 sessions. Les modèles ont été évalués sur quatre environnements GUI agentiques hors distribution (OOD) :

  • GUI-Odyssey : Navigation multi-applications, multi-viewports.
  • AndroidControl : Granularité d'instruction et navigation mobile.
  • Mind2Web : Ancrage d'instruction sur des données web ouvertes.
  • VideoGUI : Planification et narration d'actions.

Résultats Clés

Améliorations de Performance

L'entraînement sur FIGMATRACE a généré des gains de performance significatifs sur tous les benchmarks évalués :

  • Dominance des Benchmarks : Le modèle fine-tuné QWEN3.8-27B a surpassé des modèles fermés de pointe comme CLAUDE-OPUS-5 et GPT-5.6-SOL sur des tâches spécifiques. Notamment, il a obtenu une augmentation absolue de 6,4 % sur GUI-Odyssey et une augmentation absolue de 11,8 % sur AndroidControl par rapport aux bases fermées.
  • Gains In-Domain : Sur le split créatif ScreenSpot-Pro, le QWEN3.8-27B fine-tuné a montré une augmentation absolue de 7,4 % par rapport à son modèle de base (36,7 % contre 29,3 %).
  • Généralisation : Les améliorations se sont généralisées à travers différentes architectures de modèles, les quatre modèles testés montrant des gains positifs.

Étude d'Ablation : Basée sur les Phases vs Longueur

Les auteurs ont mené une étude d'ablation critique comparant leur curation de trajectoire basée sur les phases par rapport au partitionnement standard par longueur de contexte maximal.

  • Résultat : L'approche basée sur les phases a surpassé l'approche basée sur la longueur de 7,3 points absolus en moyenne.
  • Analyse : L'analyse qualitative a révélé que le partitionnement par longueur coupe souvent les tâches au milieu d'une action, obscurcissant l'intention de la tâche. En revanche, la segmentation par phase préserve l'ancrage des compétences, permettant aux modèles de mieux comprendre les instructions de type « Continuer le travail » et les références non dirigées.

Analyse Qualitative

L'évaluation humaine du meilleur modèle (QWEN3.8-27B) a identifié trois schémas clés favorisant le succès :

  1. Précision de Sélection d'Élément : Le modèle de base sélectionnait fréquemment de mauvais éléments d'interface (erreur médiane ~457 px), tandis que le modèle fine-tuné se situait à environ 15 px de la cible.
  2. Compréhension des Coordonnées : Le modèle de base émettait souvent des coordonnées de pixels bruts dépassant les limites de la grille normalisée (ex. : y>1000y > 1000), tandis que le modèle fine-tuné adhérait au système de coordonnées norm-1000.
  3. Décision : Le modèle fine-tuné fournissait systématiquement des coordonnées même dans des scénarios ambigus où le modèle de base échouait à agir.

Cependant, les auteurs ont également noté des modes d'échec introduits par le jeu de données, notamment la répétition (prédire deux fois le même pixel) et un biais de focalisation sur le centre de l'écran, probablement des artefacts de bruit dans le traitement vidéo brut.

Signification et Revendications

L'article affirme que FIGMATRACE est le premier jeu de données à fournir des paires de séquences d'actions d'or et d'enregistrements segmentés par intention de flux de travail d'experts Figma. Sa signification primaire réside dans la démonstration que :

  1. Qualité des Données plutôt que Quantité : Capturer des flux de travail humains de haute qualité, expertisés et centrés sur les phases de conception, est plus efficace pour entraîner des agents créatifs que de simplement augmenter l'échelle des données brutes ou d'utiliser l'annotation automatisée.
  2. Curation Basée sur les Phases : Structurer les données d'entraînement autour des phases de conception (compétences) plutôt que sur des fenêtres temporelles arbitraires améliore considérablement la capacité d'un modèle à comprendre les intentions de tâches à long horizon.
  3. Généralisation : L'entraînement sur des flux de travail de conception spécifiques (Figma) se transfère efficacement à des tâches de navigation agentique plus larges (Android, Web), suggérant que les compétences sous-jacentes d'analyse visuelle et de raisonnement structurel sont transférables.

Les auteurs ont mis en open-source le jeu de données et le meilleur modèle (QWEN3.8-27B) pour faciliter la recherche ultérieure sur les agents d'IA créative.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →