← 最新论文
💻 computer science

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

该论文介绍了 FigmaTrace,这是一个由超过 200 小时专家捕获的人类设计工作流通过基于阶段的方法转化为轨迹而组成的新型数据集,它显著提升了视觉语言模型在创意设计任务上的性能,使其能够媲美前沿的闭源模型。

原作者: Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:FIGMATRACE

问题陈述

视觉语言模型(VLMs)在目标性、可验证领域(如目标检测和文档理解)表现出了显著的能力。然而,它们在主观性和创造性设计任务方面仍然表现不佳。作者认为其主要瓶颈在于缺乏高质量的人类工作流数据,这类数据能够捕捉到区分人类专家的多样化偏好、决策和“品味”。虽然之前的研究尝试通过对现有 Figma 文件进行自动标注或将 HTML 转换为 JSON 来生成设计数据,但这些方法存在验证模糊、缺乏详尽质量指南以及无法捕捉人类设计师细微决策过程的问题。此外,现有的数据集往往关注最终产物,而非创建该产物所需的决策轨迹。

研究方法

1. 技能分类法与任务策划

为了填补数据空白,作者首先定义了一个独特的、由专家策划的 10 项高层设计技能分类法(例如:视觉感知、Figma 结构构建、无障碍专业知识、矢量与资产构建)。基于该分类法,他们构建了 126 个开放式、主观性的长程任务。这些任务被分为:

  • 可验证任务: 像素级完美复制、缺陷修复和无障碍修复。
  • 不可验证任务: 平台适配、主题化、草图转 Figma 以及原型连线,这些任务依赖于专家判断和偏好。

2. 数据收集与处理 (FIGMATRACE)

FIGMATRACE 数据集是通过捕获设计师在完成这些任务时超过 200 小时的操作系统级专家屏幕录制和操作行为而构建的。原始数据经过了严格的多阶段处理流水线:

  • 动作过滤: 过滤掉了随机的鼠标移动和悬停,仅保留映射到 Playwright MCP 工具集的有意义交互(点击、输入、滚动)。
  • 帧提取: 采用了两阶段提取法来识别动作后的“稳定”状态,确保仅在 UI 稳定而非在任意时间间隔时才捕获帧。
  • 效果过滤: 通过分析像素值的变化,来区分改变了人工制品与未改变人工创意的动作。
  • 基于阶段的分段: 本研究的一个新颖贡献是将视频数据转换为基于设计阶段(例如:“组件化”、“精细润色”、“参考搜集”)的轨迹,而非简单的最大上下文长度分片。作者利用 Gemini-3.6-Flash 将视频片段归类为 11 个不同的阶段。选择这种方法是为了教会 VLM 特定的技能和意图边界,从而避免视频中随机停顿引入的噪声。

3. 训练与评估

作者使用 ms-swift 框架,利用从 35 个会话中采样的 92,472 个动作训练了四种 VLM(QWEN3.6-35BA3B、QWEN3.8-27B、GEMMA-4-31B 和 MUSE-GLIMMER-30B)。这些模型在四个分布外(OOD)智能 GUI 环境中进行了评估:

  • GUI-Odyssey: 多应用、多视口导航。
  • AndroidControl: 指令粒度和移动端导航。
  • Mind2Web: 在开放网络数据上的指令落地。
  • VideoGUI: 规划与动作叙述。

关键结果

性能提升

在 FIGMATRACE 上的训练在所有评估基准测试中都带来了显著的性能增益:

  • 基准测试统治力: 微调后的 QWEN3.8-27B 模型在特定任务上超越了像 CLAUDE-OPUS-5GPT-5.6-SOL 这样的前沿闭源模型。值得注意的是,与闭源基准相比,它在 GUI-Odyssey 上实现了 6.4% 的绝对提升,在 AndroidControl 上实现了 11.8% 的绝对提升
  • 领域内增益: 在 ScreenSpot-Pro 创意拆分集上,微调后的 QWEN3.8-27B 比其基础模型显示出 7.4% 的绝对提升(36.7% vs. 29.3%)。
  • 泛化能力: 这种改进在不同的模型架构中具有泛化性,所有四种测试的模型都显示出正向收益。

消融实验:基于阶段 vs. 基于长度

作者进行了一项关键的消融实验,将他们的基于阶段的轨迹策划与标准的最大上下文长度分片进行了对比。

  • 结果: 基于阶段的方法在平均水平上比基于长度的方法高出 7.3 个绝对百分点
  • 分析: 定性分析表明,基于长度的分片经常在动作中途截断任务,从而掩盖了任务意图。相比之下,基于阶段的分段保留了基于技能的落地能力,使模型能够更好地理解“继续工作”类的指令和无向引用。

定性分析

对表现最好的模型(QWEN3.8-27B)的人类评估确定了驱动成功的三个关键模式:

  1. 元素选择准确度: 基础模型经常选择错误的 UI 元素(中位数误差约为 457 像素),而微调后的模型落点距离目标仅约 15 像素。
  2. 坐标理解: 基础模型经常输出超出归一化网格限制(例如 y>1000y > 1000)的原始像素坐标,而微调后的模型则遵循 norm-1000 坐标系统。
  3. 果断性: 在基础模型无法采取行动的模糊场景中,微调后的模型始终能提供坐标。

然而,作者也指出了由数据集引入的失效模式,包括重复(预测相同的像素两次)和屏幕中心聚焦偏差,这可能是原始视频处理中的噪声导致的伪影。

重要性与主张

本文声称 FIGMATRACE 是第一个提供专家 Figma 工作流的金标准动作序列和意图分段录制配对的数据集。其主要意义在于证明了:

  1. 质量重于数量: 与单纯扩大原始数据规模或使用自动标注相比,捕获专注于设计阶段的高质量、专家策划的人类工作流对于训练创意智能体更为有效。
  2. 基于阶段的策划: 将训练数据围绕设计阶段(技能)而非任意时间窗口进行构建,能显著提高模型理解长程任务意图的能力。
  3. 泛化性: 在特定设计工作流(Figma)上的训练可以有效地迁移到更广泛的智能导航任务(Android、Web)中,这表明底层的视觉分析和结构推理技能是具有迁移性的。

作者已经开源了该数据集和表现最好的模型(QWEN3.8-27B),以促进创意 AI 智能体领域的进一步研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →