← 最新の論文
💻 computer science

FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

本論文は、フェーズベースの手法を通じて軌跡へと変換された200時間を超えるエキスパートによる人間によるデザインワークフローからなる新しいデータセットであるFigmaTraceを紹介しており、これは、クリエイティブなデザインタスクにおけるVision Language Modelの性能を最先端のクローズドモデルに匹敵するレベルまで大幅に向上させるものである。

原著者: Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Darshan Deshpande, Yoshinari Fujinuma, Martyna Markiewicz, Devanshu Bansal, Shivani Jain, Nicholas Saban, Chirag Maheshwari, Anand Kannappan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約: FIGMATRACE

問題提起

視覚言語モデル(VLM)は、物体検出やドキュメント理解といった客観的かつ検証可能な領域において顕著な習熟度を示している。しかし、主観的かつクリエイティブなデザインタスクにおいては依然として性能が低い。著者らはその主要なボトルネックとして、人間のエキスパートを区別する多様な好み、意思決定、および「センス(taste)」を捉えた高品質な人間のワークフローデータの欠如を挙げている。先行研究では、既存のFigmaファイルを自動アノテーションしたり、HTMLをJSONに変換したりすることでデザインデータを生成しようとする試みがあったが、これらの手法は検証の曖昧さ、包括的な品質ガイドラインの欠如、そして人間のデザイナーによる微細な意思決定プロセスを捉えられないという問題を抱えている。さらに、既存のデータセットは多くの場合、最終的な成果物に焦点を当てており、それを構築するために必要な意思決定の軌跡(trajectory)には焦点を当てていない。

手法

1. スキル・タクソノミーとタスクのキュレーション

このデータのギャップに対処するため、著者らはまず、10種類の高レベルなデザインスキル(例:視覚的知覚、Figma構造構築、アクセシビリティ専門知識、ベクター&アセット構築)からなる、エキスパートによって精査された独自のタクソノミーを定義した。このタクソミに基づき、126個のオープンエンドな主観的ロングホライゾン・タスクを構築した。これらのタスクは以下のように分類された:

  • 検証可能なタスク: ピクセルパーフェクトな複製、欠陥修復、およびアクセシビリティの改善。
  • 非検証可能なタスク: プラットフォーム適応、テーマ設定、スケッチからFigmaへの変換、およびプロトタイプのワイヤリング(これらはエキスパートの判断とバイアスに依存する)。

2. データ収集および処理 (FIGMATRACE)

データセットである FIGMATRACE は、デザイナーがこれらのタスクを実行している間の、200時間を超えるOSレベルのエキスパートによる画面録画とアクションのキャプチャによって構築された。生のデータは、厳格なマルチステージ・プロセッシング・パイプラインを経た:

  • アクション・フィルタリング: ランダムなマウスの動きやホバーを排除し、Playwright MCPツールセットにマッピングされた意味のあるインタラクション(クリック、タイピング、スクロール)のみを保持した。
  • フレーム抽出: アクション後の「定着(settled)」状態を特定するために、2パスの抽出メソッドを採用した。これにより、任意の時間間隔ではなく、UIが安定したときにのみフレームがキャプチャされることを保証した。
  • 効果フィルタリング: ピクセル値の変化を分析することで、アーティファクトに変化を与えたアクションと、変化を与えなかったアクションを区別した。
  • フェーズベースのセグメンテーション: 本研究の新規な貢献は、単純な最大コンテキスト長によるシャーディングではなく、デザインフェーズ(例:「コンポーネント化」、「リファインメント・ポリッシュ」、「リファレンス収集」)に基づくビデオデータを軌跡へと変換した点である。著者らは、ビデオのスパンを11の明確なフェーズに分類するために Gemini-3.6-Flash を活用した。このアプローチは、ビデオ内のランダムな一時停止によるノイズを避け、特定のスキルと意図の境界をVLMに教え込むために選択された。

3. トレーニングと評価

著者らは、35セッションからサンプリングされた92,472のアクションを用い、ms-swift フレームワークを使用して4つのVLM(QWEN3.6-35BA3B, QWEN3.8-27B, GEMMA-4-31B, MUSE-GLIMMER-30B)をトレーニングした。モデルは、以下の4つのOOD(分布外)エージェンティックGUI環境で評価された:

  • GUI-Odyssey: マルチアプリ、マルチビューポート・ナビゲーション。
  • AndroidControl: 指示の粒度およびモバイルナビゲーション。
  • Mind2Web: オープンウェブデータにおける指示のグラウンディング。
  • VideoGUI: プランニングおよびアクションのナレーション。

主な結果

パフォーマンスの向上

FIGMATRACEでのトレーニングにより、評価されたすべてのベンチマークにおいて大幅なパフォーマンス向上が見られた:

  • ベンチマークにおける優位性: ファインチューニングされた QWEN3.8-27B モデルは、特定のタスクにおいて CLAUDE-OPUS-5GPT-5.6-SOL といった最先端のクローズドソースモデルを上回った。特筆すべきは、GUI-Odysseyで6.4%の絶対的な増加、AndroidControlで11.8%の絶対的な増加を達成したことである。
  • インドメインの利得: ScreenSpot-Pro Creative分割において、ファインチューニングされたQWEN3.8-27Bは、ベースモデルに対して7.4%の絶対的な増加(36.7% 対 29.3%)を示した。
  • 汎化性能: 改善は異なるモデルアーキテクチャ間で一般化され、テストされた4つのモデルすべてがポジティブな利得を示した。

アブレーション研究:フェーズベース vs 長さベース

著者らは、フェーズベースの軌跡キュレーションを標準的な最大コンテキスト長によるシャーディングと比較する重要なアブレーション研究を実施した。

  • 結果: フェーズベースのアプローチは、長さベースのアプローチよりも平均して7.3ポイント高くアウトパフォームした。
  • 分析: 定性的分析により、長さベースのシャーディングはタスクの途中でアクションを切断してしまうことが多く、タスクの意図を不明瞭にすることが明らかになった。対照的に、フェーズベースのセグメンテーションはスキルベースのグラウンディングを維持し、モデルが「作業を継続する」という指示や、無指向的なリファレンスをより良く理解することを可能にした。

定性的分析

最も優れた性能を示したモデル(QWEN3.8-27B)の人間による評価では、成功を牽引する3つの主要なパターンが特定された:

  1. 要素選択の正確性: ベースモデルは頻繁に誤ったUI要素を選択していた(中央値誤差 ~457 px)が、ファインチューニングされたモデルはターゲットの±15 px以内に着地した。
  2. 座標理解: ベースモデルはしばしば正規化グリッドの制限を超える生のピクセル座標(例:y>1000y > 1000)を出力したが、ファインチューニングされたモデルはnorm-1000座標系を遵守した。
  3. 決断力: ファインチューニングされたモデルは、ベースモデルが行動に失敗した曖昧なシナリオにおいても、一貫して座標を提供した。

しかし、著者らは、データの繰り返し(同じピクセルを2回予測する)や、画面中央へのフォーカス・バイアスなど、生のビデオ処理におけるノイズに起因すると考えられる失敗モードについても指摘している。

重要性と主張

本論文は、FIGMATRACE が、エキスパートによるFigmaワークフローのゴールド・アクション・シーケンスと、意図によってセグメント化された録画のペアを提供する最初のデータセットであると主張している。その主な意義は、以下のことを実証した点にある:

  1. 量よりもデータの質: デザインフェーズに焦点を当てた、高品質でエキスパートがキュレーションした人間のワークフローをキャプチャすることは、単に生データをスケールアップしたり自動アノテーションを使用したりすることよりも、クリエイティブなエージェントのトレーニングにおいて効果的である。
  2. フェーズベースのキュレーション: トレーニングデータを任意の時間窓ではなく、デザインフェーズ(スキル)に基づいて構造化することは、モデルがロングホライゾンのタスクの意図を理解する能力を大幅に向上させる。
  3. 汎化: 特定のデザインワークフロー(Figma)でのトレーニングは、より広範なエージェンティック・ナビゲーション・タスク(Android, Web)に効果的に転移する。これは、視覚的分析と構造的推論という基礎的なスキルが転移可能であることを示唆している。

著者らは、さらなるクリエイティブAIエージェントの研究を促進するために、データセットと最高の性能を示したモデル(QWEN3.8-27B)をオープンソース化している。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →