FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows

TL;DR

FigmaTrace通过设计阶段转换方法提升VLM在设计任务中的表现。

cs.CV 🔴 高级 2026-08-21 3 次浏览
Darshan Deshpande Yoshinari Fujinuma Martyna Markiewicz Devanshu Bansal Shivani Jain Nicholas Saban Chirag Maheshwari Anand Kannappan
视觉语言模型 设计流程 数据集 性能提升 开源

核心发现

方法论

研究采用设计阶段转换方法,将200小时视频数据转为3469个设计轨迹。使用FigmaTrace数据集训练四个模型,展示在四个GUI环境中的性能提升。

关键结果

  • FigmaTrace训练的模型在GUI-Odyssey上性能提升46%。
  • 设计阶段转换方法比长度转换方法提升7.3%。
  • QWEN3.8-27B模型在AndroidControl上提升11.8%。

研究意义

该研究通过提供高质量设计数据集,填补了VLM在主观设计任务中的性能空白,推动了设计领域的自动化进程。

技术贡献

提出了设计阶段转换方法,改善了视频到轨迹的转换精度,超越了现有长度转换方法,提供了新的设计任务训练框架。

新颖性

首次将设计阶段转换用于VLM训练,显著提升了模型在复杂设计任务中的表现。

局限性

  • 数据集可能无法覆盖所有设计风格,影响模型的泛化能力。
  • 转换方法对视频质量要求较高,低分辨率可能影响结果。

未来方向

未来可扩展数据集以涵盖更多设计风格,并优化转换方法以适应低质量视频。

AI 总览摘要

FigmaTrace通过捕捉人类设计工作流中的创意细节,提升视觉语言模型在设计任务中的表现。现有模型在主观设计任务中表现不佳,主要原因是缺乏高质量的人类工作流数据。FigmaTrace数据集包含200小时视频数据,转换为3469个设计轨迹,使用设计阶段转换方法。实验表明,使用FigmaTrace训练的模型在多个GUI环境中性能显著提升。该研究不仅为设计任务提供了新的数据集,还提出了有效的转换方法,推动了设计领域的自动化进程。尽管如此,数据集的覆盖范围和转换方法的适应性仍需进一步优化。

深度分析

研究背景

视觉语言模型在客观任务中表现优异,但在主观设计任务中仍有不足。现有研究尝试通过人类偏好对齐和强化学习来改善,但缺乏高质量设计数据集。

核心问题

视觉语言模型在主观设计任务中表现不佳,主要由于缺乏捕捉人类设计偏好和决策的数据。

核心创新

提出FigmaTrace数据集,通过设计阶段转换方法提升模型在设计任务中的表现。该方法超越了现有长度转换方法。

方法详解

  • �� 定义设计技能分类
  • �� 收集200小时视频数据
  • �� 转换为3469个设计轨迹
  • �� 使用FigmaTrace训练四个模型
  • �� 进行性能对比和消融实验

实验设计

实验使用FigmaTrace数据集训练四个模型,并在四个GUI环境中进行性能评估。对比现有长度转换方法,进行消融实验。

结果分析

FigmaTrace训练的模型在多个任务中表现优异,尤其在GUI-Odyssey和AndroidControl上有显著提升。

应用场景

该研究可用于提升设计任务中的自动化水平,帮助开发更智能的设计工具。

局限与展望

数据集覆盖范围有限,可能影响模型的泛化能力。转换方法对视频质量要求较高,低分辨率可能影响结果。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你需要根据食谱准备食材、烹饪和装盘。FigmaTrace就像是一个详细的食谱,帮助视觉语言模型学习如何完成复杂的设计任务。通过观察人类设计师的工作流程,模型可以更好地理解如何选择合适的设计元素、调整布局和风格,就像厨师根据食材和调料创造美味佳肴一样。

简单解释 像给14岁少年讲一样

想象你在玩一个设计游戏。你需要根据任务要求选择合适的工具和材料,完成一个创意设计。FigmaTrace就像是一个超级攻略,告诉你如何一步步完成任务。通过观察专业设计师的视频,模型可以学习如何选择合适的颜色、布局和元素,就像你在游戏中选择合适的装备和技能一样。是不是很酷?

术语表

视觉语言模型 (Vision Language Model)

结合视觉和语言信息进行任务处理的模型。

用于设计任务的自动化处理。

设计阶段转换 (Design Phase Conversion)

根据设计阶段将视频数据转换为设计轨迹的方法。

提高视频到轨迹转换的精度。

FigmaTrace

包含200小时视频数据的设计数据集。

用于训练视觉语言模型。

消融实验 (Ablation Study)

通过去除某些组件来评估模型的性能变化。

验证设计阶段转换方法的有效性。

GUI环境 (GUI Environment)

图形用户界面的操作环境。

用于评估模型的导航能力。

开放问题 这项研究留下的未解疑问

  • 1 如何扩展数据集以涵盖更多设计风格?
  • 2 如何优化转换方法以适应低质量视频?

应用场景

近期应用

设计任务自动化

帮助开发更智能的设计工具,提高设计效率。

远期愿景

设计领域的全面自动化

推动设计领域的自动化进程,实现更复杂的设计任务。

原文摘要

Vision Language Models have recently shown improvements in several objective and verifiable domains such as object detection but continue to underperform on subjective and creative design tasks. A major contributor to this performance gap is the lack of high quality human workflow data that captures a diverse set of preferences and decisions that make human experts good at design tasks. In this work, we first define a unique, expert curated taxonomy of design skills and best practices which we further expand into a set of 126 open ended, subjective, long horizon tasks. Built on top of this and expert solutions, our dataset FigmaTrace contains over 200 hours of human captured video data converted into 3469 design trajectories using a novel design phase-based method. We use our dataset to train four models and show that training on FigmaTrace leads to a performance improvement comparable to frontier closed models such as \textsc{Claude-Opus-5} and \textsc{GPT-5.6-Sol} on four out of distribution agentic GUI environments. We further perform a useful ablation to attribute these performance improvements to a design phase-based video to trajectory conversion which outperforms prior length-based conversion approaches. Finally, we perform a qualitative analysis on the best performing \textsc{Qwen3.8-27B} outputs to better correlate performance improvements to FigmaTrace's trends. We open source our dataset and the best model for the community.

cs.CV cs.AI