EdiTikZ: Scientific Figure Editing from Revision Trajectories

TL;DR

EdiTikZ通过DaEdiTikZ数据集和强化学习实现科学图表编辑,9B模型超越GPT-5.6-Sol。

cs.AI 🔴 高级 2026-09-01 34 次浏览
Christian Greisinger Zhixue Zhao Steffen Eger
科学图表 TikZ编辑 多模态模型 强化学习 数据集构建

核心发现

方法论

研究提出了DaEdiTikZ数据集,包含391K TikZ编辑对和781K编辑指令,结合Qwen3.5模型进行联合训练和强化学习优化。模型通过多任务学习同时掌握图表重建和编辑能力,并利用渲染反馈进行奖励优化。

关键结果

  • 结果1:EdiTikZ-9B模型在自动评估中超越所有基线模型,编辑质量评分高于GPT-5.6-Sol。
  • 结果2:在人类评估中,9B模型在4320次评分中表现与Gemini-3.1-Pro相当。
  • 结果3:在分布外测试中,9B模型在2K序列长度限制下仍保持竞争力。

研究意义

本研究填补了科学图表编辑领域的空白,为多模态模型提供了新的训练监督来源。DaEdiTikZ数据集和EdiTikZ模型的发布将推动科学工作流程自动化,尤其是在学术出版和研究协作中。

技术贡献

技术贡献包括:1) 基于自然修订轨迹构建的大规模数据集;2) 联合学习图表重建和编辑的多任务框架;3) 结合渲染反馈和编辑应用的强化学习策略。

新颖性

本研究首次利用科学修订轨迹作为编辑监督来源,与基于合成数据的方法相比更具真实性和可扩展性。

局限性

  • 局限1:模型对复杂几何结构的编辑能力有限,可能导致渲染错误。
  • 局限2:数据集主要来源于TikZ,可能对其他图形语言的泛化能力不足。
  • 局限3:编辑指令的生成依赖于VLM模型,可能存在偏差。

未来方向

未来工作包括扩展数据集至其他图形语言,改进模型对复杂编辑任务的鲁棒性,以及探索更高效的训练方法。

AI 总览摘要

科学图表编辑是学术出版中不可或缺的一部分,但现有方法主要依赖昂贵的专有系统或合成数据,难以满足实际需求。

EdiTikZ通过引入DaEdiTikZ数据集和强化学习方法,解决了这一问题。该数据集从arXiv、GitHub和TeX SE中提取了391K TikZ编辑对,并生成781K编辑指令。基于此,研究团队训练了两个Qwen3.5模型(4B和9B),通过联合学习和渲染反馈优化,实现了高质量的图表编辑。

实验结果表明,EdiTikZ-9B模型在自动评估和人类评估中均表现优异,尤其在分布外测试中展现了强大的泛化能力。该研究为科学图表编辑提供了新的解决方案,并为相关领域的进一步研究奠定了基础。

深度分析

研究背景

科学图表是学术交流的重要工具,TikZ因其精确性和可解释性成为主流选择。然而,TikZ的复杂语法对人类和模型都构成挑战。现有研究多集中于从文本或图像生成TikZ代码,而对现有图表的编辑研究较少。

核心问题

现有方法依赖合成数据或专有系统,难以捕捉真实的编辑需求。科学图表的编辑需要在保留原始内容的同时,精确地应用修改,这对模型提出了更高的要求。

核心创新

核心创新包括:1) 利用科学修订轨迹构建真实编辑数据集;2) 提出联合学习框架,同时掌握图表重建和编辑;3) 通过渲染反馈优化编辑质量。

方法详解

  • �� 数据集构建:从arXiv等平台提取TikZ编辑对,生成编辑指令。
  • �� 模型训练:基于Qwen3.5模型进行多任务学习,结合重建和编辑任务。
  • �� 强化学习:利用渲染反馈优化编辑应用和视觉保真度。

实验设计

实验使用DaEdiTikZ数据集,基线模型包括GPT-5.6-Sol和Gemini-3.1-Pro。评估指标涵盖编辑应用、源内容保留和视觉质量,并进行了分布外测试。

结果分析

EdiTikZ-9B在自动评估中超越所有基线模型,在人类评估中获得与Gemini-3.1-Pro相当的评分,并在分布外测试中保持竞争力。

应用场景

该方法可用于学术出版、科研协作和教育领域,帮助用户高效编辑科学图表。

局限与展望

模型对复杂几何结构的编辑能力有限,数据集的TikZ依赖性可能限制其泛化能力,未来需进一步优化。

通俗解读 非专业人士也能看懂

想象你在用乐高搭建模型。每次搭建后,你会根据朋友的建议修改某些部分,比如换颜色或加新零件。EdiTikZ就像一个聪明的助手,它能理解这些建议,并帮你快速完成修改。它的特别之处在于,它不仅能看懂你的乐高模型,还能准确地按照你的要求调整每个细节。

简单解释 像给14岁少年讲一样

假设你在玩Minecraft,建了一个城堡。朋友说:“把城堡的塔楼换成蓝色,再加个旗帜!”你可能需要花时间调整,但EdiTikZ就像一个超级助手,听了指令后,立刻帮你完成这些修改,甚至比你做得更好!是不是很酷?

术语表

TikZ (TikZ绘图语言)

一种基于LaTeX的图形绘制语言,广泛用于学术图表制作。

用于生成和编辑科学图表的核心语言。

VLM (视觉-语言模型)

一种结合图像和文本理解能力的模型,用于多模态任务。

用于生成编辑指令和评估编辑质量。

DaEdiTikZ

一个包含391K TikZ编辑对的大规模数据集,用于训练和评估科学图表编辑模型。

作为EdiTikZ模型的训练数据来源。

强化学习 (Reinforcement Learning)

一种通过奖励信号优化模型行为的机器学习方法。

用于优化编辑应用和渲染保真度。

分布外测试 (Out-of-Distribution Testing)

评估模型在未见过的数据分布上的表现能力。

用于验证EdiTikZ模型的泛化能力。

开放问题 这项研究留下的未解疑问

  • 1 如何扩展至其他图形语言以提升通用性?
  • 2 如何提高模型对复杂几何结构的编辑能力?
  • 3 如何减少编辑指令生成中的偏差?

应用场景

近期应用

学术图表优化

帮助研究人员快速调整图表,提升学术出版效率。

教育工具

为学生提供TikZ学习辅助,降低学习曲线。

远期愿景

跨语言图表编辑

支持多种图形语言的编辑,推动科学协作自动化。

原文摘要

Vision-language models (VLMs) have shown strong performance in generating scientific figures from text or images. However, producing publication-ready figures requires iterative refinement, making scientific figure editing an important yet largely unexplored task. Existing approaches rely on costly proprietary agentic systems, focus primarily on evaluation, or construct training supervision from synthetically generated edits. Instead, we leverage naturally occurring scientific revision and development trajectories as a scalable source of supervision. To this end, we introduce DaEdiTikZ, the first large-scale dataset of revision-derived scientific figure edits, constructed by mining 391K plausible TikZ edit pairs from arXiv, GitHub, and TeX SE and inferring 781K directed edit instructions with a VLM conditioned on rendered figures and TikZ code. We further introduce DaEdiTikZ-Bench, a human-refined benchmark with 790 instances, and train two compact Qwen3.5-based EdiTikZ models (4B and 9B) by jointly learning reconstruction and editing, followed by reinforcement learning (RL) with complementary rewards for rendered fidelity and edit application. Automatic evaluation places our 9B model above all tested baselines, while human evaluation with 9 annotators and 4,320 ratings places it above GPT-5.6-Sol and on par with Gemini-3.1-Pro. Under severe out-of-distribution shifts, it remains competitive with GPT-5.6-Sol near its 2K training sequence-length regime. Models and datasets will be released.

cs.AI cs.CL cs.CV