← 最新论文
💻 computer science

LiveFigure: Generating Editable Scientific Illustration with VLM Agents

LiveFigure 是一个由视觉语言模型驱动的智能体框架,它模仿人类研究人员的多步骤工作流程,通过 PowerPoint 脚本生成完全可编辑的矢量科学插图,在出版就绪度和人类偏好方面显著优于现有基线。

原作者: Chenyang Shao, Jiahe Liu, Fengli Xu, Yong Li

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyang Shao, Jiahe Liu, Fengli Xu, Yong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位科学家,刚刚发现了一个绝妙的新想法。你需要绘制一张图表向全世界解释它。在过去,你得花数小时在 PowerPoint 或 Illustrator 等软件中手动拖拽方框、绘制箭头并调整字体。这极其繁琐,就像用镊子一块砖一块砖地建造房屋。

最近,AI 图像生成器(那些能从文字生成精美图片的工具)承诺能为你完成这项工作。但它们存在一个重大缺陷:它们在画布上绘制图片,然后涂上清漆封存。一旦图片生成,除非重画整幅图,否则你无法移动任何一个方框或修正一个拼写错误。如果你想把“加权和”方框向下移动,AI 只会尝试重绘整张图片,而且往往会把图片的其他部分画错。

LiveFigure 是一个改变游戏规则的新系统。它不像是在绘制一张静态图片,而是像一位超级聪明、极度有条理的建筑师,为你构建一个完全可编辑的图表模型。

其工作原理可分解为三个简单步骤:

1. “蓝图”阶段(视觉规划)

在开始建造之前,人类建筑师会观察成功的建筑,了解哪些设计行之有效。LiveFigure 也是如此。它会扫描顶级期刊中成千上万张高质量科学图表,学习其中的“通行规则”。

  • 类比:想象你在建造树屋。与其猜测树枝该放在哪里,不如去观察那些最出色的树屋照片。你会了解到梯子通常装在左侧,窗户朝向阳光。LiveFigure 利用这种“视觉记忆”,在编写任何代码之前,先勾勒出你图表的“心理蓝图”。

2. “建造”阶段(过程生成)

这是 LiveFigure 与其他 AI 不同的地方。它不是绘制像素,而是编写代码(具体而言,是与 Microsoft PowerPoint 交互的 Python 脚本)。

  • 类比:把其他 AI 想象成在调色板上混合颜料的画家。LiveFigure 则是一位机器人木匠,拥有一个由预制的完美部件组成的工具箱。它不会试图“猜测”如何画一个方框,而是使用一个名为 add_box() 的预测试工具。它不会猜测如何画箭头,而是使用名为 add_connector() 的工具。
  • “经验”技巧:有时,即使是机器人也会犯错(比如试图把锤子当螺丝刀用)。LiveFigure 会保存一本“错误日记”。如果它尝试做某件之前导致程序崩溃的事情,它会记住:“绝不再做!”这有助于它第一次就写出真正有效的代码。

3. “质检”阶段(针对性优化)

一旦机器人构建好图表,“视觉检查员”(另一个 AI)就会审视结果。

  • 类比:想象木匠搭建了一个架子,但检查员发现一颗螺丝凸出,或者架子略微歪斜。检查员不会拆掉整个架子从头再来,而是指向那颗特定的螺丝说:“把这个顺时针转一下。”
  • LiveFigure 会对代码进行这些微小而精确的调整。它会修正歪斜的箭头或重叠的文本框,而无需触碰图表的其他部分。

结果:一个“乐高”式图表

最终输出不是一张扁平的图片(如 JPEG),而是一个PowerPoint 文件,其中每一个方框、箭头和单词都是独立的、可移动的对象。

  • 为何重要:如果你想改变一个方框的颜色,只需点击它并修改颜色即可。如果你想移动整个部分,只需拖动它,箭头会自动拉伸和弯曲以跟随它。这就像是用乐高积木搭建,而不是浇筑混凝土。

论文发现

研究人员将 LiveFigure 与最先进的人工智能图像生成模型(如 Google 的"Nano Banana"和 OpenAI 的"GPT-Image")以及传统编码工具进行了对比测试。

  • “修复”测试:他们要求人类对 AI 生成的图表进行修改,使其达到科学论文发表的标准。
    • 其他 AI:人类需要进行约30 次以上的编辑才能修复混乱,即便如此,只有**24%**的图表质量足够可用。
    • LiveFigure:人类仅需进行约17 次编辑(主要是微调),**80%**的图表可直接用于发表。
  • 人类偏好:当人们并排观看两张图表(一张来自 LiveFigure,一张来自竞争对手)时,**60%**的情况下他们选择了 LiveFigure,因为它看起来更专业,逻辑也更合理。

简而言之

LiveFigure 不仅仅是“绘制”一张图片;它通过模仿人类专家思维方式的智能、分步过程来构建图表。它创建出你可以真正编辑、修正和完善图表,将科学插图这项艰巨任务转变为一种如同玩数字乐高般轻松的过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →