← 最新论文
💻 computer science

From Static to Interactive: Authoring Interactive Visualizations via Natural Language

本文介绍了 Athanor,这是一种新颖的系统,它利用多模态大语言模型和自然语言指令,将现有的静态可视化转换为交互式可视化,而无需编程或访问原始源代码。

原作者: Can Liu, Jaeuk Lee, Tianhe Chen, Zhibang Jiang, Xiaolin Wen, Yong Wang

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Can Liu, Jaeuk Lee, Tianhe Chen, Zhibang Jiang, Xiaolin Wen, Yong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张精美的城市天际线打印照片。它是静态的:你可以观看它,但无法放大到特定建筑,无法重新排列摩天大楼,也无法点击桥梁以查看其上的交通流量。现在,想象一下,如果你能对着一个乐于助人的助手说话,将同一张照片转化为一个生动、可呼吸的数字模型,让你能够完成上述所有操作,那会是怎样的情景。

这正是论文《从静态到交互:通过自然语言创作交互式可视化》所提出的内容,该系统名为Athanor

以下是其工作原理的简单分解,采用日常类比:

问题:被“冻结”的图表

目前,你在报告或新闻文章中看到的大多数图表都是“冻结”的。它们就像墙上的画作。

  • 问题所在:如果你想修改图表(例如,“只显示 2020 年的销售额”或“将此折线图改为柱状图”),你通常需要是一名程序员,并且能够访问原始代码和数据。
  • 现实情况:通常,那些代码已经丢失,或者查看图表的人不懂编程。他们只能被困在一张静态图片中。

解决方案:Athanor(“魔法翻译器”)

作者开发了一种名为Athanor的工具,它充当你的口语与图表行为之间的“魔法翻译器”。你无需懂任何代码。你只需告诉系统你想要发生什么,它便会自行找出实现方法。

该系统有三个主要的“工作者”(代理)来承担繁重的工作:

1. 设计蓝图(动作 - 修改空间)

将其想象为图表可能执行的所有操作的菜单。

  • 类比:想象一辆汽车。你知道可以“踩油门”(动作)来“让车加速”(修改)。
  • 工作原理:Athanor 拥有一个预定义的交互列表。它知道“悬停”(动作)可以导致“显示工具提示”(修改),或者“点击按钮”(动作)可以导致“更改图表类型”(修改)。这创建了一个结构化地图,让计算机知道什么是可行的。

2. 智能团队(多代理分析器)

这是整个操作的大脑。它由三个专门的 AI 代理协同工作,以理解你的请求。

  • 翻译器:你说:“我想在悬停于柱状图时查看详细信息。”翻译器将这句杂乱的话转化为严格的指令:动作:悬停 | 目标:柱状图 | 修改:显示工具提示
  • 编辑(修正代理):该代理会双重检查工作。如果你要求了不可能的事情(例如,当柱状图已经堆叠时,要求“将这些柱状图垂直堆叠”),编辑会发现错误并说:“嘿,这说不通。我们试试这个吧。”
  • 教练(指导代理):如果你的请求太模糊(例如,“让它变得可交互”),教练会介入并问道:“你是指想要放大,还是想要过滤数据?”它会帮助你细化请求,直到其清晰明确。

3. 变形者(可视化抽象翻译器)

这是最技术性的部分,但你可以将其想象为一个“万能适配器”。

  • 问题:图表的构建方式多种多样(就像不同品牌的乐高积木套装)。有些使用一套规则,另一些使用另一套。通常,如果不将其拆解,你很难将一种品牌转换为另一种。
  • 解决方案:Athanor 将静态图表(即使它只是一个图像文件)分解为由约束构成的灵活“骨架”。
  • 类比:想象图表不是一个僵硬的雕像,而是一个由看不见的橡皮筋和磁铁(约束)固定在一起的结构。
    • 如果你移除一根柱子,橡皮筋会将剩余的柱子拉下来以填补空隙。
    • 如果你放大,磁铁会拉伸以显示更多细节。
    • 因为该系统理解这些“物理规则”而非特定代码,所以它可以使任何图表变得灵活,无论其最初是如何构建的。

你实际上能做什么?

论文展示了两个人使用该系统的示例:

  1. “比较”按钮:一位用户查看了一个复杂的堆叠面积图,并说:“让我选择两个区域并进行比较。”系统添加了一个按钮。点击后,它剥离了其他数据,将选定的两个区域并排对齐,并重新缩放图表,以便用户能清晰地看到差异。
  2. “切换”按钮:一位用户想查看全球排放数据。他们点击一个按钮将折线图切换为面积图,再点击另一个按钮切换为柱状图。他们还可以拖动元素以更改堆叠方式。

结果

研究人员对 11 人进行了测试,包括数据分析师和学生。

  • 发现:人们只需与系统对话,就能轻松地将静态图表转化为交互式图表。
  • 结论:即使是非专家也发现它很直观。他们觉得这为他们节省了时间,因为他们无需从头重建图表。该系统足够智能,能够理解他们的意图并修正他们模糊的请求。

局限性(目前还无法做到的事)

论文诚实地指出了 Athanor无法做到的事情:

  • 无新数据:它只能重新排列或突出显示图表中已经可见的数据。它无法去互联网上获取新数据来回答诸如“显示该城市的天气数据”之类的问题。
  • 复杂形状:它在标准图表(柱状图、折线图、面积图)上表现良好,但在处理非常复杂、非标准的可视化(如 3D 地图或力导向网络)时则显得吃力。

总结

Athanor就像是一个数据图表的“自己动手”(DIY)套件。你不再需要一位大师级木匠(程序员)来构建一个新的交互式仪表板,你只需给木匠一张桌子的照片,然后说:“我想在这里加个抽屉,并把桌腿做成可调节的”,系统就会为你绘制蓝图并将其构建出来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →