← 最新论文
💻 computer science

PlotPick: AI-powered batch extraction of numerical data from scientific figures

本文介绍了 PlotPick,这是一种利用视觉语言模型从科学图表中高效批量提取数值数据的开源工具,其在各类基准测试和图表类型上均展现出优于 DePlot 等专用图表转表格模型的性能。

原作者: Tommy Carstensen

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Tommy Carstensen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名研究人员,正试图撰写一份关于健康研究的大型报告。你需要从数百篇旧科学论文中的不同图表和图形里提取数据。但问题在于:这些数字被锁在图片里。它们并非写在电子表格中,而只是页面上的线条和条形。

要获取这些数字,你通常不得不玩一场枯燥的“猜测与点击”游戏,手动测量每张图表上的每一个数据点。这就像试图用铅笔描摹整图书馆书籍的字母来复制它们——耗时极长且无法规模化。

“PlotPick”登场了。

将 PlotPick 想象成一位超高速的机器人图书管理员,它不仅会阅读文字,还能“看见”图片。这是由 Tommy Carstensen 开发的一款免费工具,它使用了一种名为“视觉 - 语言模型”(VLM)的特殊人工智能。你可以将 VLM 想象成一名几乎读遍了世界上几乎所有书籍、看过几乎所有图片的学生。

以下是 PlotPick 的工作原理以及论文发现的简要说明:

魔法技巧:提出正确的问题

PlotPick 不需要为每种特定类型的图表定制复杂的机器人,它只需向人工智能提出一个非常简单的问题:“这是一张图表的图片。请将图片中的数字整理成一份整洁的列表(表格)。”

论文通过将这类“通用型”人工智能学生与名为DePlot的“专家型”机器人进行对比测试。DePlot 就像一位精通制作椅子(条形图)的大师木匠,却从未见过梯子(箱线图)或滑梯(直方图)。

结果:通用型获胜

论文在两条不同的赛道(称为基准测试)上进行了竞赛,以观察谁能最准确地提取数字。

  1. “ChartX"赛道(多样性测试):
    这条赛道包含多种不同类型的图表,包括一些专家型机器人从未见过的图表,例如箱线图。

    • 专家型(DePlot):71% 的数字提取正确。它在未练习过的图表上表现挣扎(在箱线图上仅降至 24%!)。
    • 通用型(PlotPick 的 AI): 正确率在 88% 到 96% 之间。即使是该组中“最便宜”的 AI 模型,也以巨大优势击败了专家型。
  2. “PlotQA"赛道(专家测试):
    这条赛道是专门为专家型机器人设计的。你可能会认为专家型会在此获胜。

    • 专家型: 正确率为 94%
    • 通用型: 令人惊讶的是,它们的正确率在 86% 到 99% 之间。最好的通用型甚至击败了专家型,尽管专家型是专门针对此测试进行训练的。

为什么通用型获胜?

论文提出了三个主要原因,解释为何这些“万事通”人工智能击败了“专才”:

  • 见多识广: 通用人工智能的训练图像数量比专家型多出数百万。它们拥有更广泛的“视觉词汇”。
  • 熟悉未知: 专家型只被教导如何阅读条形图和折线图。当它看到箱线图(科学中常见的图表)时,会感到困惑。而通用人工智能在其庞大的训练数据中见过箱线图,因此确切知道该怎么做。
  • 标签最为关键: 当数字直接写在图表上时(例如在条形正上方写着"50%"),人工智能的表现最佳。如果数字被隐藏,你需要从图表侧面猜测刻度,即使是最高级的人工智能也可能出错(例如将"230 万”误读为"2,300")。

核心结论

PlotPick 是一款工具,允许研究人员上传包含科学论文的 PDF 文件,它会自动查找图表、读取数字,并将其输出到电子表格(Excel、CSV 等)中,以便进行分析。

论文声称,你不再需要为每种类型的图表构建定制的人工智能。你只需使用这些功能强大的通用人工智能工具,配合简单的提示,它们的表现就会优于当前可用的专用工具。该工具免费、开源,并且已被哥本哈根的一个研究中心用于加快其工作进度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →