← 最新论文
💬 NLP

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

该论文提出了 ViTaB-A 基准,评估发现尽管多模态大语言模型在表格问答中表现尚可,但在 Markdown、JSON 及图像等不同格式下的细粒度归因能力(即指出支持答案的具体行列)普遍极差且不可靠,严重限制了其在需要透明度和可追溯性场景中的应用。

原作者: Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

发布于 2026-02-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 超级大脑”(多模态大语言模型)做了一次**“查户口”式的体检**。

想象一下,你有一个非常聪明的助手(AI),你让它看一张复杂的表格(比如公司的财务报表或医疗记录),然后问它:“去年哪个月的销售额最高?”

1. 核心问题:知道答案 vs. 知道答案从哪来

这篇论文发现了一个很尴尬的“双标”现象:

  • 答对题(Question Answering): 这个助手通常能给出正确答案。比如它说:“去年 12 月销售额最高,是 500 万。”这听起来很棒,对吧?
  • 指出处(Attribution/Citation): 但是,如果你问它:“你是怎么知道是 12 月的?请告诉我表格里的哪一行、哪一列支持这个结论。”这时候,助手就彻底懵圈了。

打个比方:
这就好比一个学生参加数学考试。

  • 情况 A(答对题): 老师问"1+1 等于几?”,学生脱口而出"2"。老师觉得他懂了。
  • 情况 B(指出处): 老师接着问:“请指出你在课本第几页、第几行找到了这个公式,或者把计算过程写出来。”结果学生虽然答对了"2",但他完全不知道这个答案是从哪来的,甚至可能是瞎蒙的,或者脑子里有个模糊的印象但说不清具体位置。

这篇论文的研究就是:现在的 AI 就像这个学生,能猜对答案,但无法精准地指出证据在哪里。

2. 实验是怎么做的?(ViTaB-A 测试)

研究团队搞了一个叫 ViTaB-A 的测试,就像给 AI 出了一套“找茬”试卷。
他们把表格换成了三种不同的“衣服”给 AI 看:

  1. 图片版(Image): 就像一张拍下来的表格照片。
  2. 文字版(Markdown): 像 Word 文档里的表格。
  3. 代码版(JSON): 像程序员写的代码数据。

然后问 AI 两个问题:

  1. 答案是什么?
  2. 答案在表格的哪个格子(行和列)?

3. 令人震惊的发现

测试结果就像给 AI 泼了一盆冷水:

  • 猜答案 vs. 找证据的“剪刀差”:
    AI 猜对答案的准确率大概在 50%-60%(还能看),但让它找证据(指出具体行和列)时,准确率直接跌到 30% 以下

    • 特别是在 JSON(代码版) 格式下,AI 找证据的能力几乎等于瞎蒙(接近 0% 的准确率)。
  • “看图”比“看字”强:
    有趣的是,当表格是图片时,AI 找证据的能力反而比看文字(Markdown 或 JSON)要强。

    • 比喻: 就像人类看一张带颜色的表格照片,能一眼看出“哦,这一行是红色的,数据在这里”。但给 AI 看一堆纯文字代码,它就像在迷宫里找路,容易晕头转向,分不清哪是行、哪是列。
  • 找“行”容易,找“列”难:
    AI 比较擅长指出“这是第几行”(比如:这是张三的记录),但非常不擅长指出“这是第几列”(比如:这是“销售额”这一列)。

    • 比喻: 就像你能认出“这是张三”,但让你指出“张三的‘身高’数据在哪一列”时,你就糊涂了。
  • 自信过头(Confidence Gap):
    最可怕的是,即使 AI 找错了证据,它依然非常自信

    • 它可能会说:“我 90% 确定答案在第 5 行第 3 列。”但实际上它完全找错了。
    • 这意味着,你不能因为 AI 说话很有底气,就相信它找到的证据是真的。

4. 这对我们意味着什么?

这篇论文给那些想用 AI 处理重要数据(比如银行、医疗、法律)的人敲响了警钟:

  • 现在的 AI 还不可靠: 如果你让 AI 帮你审计财务报表,它可能算对了总数,但它指不出具体哪个数字错了,或者它指错了地方。在需要“可追溯、可审计”的领域,这种 AI 是危险的。
  • 不能只看答案: 我们不能只问 AI“答案是什么”,必须同时问“证据在哪里”。如果它指不出证据,哪怕答案是对的,也不能信。
  • 未来的方向: 现在的 AI 训练太注重“把答案说对”,而忽略了“把证据指对”。未来的 AI 需要专门训练这种“指路”的能力,而不仅仅是“猜谜”的能力。

总结

这篇论文告诉我们:目前的 AI 就像一个“虽然能猜对答案,但经常指错路”的导游。 在需要精确导航(比如查账、看病历)的时候,我们还得小心,不能全听它的,因为它可能连自己是怎么找到答案的都不知道。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →