Encoded but Not Routed: Explaining the Table-Chart Gap in Scientific Claim Verification
本文研究了表格证据与图表证据在科学断言验证方面的性能差距,揭示了多模态大语言模型虽能成功在中间层编码图表信息,却无法将其路由至预测位置,这表明其缺陷在于路由而非编码。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图判断一位科学家说法是否真实的法官。你有两份证据:一份电子表格(表格)和一份图表(图表),它们显示的是完全相同的数字。
你会预期一个聪明的计算机程序(多模态人工智能)无论是在看电子表格还是看图表时,都会做出相同的判断。但问题在于,这个 AI 擅长阅读电子表格,但在处理图表时却经常感到困惑,尽管数据是完全一样的。
这篇论文探讨的是:为什么会发生这种情况?
是 AI 对图表“视而不见”(它看不见数据)?还是它被“分心了”(它看到了数据,但在做出最终决定时却忘了使用它)?
调查过程:窥探黑盒内部
研究人员将这个 AI 视为一个神秘的盒子。他们不仅仅是向 AI 询问答案,而是逐层窥探其“大脑”内部,观察信息是如何流动的。他们使用了两种主要工具:
“线性探测器”(侦探的手电筒):
想象一下,AI 的大脑是一个由许多房间(层)组成的漫长走廊。研究人员在每个房间里都放置了一个小侦探(探测器),去询问:“你已经知道答案了吗?”- 发现: 当 AI 查看图表时,侦探发现在中间的房间里隐藏着答案。信息确实在那里!然而,当信息到达最后一个房间(即写下最终答案的地方)时,它却消失了。
- 类比: 这就像一位厨师完美地切好了蔬菜(编码了数据),但在上菜之前却忘了把它们放入汤中。食材确实在那儿,但没能进入最终的成品。
“注意力图”(追踪视线):
研究人员还追踪了 AI 在做出决定时正在“注视”哪里。- 发现: 他们发现了两种不同类型的“遗忘”,这取决于他们测试的是哪一类 AI 模型:
- “回避视线”(Qwen 模型): 这些模型几乎完全没有看图表。它们瞥了一眼图表,然后立即将注意力转向了文本,完全忽略了视觉证据。这就像一个正在考试的学生,扫了一眼图表,但只读题目,忽略了关键的图片。
- “分心视线”(InternVL 模型): 这个模型确实看了图表。它盯着数据看。但即便它看到了数字,也无法将它们与最终答案联系起来。这就像一个学生非常专注地研究图表,但在尝试写文章时却感到困惑,无法利用刚才做的笔记。
- 发现: 他们发现了两种不同类型的“遗忘”,这取决于他们测试的是哪一类 AI 模型:
核心结论
论文得出结论,AI 并不是对图表“视而不见”。信息被成功捕捉并存储在了 AI 大脑的中部。问题在于路由(传输路径)。
把 AI 的大脑想象成一个繁忙的办公室:
- 表格就像是一份经过盖章、归档并直接送到老板桌上的备忘录。
- 图表则像是一份经过盖章和归档,但随后在收发室丢失了的备忘录。即使收发室里有这份文件,老板也从未看到过它。
研究人员发现,对于图表,信息被编码了,但未能传递到负责做出最终决策的“预测位置”。这是一个关于信息如何传递的问题,而不是关于信息如何被看见的问题。
一句话总结
AI 可以“看到”图表并存储数据,但它无法将这些信息传递到大脑中做出最终决定的部分,导致它在处理图表时的表现不如处理表格。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。