← 最新论文
💻 computer science

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

本文介绍了 ShredBench,这是一个具有自动化生成流程的新颖基准,用于评估多模态大语言模型在重建 shredded 文档这一挑战性任务上的表现,结果表明,与在完整文档上的表现相比,当前模型在弥合视觉不连续性所需的细粒度跨模态推理方面存在显著困难。

原作者: Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一份报纸、一段代码或一份财务电子表格。现在,想象有人拿起一把剪刀,将这份文件撕成 8 块、12 块,甚至 16 块随机且参差不齐的碎片。随后,他们将这些碎片扔成一堆,搅乱它们,甚至可能稍微揉皱一些。

你的任务是什么?面对那堆杂乱的纸屑,准确告诉计算机原始文件的内容,并按正确的顺序排列。

这是一项名为ShredBench的新研究的核心挑战。研究人员希望看看最新、最智能的 AI 模型(称为多模态大语言模型,或 MLLM)在面对被毁文件时,能否像人类侦探一样行事。

以下是他们所做工作及发现结果的简要说明:

1. “碎纸拼图”与“拼图游戏”

通常,当我们用拼图测试 AI 时,使用的是标准拼图游戏,即匹配一块拼图边缘的图案与另一块拼图边缘的图案。那是一场视觉游戏。

但 ShredBench 不同。这是一场语义游戏。

  • 类比:想象你有一句话,其中一块碎片上是"“算法优化-"",另一块上是"-了损失函数”"。由于切割参差不齐,边缘并不完美匹配。人类不需要看到确切的像素匹配;他们运用大脑知道"“优化”"是此处应填入的词汇。
  • 目标:研究人员希望看看 AI 能否运用其“大脑”(语言知识)来拼凑意义,而不仅仅是依靠其“眼睛”(匹配像素)。

2. 他们如何构建测试(“碎纸机”)

为了进行公平的测试,研究人员并未直接拍摄真实的碎纸照片,而是构建了一个数字“碎纸机”流程:

  1. 来源:他们获取了真实的新闻文章(英文和中文)、计算机代码(Python、Java、C++)以及复杂的表格。
  2. 切割:他们使用一种数学方法(沃罗诺伊 tessellation)将数字文档切割成不规则、参差不齐的形状,就像真实的碎纸机那样。
  3. 3D 效果:他们在 3D 程序中模拟物理效果,添加阴影、褶皱和深度,使数字碎片看起来像真实杂乱的纸屑。
  4. 混合:他们打乱了碎片的顺序,迫使 AI 从零开始推断正确的顺序。

3. 结果:“聪明”但“脆弱”

研究人员测试了全球 14 个最先进的 AI 模型,包括 GPT-5、Gemini 3 和 Qwen 等知名模型。

  • 好消息:当文档完整且清晰时,几乎所有模型的表现都如同人类专家。它们能够完美地阅读和理解文本。
  • 坏消息:一旦文档被撕碎,大多数模型的性能崩溃了。
    • 这就像一名学生,如果题目印刷清晰,就能在数学考试中取得优异成绩;但如果试卷被撕成碎纸片,就会惨败。
    • 随着碎片数量增加(从 8 块到 16 块),AI 重建文本的能力急剧下降。
    • 许多模型开始“幻觉”——编造原本不存在的词汇,或将句子顺序放错。

4. 胜者与败者

  • 冠军Gemini 3 Pro 是当之无愧的赢家。它最具韧性,比其他任何模型都能更好地处理碎纸片。即使视觉线索杂乱无章,它仍能“阅读”文本。
  • 挣扎者
    • 中文文本:模型在处理中文时比英文更吃力。研究人员解释说,在英文中,撕裂可能切断一个单词,但你通常可以猜出剩余部分。而在中文中,单个汉字是一个完整的意义单元;如果你将一个汉字切成两半,其含义往往完全丧失,这使得 AI 更难猜测。
    • 代码:计算机代码非常困难。代码依赖于严格的规则(如缩进和括号)。当纸张被撕碎时,这些视觉规则被破坏,AI 会困惑于哪一行代码应该接在下一行。
    • 表格:表格就像网格。当你撕碎网格时,行和列会混杂在一起。即使是最好的模型,也很难将单元格恢复到正确的二维排列中。

5. AI 实际做了什么(成功与失败)

  • 成功:在某些情况下,AI 的表现令人惊叹。如果一个像"school"这样的单词在"sch"和"ool"之间被切断,AI 不仅仅是阅读碎片;它利用语言知识“弥合差距”,意识到该单词是"school"。
  • 失败:AI 经常在排序上失败。在故事中,上下文告诉你接下来是什么;在代码中,逻辑告诉你。AI 经常搞混代码行,将程序的“结尾”放在“开头”之前,因为它无法透过视觉混乱看到逻辑流。

结论

该论文总结道,虽然 AI 擅长阅读清晰的文档,但目前还缺乏重建物理破损信息所需的细粒度推理能力。它将纸屑视为分离、孤立的岛屿,而不是单一连贯故事的一部分。

研究人员建立这个基准(ShredBench)并非为了推销产品,而是为了向科学界展示:“嘿,我们的 AI 很聪明,但当世界变得混乱和破碎时,它仍然会挣扎。”这突显了这些模型在将其所“见”与所“知”联系起来方面存在的具体差距。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →