← 最新论文
💬 NLP

Office Comprehension Benchmark

本文介绍了 Office Comprehension Bench (OCB),这是首个旨在通过文件忠实度问答(File Fidelity Q&A)和领域问答(Domain Q&A)两个维度,评估大语言模型对 Word、Excel 和 PowerPoint 理解能力的公开基准测试,研究结果表明,即使是顶尖模型在处理复杂的文档推理时也表现挣扎,在领域任务上的准确率仅为 59.3%。

原作者: Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwas Suryanarayanan, Neha Nandan Kenkare, Weiyao Xie, Zhipeng Han, Zheng Zhang, Wal
发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwas Suryanarayanan, Neha Nandan Kenkare, Weiyao Xie, Zhipeng Han, Zheng Zhang, Waleed Shahid, Jay Rathi, Russell Scherer, Thong Q. Nguyen, Michael Bentley, Tamara Stankovic, Rasika Chakravarthy, Vishal Chowdhary

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、超级聪明的机器人助手,它能够阅读文档。你想知道:它真的擅长阅读真实的办公文件吗,还是只是在瞎猜?

微软的研究人员构建了一个名为 Office Comprehension Bench (OCB) 的大型测试,来弄清这个问题。你可以把这个测试看作是 AI 的“驾照考试”,只不过它不是在驾驶汽车,而是在 Word 文档、Excel 表格和 PowerPoint 幻灯片中穿梭。

以下是这项测试的工作原理,分为几个简单的部分:

1. 两种类型的测试

该考试有两个不同的“赛道”,就像电子游戏中的两个不同关卡。

  • 赛道 1:“鹰眼”测试 (文件忠实度/File Fidelity)

    • 目标: AI 能否准确看到页面上的内容?
    • 类比: 想象你递给 AI 一份打印好的菜单,然后问:“汤的价格是多少?”或者“汤的名字是否用了加粗字体?”
    • 检查内容: AI 能否找到表格中的特定数字?它能识别出图表吗?它能读到幻灯片底部微小的演讲者备注吗?这关乎于识别并读取事实,而不是凭空捏造。
    • 结果: AI 在这方面表现得非常出色!它就像一个永不疲倦、绝不会遗漏细节的图书管理员。事实上,AI 在这些任务上的得分高于人类平均水平,因为人类会感到疲劳并漏掉小细节,而 AI 则能完美地扫描一切。
  • 赛道 2:“专家侦探”测试 (领域问答/Domain Q&A)

    • 目标: AI 能否理解复杂的业务问题并解决它们?
    • 类比: 想象你递给 AI 一叠 50 页的财务报告、一份包含销售数据的电子表格,以及一份关于新产品的幻灯片演示文稿。然后你问:“如果我们收购这家公司,三年后我们将赚多少钱,面临哪些风险?”
    • 检查内容: 这不仅仅是寻找一个数字。AI 必须阅读所有内容,将不同文件之间的信息联系起来,进行数学计算,并建立逻辑论证。这就像是要求一名侦探利用散落在三个不同笔记本中的线索来破解谜团。
    • 结果: 这正是 AI 感到吃力的地方。即使是最聪明的 AI 模型,正确率也只有大约 59% 到 63%。它们就像是聪明的实习生,虽然了解事实,但有时会对大局判断失误或在计算上出错。

2. 他们是如何评分的

研究人员不仅询问“答案是否正确”,他们还将每个答案拆解成了极其微小的、原子级的组成部分(就像核对清单一样)。

  • “三位评委”小组: 他们没有使用单一的人来评分,而是使用了三种不同的 AI 模型来充当评委。如果三位评委中有两位认为答案正确,则计为通过。这就像是有三位老师共同批改学生的作文,以确保评分公平。
  • “原子级”主张: 如果一个问题包含 50 个部分的答案,AI 必须把这 50 个部分全部答对。如果它答对了 49 个却漏掉了一个微小的细节,它也会丢分。这确保了 AI 不仅仅是“大致”正确,而是必须做到精准。

3. 重大发现

论文揭示了当今 AI 的“分裂人格”:

  • 超级阅读者: 当涉及到仅仅观察文档并查找事实(例如“这封信上的日期是什么时候?”)时,AI 是超人类级别的。它比阅读一次文档的人类更快、更准确。
  • 次级专家: 当涉及到对复杂业务问题进行深度思考(例如“分析这个供应链风险”)时,AI 仍然只是次级专家。它很聪明,但尚未达到资深专业人士的水平。

4. “思考得更久”会有帮助吗?

研究人员测试了让 AI “思考得更久”或“思考得更深”(使用更多的计算能力)是否能解决问题。

  • 结果: 令人惊讶的是,效果并不明显。 在同一“家族”的模型中,让 AI 进行更多思考并不能显著提高分数。这就像要求一个学生盯着一道数学题看一个小时而不是 10 分钟;他们依然会犯同样的错误。
  • 真正的解决方法: 提高得分的唯一方法是切换到“更大、更昂贵”的模型(更高阶的模型)。这就像是从标准计算器升级到超级计算机;更大的机器确实能做得更好,但成本更高,耗时也更长。

总结

这篇论文介绍了一种测试 AI 是否真正理解我们办公文件的新方法。它表明,虽然 AI 在文档中寻找信息方面表现惊人,但在通过复杂、真实的业务问题进行推理方面,它仍在学习阶段。该测试现在已经公开,其他研究人员可以利用它来观察他们的 AI 是否在变得更像一个真正的办公助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →