← 最新论文
🤖 AI

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

本文介绍了 OmegaUse-OfficeVal,这是一个包含 100 个具有经济基础(人类劳动时间与任务价格)的长程办公套件任务的新基准,用于评估大语言模型智能体,并揭示了尽管目前的模型比人类更便宜且更快速,但在任务完成质量方面仍未能达到人类水平。

原作者: Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:你的电脑不再只是等待你点击按钮,而是能真正为你分担工作。这就是“AI智能体”(AI agents)的梦想——这些聪明的程序能够理解你的指令、打开你的文件并完成一项任务,就像一个数字实习生一样。一段时间以来,这些智能体在处理短小、简单的技巧方面表现出色,比如写一封邮件或总结一篇短文。但衡量它们实力的真正考验在于,它们是否能处理一整天的办公工作:接收一份杂乱的报告、对其进行重新排版、添加图表,并完美地保存,且过程中不会产生混乱或损坏文件。研究人员提出的核心问题是:这些数字员工真的能胜任这份工作吗?与雇佣真人相比,这样做是否物有所值?

于是,由百度研究人员设计的全新“成绩单”——OmegaUse-OfficeVal 应运而生,旨在测试正是这一点。他们并没有凭空捏造简单的虚假任务,而是构建了一个包含 100 个真实世界办公挑战的基准测试,例如修复损坏的电子表格或将草稿转化为精美的演示文稿。这个测试的特别之处在于,他们为每一项任务都贴上了“价格标签”。他们精确测量了人类完成该任务所需的时间,并估算了雇佣人工完成该任务的成本。随后,他们让全球最顶尖的几个 AI 模型尝试解决这些相同的难题。结果如何?AI 智能体速度极快且成本极低——通常只需几分钟且仅花费几分钱就能完成——但它们犯错的频率仍然太高,以至于还无法被信任去交付最终成品。虽然它们正在进步,但尚未达到可靠的人类初级员工水平。

设定:数字障碍赛

要理解研究人员的工作,可以将办公室想象成一个巨大的、杂乱的工场。过去,测试 AI 就像要求它堆叠几个积木,如果掉了一个,就算失败。但真正的办公工作更像是从零开始烘焙一个复杂的蛋糕:你必须收集原料(文件)、遵循食谱(指令),如果你把糖霜烤焦了,整个蛋糕就毁了。

研究人员创建了一个名为 OmegaUse-OfficeVal 的数据集,其中包含 100 个这类“烘焙蛋糕”的任务。这些不是简单的“写一首诗”之类的请求,而是涉及 Word 文档、PowerPoint 幻灯片和 Excel 表格的长流程、多步骤工作。有些任务人类平均需要 2.32 小时 才能完成。对于一台计算机来说,保持如此长时间的专注力是非常不容易的!

这个基准测试的独特之处在于其“经济落地性”(economic grounding)。研究人员不仅询问“AI 是否完成了任务?”,他们还询问“它创造了多少价值?”为此,他们追踪了每项任务的两个指标:

  1. 人类劳动时间: 真人完成该任务所需的时间。
  2. 任务价格代理值: 如果你雇佣一名自由职业者来做这项工作,大约会花费多少钱(范围在每项任务约 3.65 美元29.22 美元 之间)。

这使得他们不仅能根据速度来比较 AI,还能判断 AI 究竟是在节省成本,还是仅仅在制造廉价的错误。

测试:AI 对阵人类实习生

研究人员让几个顶尖的 AI 模型与“人类基准线”展开了对决。这个基准线并非 CEO 或天才,而是一名熟练的初级员工或实习生。人类接收到的指令和文件与 AI 完全相同。

为了评定结果,研究人员并没有仅仅让一个真人看一眼最终文件并说“看起来不错!”那样做太慢且具有主观性。相反,他们编写了基于代码的验证器。想象一个机器人检查员,它会自动检查最终文件:打开文档,检查是否有封面,统计图表的大小是否正确,并确保没有误删文本。如果文件损坏或缺失关键部分,机器人会给出零分。这使得测试变得公平、快速且可重复。

结果:快速且廉价,但不完美

尘埃落定后,结果展示了一个清晰的故事。

人类基准线:
人类员工的平均得分是满分的 27.79。他们很可靠,很少损坏文件,并且能处理好大部分细节。然而,他们需要时间和金钱。平均而言,一项人类任务的成本约为 6.86 美元,耗时 2.32 小时

AI 智能体:
AI 模型则是另一番景象。它们速度极快,而且极其便宜。

  • 速度: 最快的 AI(DeepSeek-V4-Pro)完成一项任务仅需 0.184 小时(约 11 分钟)。
  • 成本: 最便宜的 AI(Qwen3.7-Plus)每项任务的成本仅为 0.2152 美元。这甚至比一杯咖啡还要便宜!

但问题在于:它们做得并不够好。
表现最好的 AI 模型(GLM-5.2)得分仅为 17.91。这明显低于人类的 27.79 分。虽然 AI 更快、更便宜,但它犯错更多。它经常忘记添加目录,弄乱格式,或者生成一个无法打开的文件。

研究人员发现,AI 在处理最难、最长的任务时表现最差。当一项任务需要人类工作很长时间(超过 2 小时)时,AI 的性能下降得更加厉害。看来,虽然 AI 擅长快速、简单的任务,但当涉及到复杂的“长程”(long-horizon)规划时,它们就会迷失方向。

结论:尚未准备好进入主流阶段(目前而言)

这项研究表明,我们正处于 AI 办公工作的“谷底”。这项技术无疑是有用的,因为它既便宜又快速。如果你只需要一个草稿或一个快速摘要,AI 是一个极好的工具。但如果你需要一份可以直接发给客户的、精美且专业的文档,AI 目前还达不到要求。

作者明确排除了“AI 已经解决了办公工作”的观点。他们证明了虽然 AI “显著更便宜且更快”,但其“交付质量尚未接近人类水平”。在最终产品的质量方面,人类员工与 AI 智能体之间的差距依然巨大。

然而,论文对未来持乐观态度。通过创建这个带有真实经济数据的严谨测试,研究人员建立了一份路线图。他们准确知道 AI 在哪里失败(长任务、复杂格式),现在可以针对这些具体问题进行改进。目前来看,最好的策略似乎是合作:让 AI 处理繁重的工作和快速的草稿,但保留人类在环节中进行检查,以修正错误。实现“氛围办公”(vibe working)——即 AI 直接处理整个工作——的梦想仍处于进行时,但旅程已经正式开启。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →