OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
本文介绍了 OmegaUse-OfficeVal,这是一个包含 100 个具有经济基础(人类劳动时间与任务价格)的长程办公套件任务的新基准,用于评估大语言模型智能体,并揭示了尽管目前的模型比人类更便宜且更快速,但在任务完成质量方面仍未能达到人类水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:你的电脑不再只是等待你点击按钮,而是能真正为你分担工作。这就是“AI智能体”(AI agents)的梦想——这些聪明的程序能够理解你的指令、打开你的文件并完成一项任务,就像一个数字实习生一样。一段时间以来,这些智能体在处理短小、简单的技巧方面表现出色,比如写一封邮件或总结一篇短文。但衡量它们实力的真正考验在于,它们是否能处理一整天的办公工作:接收一份杂乱的报告、对其进行重新排版、添加图表,并完美地保存,且过程中不会产生混乱或损坏文件。研究人员提出的核心问题是:这些数字员工真的能胜任这份工作吗?与雇佣真人相比,这样做是否物有所值?
于是,由百度研究人员设计的全新“成绩单”——OmegaUse-OfficeVal 应运而生,旨在测试正是这一点。他们并没有凭空捏造简单的虚假任务,而是构建了一个包含 100 个真实世界办公挑战的基准测试,例如修复损坏的电子表格或将草稿转化为精美的演示文稿。这个测试的特别之处在于,他们为每一项任务都贴上了“价格标签”。他们精确测量了人类完成该任务所需的时间,并估算了雇佣人工完成该任务的成本。随后,他们让全球最顶尖的几个 AI 模型尝试解决这些相同的难题。结果如何?AI 智能体速度极快且成本极低——通常只需几分钟且仅花费几分钱就能完成——但它们犯错的频率仍然太高,以至于还无法被信任去交付最终成品。虽然它们正在进步,但尚未达到可靠的人类初级员工水平。
设定:数字障碍赛
要理解研究人员的工作,可以将办公室想象成一个巨大的、杂乱的工场。过去,测试 AI 就像要求它堆叠几个积木,如果掉了一个,就算失败。但真正的办公工作更像是从零开始烘焙一个复杂的蛋糕:你必须收集原料(文件)、遵循食谱(指令),如果你把糖霜烤焦了,整个蛋糕就毁了。
研究人员创建了一个名为 OmegaUse-OfficeVal 的数据集,其中包含 100 个这类“烘焙蛋糕”的任务。这些不是简单的“写一首诗”之类的请求,而是涉及 Word 文档、PowerPoint 幻灯片和 Excel 表格的长流程、多步骤工作。有些任务人类平均需要 2.32 小时 才能完成。对于一台计算机来说,保持如此长时间的专注力是非常不容易的!
这个基准测试的独特之处在于其“经济落地性”(economic grounding)。研究人员不仅询问“AI 是否完成了任务?”,他们还询问“它创造了多少价值?”为此,他们追踪了每项任务的两个指标:
- 人类劳动时间: 真人完成该任务所需的时间。
- 任务价格代理值: 如果你雇佣一名自由职业者来做这项工作,大约会花费多少钱(范围在每项任务约 3.65 美元 到 29.22 美元 之间)。
这使得他们不仅能根据速度来比较 AI,还能判断 AI 究竟是在节省成本,还是仅仅在制造廉价的错误。
测试:AI 对阵人类实习生
研究人员让几个顶尖的 AI 模型与“人类基准线”展开了对决。这个基准线并非 CEO 或天才,而是一名熟练的初级员工或实习生。人类接收到的指令和文件与 AI 完全相同。
为了评定结果,研究人员并没有仅仅让一个真人看一眼最终文件并说“看起来不错!”那样做太慢且具有主观性。相反,他们编写了基于代码的验证器。想象一个机器人检查员,它会自动检查最终文件:打开文档,检查是否有封面,统计图表的大小是否正确,并确保没有误删文本。如果文件损坏或缺失关键部分,机器人会给出零分。这使得测试变得公平、快速且可重复。
结果:快速且廉价,但不完美
尘埃落定后,结果展示了一个清晰的故事。
人类基准线:
人类员工的平均得分是满分的 27.79。他们很可靠,很少损坏文件,并且能处理好大部分细节。然而,他们需要时间和金钱。平均而言,一项人类任务的成本约为 6.86 美元,耗时 2.32 小时。
AI 智能体:
AI 模型则是另一番景象。它们速度极快,而且极其便宜。
- 速度: 最快的 AI(DeepSeek-V4-Pro)完成一项任务仅需 0.184 小时(约 11 分钟)。
- 成本: 最便宜的 AI(Qwen3.7-Plus)每项任务的成本仅为 0.2152 美元。这甚至比一杯咖啡还要便宜!
但问题在于:它们做得并不够好。
表现最好的 AI 模型(GLM-5.2)得分仅为 17.91。这明显低于人类的 27.79 分。虽然 AI 更快、更便宜,但它犯错更多。它经常忘记添加目录,弄乱格式,或者生成一个无法打开的文件。
研究人员发现,AI 在处理最难、最长的任务时表现最差。当一项任务需要人类工作很长时间(超过 2 小时)时,AI 的性能下降得更加厉害。看来,虽然 AI 擅长快速、简单的任务,但当涉及到复杂的“长程”(long-horizon)规划时,它们就会迷失方向。
结论:尚未准备好进入主流阶段(目前而言)
这项研究表明,我们正处于 AI 办公工作的“谷底”。这项技术无疑是有用的,因为它既便宜又快速。如果你只需要一个草稿或一个快速摘要,AI 是一个极好的工具。但如果你需要一份可以直接发给客户的、精美且专业的文档,AI 目前还达不到要求。
作者明确排除了“AI 已经解决了办公工作”的观点。他们证明了虽然 AI “显著更便宜且更快”,但其“交付质量尚未接近人类水平”。在最终产品的质量方面,人类员工与 AI 智能体之间的差距依然巨大。
然而,论文对未来持乐观态度。通过创建这个带有真实经济数据的严谨测试,研究人员建立了一份路线图。他们准确知道 AI 在哪里失败(长任务、复杂格式),现在可以针对这些具体问题进行改进。目前来看,最好的策略似乎是合作:让 AI 处理繁重的工作和快速的草稿,但保留人类在环节中进行检查,以修正错误。实现“氛围办公”(vibe working)——即 AI 直接处理整个工作——的梦想仍处于进行时,但旅程已经正式开启。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。