← 最新论文
💬 NLP

AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios

本文介绍了 AgentIF-OneDay,这是一个包含 104 个涵盖开放工作流执行、潜在指令推理和迭代优化的多样化日常任务的新型基准测试,旨在评估通用 AI 智能体遵循自然语言指令并产生切实的基于文件的结果的能力,研究揭示了目前基于 API 的智能体和经强化学习增强的智能体均处于领先地位。

原作者: Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Chen, Haotong Tian, Haoye Zhang, Haoyu Bian, Hongbing Pan, Hongkang Zhang, Hongyi Z
发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Chen, Haotong Tian, Haoye Zhang, Haoyu Bian, Hongbing Pan, Hongkang Zhang, Hongyi Zhou, Jiaqi Cai, Jiewu Rao, Jiyuan Ren, Keduan Huang, Lucia Zhu Huang, Mingyu Yuan, Naixu Guo, Qicheng Tang, Qinyan Zhang, Shuai Chen, Siheng Chen, Ting Ting Li, Xiaoxing Guo, Yaocheng Zuo, Yaoqi Guo, Yinan Wang, Yinzhou Yu, Yize Wang, Yuan Jiang, Yuan Tian, Yuanshuo Zhang, Yuxuan Liu, Yvette Yan Zeng, Zenyu Shan, Zihan Yin, Xiaobo Hu, Yang Liu, Yixin Ren, Yuan Gong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的通俗易懂版解释,通过类比使概念更加清晰。

大局观:AI 助手的“一天测试”

想象一下你雇佣了一位新的私人助理。你不仅仅想看他们能否回答一个常识问题或写一首诗,你更想看他们能否处理你完整的一天——从整理你的工作日程到规划一次家庭旅行,同时还要遵循你那些特定且有时甚至有些混乱的指令。

这篇论文介绍了 AgentIF-OneDay,这是一个全新的、专门为 AI 智能体(AI agents)设计的“期末考试”,旨在测试上述能力。它不再仅仅测试 AI 解决高难度编程谜题或进行深度科学研究的能力,而是问道:“这个 AI 真的能帮助一个普通人完成日常生活和工作吗?”


三种类型的“日常任务”

研究人员创建了 104 个不同的场景来测试 AI。他们将这些任务分为三类,就像你向助手寻求帮助的三种不同方式:

1. “遵循食谱”测试(开放式工作流执行)

  • 类比: 你给你的助手一个非常具体、分步骤的复杂菜肴食谱。你说:“首先,检查烤箱温度。然后,查看计时器。接着,混合这三种配料。不要跳过第 3 步。”
  • 测试内容: AI 能否在不产生困惑、不遗忘步骤或不凭空捏造的情况下,遵循一份冗长且详细的指令清单?它测试的是 AI 是否能坚持执行你给出的计划,即使这个计划很长且很复杂。

2. “读懂言外之意”测试(潜在指令推断)

  • 类比: 你递给你的助手一个旧文档文件夹,并说:“制作一份看起来和这些文件完全一样的报告。”你并没有写下规则(比如“使用蓝色标题”或“将日期放在右下角”)。你期望助手能够通过观察旧文档,自行领悟其中的隐藏风格规则,并将这些规则应用到新报告中。
  • 测试内容: AI 能否通过查看一个文件(如 PDF 或电子表格)来理解那些“未言明”的规则?这考察的是 AI 识别模式和捕捉你没有明确说出口的隐含约束的能力。

3. “编辑与改进”测试(迭代优化)

  • 类比: 你的助手起草了一份演示文稿。你看了之后说:“字体太小了,而且第二张幻灯片缺少一个图表。另外,把背景调浅一点。”你并不是要求他们从头开始做一份新的演示文稿,而是希望他们在保留原有优秀部分的同时,对现有的内容进行精准修改。
  • 测试内容: AI 能否记住它刚刚做了什么,理解你的反馈,并在不破坏其他部分的前提下进行精确修改?它测试的是 AI 对项目状态的“记忆”能力。

他们是如何评分的

研究人员并没有简单地询问“是否成功?”,而是使用了一套非常严格的评分标准(就像老师的答案解析)。

  • “裁判”: 他们使用了一个极其聪明的 AI(Gemini-3-Pro)来对结果进行评分,但同时也通过人工评判进行了核对,以确保公平性。他们发现 AI 裁判与人类裁判的一致性达到了 80%
  • 文件处理: 测试不仅仅局限于文本。AI 必须处理真实的各种文件——PDF、Excel 表格、图像和代码——就像人类一样。

他们的发现:结果

他们测试了目前市面上四种顶尖的 AI 智能体。以下是核心结论:

  1. “API 模式” vs. “专业化训练” 的争论:

    • 有些公司构建 AI 智能体的方式只是将强大的聊天机器人接入一系列工具(作为通用型选手)。
    • 另一些公司则通过专门针对执行任务进行的“大脑训练”(强化学习)来构建智能体。
    • 令人惊讶的是: 论文发现这两类表现几乎不相上下。“专门训练”并没有带来巨大的优势。看来,处理任务所需的“基础智能”现在已经内置在主流 AI 模型本身之中了。
  2. 胜出者:

    • Manus 在综合表现上排名第一。它在处理长流程、复杂工作流方面表现尤为出色。
    • Genspark 在遵循指令和处理负面约束(例如“不要做 X”)方面表现优异。
    • ChatGPT-Agent 在处理工作相关任务方面表现最好。
    • Minimax-Agent 速度最慢,思考时间较长,尽管它的逻辑能力不错。
  3. 弱点:

    • 对于所有 AI 来说,最难的部分是 “潜在指令推断”(读懂言外之意)。即使是最优秀的智能体,在没有被明确告知要寻找什么的情况下,也很难完美地从文件中推断出隐藏的规则。

总结

这篇论文认为,我们不应该只测试 AI 解谜的“聪明程度”,而应该测试它在现实生活中的“实用程度”。

好消息是,AI 智能体在处理日常生活中那些“枯燥”但必不可少的部分(如管理文件、遵循复杂工作流和编辑工作)方面正变得越来越出色。坏消息是,它们在“察言观色”或在没有更多帮助的情况下理解文档中的隐藏规则时,仍然会遇到困难。

AI 的未来不仅仅在于让模型变得更聪明,更在于构建更好的产品,帮助我们在特定且琐碎的日常生活中游刃有余。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →