Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents
本文介绍了 Harness-IF,这是一个通过使用一种称为“对抗先验准确率”(Against-Prior Accuracy, AP-Acc)的新指标来区分真正的合规性与巧合性,从而在不同层面评估编码智能体真实指令遵循能力的全新基准测试,它揭示了现有基准测试高估了性能表现,并且规则优先级并不严格遵循提示词深度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人厨师烹饪一道复杂的菜肴。你不会只在最后大喊一声“做意面!”。相反,你有一整套指令:墙上的规则手册(系统提示词)、食谱卡上的笔记(项目文件)、关于刀具如何工作的说明(工具描述),以及最后你对厨师的具体要求(用户指令)。长期以来,测试这些 AI 厨师的科学家们只关心一件事:厨师有没有把意面端上来?如果盘子看起来很漂亮,他们就会给一颗金星。但他们从未检查过厨师到底听从了哪些指令。也许厨师忽略了关于“不加蒜”的规则手册,因为他们恰好本身就喜欢不加蒜的意面。这就是我们正在探索的人工智能中一个棘手的角落:指令遵循(Instruction Following)。这不仅仅是关于得到正确答案,而是关于证明机器人确实遵守了你给出的特定规则,即使这些规则与机器人的自然本能相悖。
这篇题为《Harness-IF》的论文就像是一家专门针对 AI 厨师的侦探社。研究人员意识到,现有的测试太简单了,因为它们只关注最终的成品。他们想知道机器人是真的在遵守规则,还是仅仅运气好。因此,他们构建了一个全新的、极其详尽的测试,称为 Harness-IF。他们不再只是问“你做意面了吗?”,而是设置了 60 个真实的编程场景,在这些场景中,AI 必须遵循 256 条不同的微小规则。这些规则隐藏在机器人的“大脑”不同位置——有些在系统提示词中,有些在项目文件中,有些在工具描述中,还有些在用户的直接对话中。
这里有研究人员发现的大惊喜:对于那些符合其原有习惯的规则,AI 模型的遵循能力要强得多;而对于违背其自然习惯的规则,表现则较差。 研究人员称之为“违背先验(Against-Prior)”测试。他们发现,当一条规则迫使 AI 做一些与其默认行为不同的事情时,AI 的成功率会显著下降。平均而言,模型在遵循违背其本性的规则时,表现要差 5.8 个百分点。这就像一个学生,因为热爱数学而在数学考试中拿了 A,但当老师要求用一种他讨厌的方法解题时,他却只拿了 C。论文指出,如果我们只看最终成绩(任务成功率),我们就是在误导自己,以为这个学生是数学天才,而实际上他可能只是在靠天赋“混分”。
这项研究还观察了规则放置的位置。你可能会认为最后说出的规则(用户指令)是最重要的,就像会议中最后发言的人通常能决定结果一样。但数据展示了不同的情况。存在于系统提示词、项目文件和用户指令中的规则在重要性上并列第一,而埋藏在工具描述或技能描述中的规则则经常被忽略。事实证明,AI 对“大局观”规则的关注度高于对特定工具如何运作的琐碎细节的关注。
简而言之,这篇论文并不声称已经解决了让 AI 变得完美的难题,而是为我们提供了一把更好的尺子,来衡量 AI 究竟有多听话。它表明,目前的 AI 模型擅长做它们想做的事,但当要求它们做一些它们本能不会选择的事情时,它们仍然感到吃力。通过将“幸运的顺从”与“真正的服从”区分开来,研究人员希望我们能够构建更好的测试,使我们的 AI 助手不仅看起来很成功,而且更加可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。