← 最新论文
💻 computer science

CHILL-Harness: Counterfactual Harness Learning for Efficient Reasoning in Long-Horizon Agents

CHILL-Harness 是一种通过采用反事实因果学习来自适应地编排工作流,从而在保持或提高任务成功率的同时,显著降低计算开销和执行时间的创新框架,旨在解决静态智能体控制台在长程任务中的低效问题。

原作者: Jiarun Fu, Lizhong Ding, Sida Chen, Honglei Xin, Chunhui Zhang, Pengqi Li, Qiuning Wei, Ye Yuan, Guoren Wang

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarun Fu, Lizhong Ding, Sida Chen, Honglei Xin, Chunhui Zhang, Pengqi Li, Qiuning Wei, Ye Yuan, Guoren Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在试图穿越复杂且不断变化的星系以寻找隐藏宝藏的飞船舰长。在人工智能的世界里,这些飞船被称为“AI智能体(AI agents)”,而宝藏则可以是任何东西,比如解决一个棘手的数学难题或修复一个损坏的计算机程序。为了完成任务,这些智能体不仅仅需要思考,它们还需要一个“束缚器(harness)”。你可以把这个束缚器想象成飞船的自动驾驶仪和任务控制中心的结合体。它是那套无形的底层架构,告诉AI何时该查看地图、何时该寻求帮助、何时该复查工作,以及何时最终宣布:“我完成了。”

长期以来,这些自动驾驶仪一直有些僵化。它们遵循一套严格的、预先写好的规则手册:“如果你看到红灯,就停止;如果你看到蓝灯,就前进。”但现实世界任务的星系是混乱的。有时红灯意味着“停止”,但有时它仅仅意味着“稍等片刻”。僵硬的规则手册会让AI浪费燃料(计算能力)去过度思考简单的难题,或者更糟的是,因为规则手册没有涵盖特定的情况而忽略关键警告,导致飞船坠毁。科学家们现在正在询问:我们能否教会自动驾驶仪变得更聪明?它能否学会即时调整其规则,决定何时该谨慎、何时该快速,而不丢失宝藏?这就是名为 CHILL-Harness 的这项新研究背后的核心问题。

问题所在:过度思考者与思考不足者

来自北京理工大学的研究人员注意到,目前的AI智能体在工作方式上存在一种令人沮丧的模式。想象一下一个正在参加考试的学生。有些学生是“过度思考者”。他们会对一个简单的“2 + 2”问题花费十分钟,画出复杂的图表并撰写论文,只为了确保万无一失。他们虽然得到了正确答案,但却没时间做剩下的题目。另一些学生则是“思考不足者”。他们匆忙应考,跳过步骤,犯下低级错误,最终考试失败。

目前的AI束缚器往往就像这些学生。它们使用不随情况变化的固定策略。如果AI陷入困境,束缚器可能会强迫它持续思考,即使答案显而易见,也会浪费大量的能量(在AI领域被称为“Token/令牌”)。或者,如果AI表现良好,束缚器可能会强迫它继续运行,在不必要的检查上浪费时间。结果呢?AI要么过快地耗尽了预算,要么无法完成任务。

解决方案:“如果……会怎样”的教练

该论文的作者提出了一种名为 CHILL-Harness(反事实束缚器干预学习,Counterfactual Harness Intervention Learning)的新系统。为了理解它,让我们用另一个类比:一位正在观察比赛的体育教练。

一个糟糕的教练无论比赛发生什么都会喊出同样的指令:“跑快点!”或“传球!”而一位聪明的教练则会观察比赛并询问:“如果我们现在采取不同的行动,会发生什么?”这就是反事实推理(counterfactual reasoning)。这是一种想象不同路径并观察其是否会更好的能力。

CHILL-Harness 扮演的就是这位聪明教练的角色。它不是盲目地遵循规则手册,而是不断自问:“如果我现在改变计划,会对我们获胜有帮助,还是只会浪费时间?”它通过两个主要步骤来实现这一点:

  1. “如果……会怎样”计算器 (CIEL): 这部分系统观察当前情况,并估算改变计划的“优势”。它会问:“如果我们停下来多思考一会儿,或者尝试使用不同的工具,结果会有多好?”它通过过去的经验来学习,以预测哪些变化是值得付出代价的。
  2. “去/不去”守门员 (ARCO): 即使计算器说改变计划可能会有好处,守门员也会检查这种收益是否足以抵消风险。它有一条严格的规则:“除非改进是清晰且显著的,否则不要改变计划。”这可以防止AI被微小且无用的变化所迷惑。

至关重要的是,该系统拥有一个“安全网”。它被设定了一个“保全成功(success-preserving)”的目标。这意味着它非常害怕犯下毁掉整个任务的错误。如果系统不能百分之百确定改变计划不会破坏任务,它就会坚持原有的计划。它宁愿效率稍低,也不愿冒任务彻底失败的风险。

研究发现:更聪明、更快、更安全

团队在三种完全不同的“星系”(任务)上测试了 CHILL-Harness:

  • 信息寻求(Information Seeking): 在浩如烟海的数据中寻找特定事实(类似于寻宝游戏)。
  • 软件工程(Software Engineering): 修复计算机代码中的漏洞(类似于机械师修理汽车引擎)。
  • 终端交互(Terminal Interaction): 向计算机系统发出指令以完成复杂任务(类似于飞行员驾驶飞机)。

他们将新系统与其他顶尖的AI系统进行了对比。结果令人印象深刻。

  • 它没有丢失宝藏: 在每一次测试中,CHILL-Harness 完成任务的效果都与其它系统一样好,甚至更好。例如,在信息寻求测试中,它解决了 71.3% 的任务,击败了表现第二的系统(后者解决了 70.2%)。
  • 它节省了大量燃料: 这是该系统真正闪光的地方。通过仅在绝对必要时才改变计划,它节省了大量的计算能力。在信息寻求测试中,它比之前最高效的系统节省了 28.4% 的 Token(AI的燃料)。在软件修复测试中,它节省了 13.1% 的 Token。
  • 它更快: 因为它减少了在不必要思考上的时间浪费,所以完成任务的速度更快。在信息寻求测试中,它比基准系统快了 46.6%

“始终全量”的教训

为了证明他们的“聪明教练”确实在发挥作用,研究人员进行了一项特别实验。他们强迫系统无论如何都要进行深度思考和全面检查。他们称之为“始终全量(Always-Full)”模式。

结果是一场灾难。当系统被强迫过度思考时,它解决问题的能力反而下降了。在信息寻求测试中,成功率从 71.3% 骤降至 27.7%。同时,它也消耗了更多的燃料。这证明了 CHILL-Harness 成功的关键不在于“思考更多”,而在于准确知道何时思考以及何时停止。

总结

CHILL-Harness 表明,我们并不需要构建更大、更昂贵的 AI 大脑来获得更好的结果。相反,我们需要更好的“自动驾驶仪”来管理大脑的能量。通过使用“如果……会怎样”的方法来决定何时干预,并非常谨慎地不去破坏已经奏效的部分,该系统使 AI 智能体变得更加高效且可靠。这标志着从一个僵化的机器人向一个灵活、聪明的伙伴的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →