← 最新论文
🤖 AI

From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents

本文介绍了 RADEG,一种轻量级、具备奖励感知能力的门控机制,通过预测检索到的技能包的执行效用,使 LLM 智能体在显著降低不必要的计算成本的同时,保持下游任务性能。

原作者: Liang He, Jingbo Wen, Hongyu Gu, Hao Li, Haoyu Wang, Yixiong Chen, Kangning Cui, Xilu Wang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Liang He, Jingbo Wen, Hongyu Gu, Hao Li, Haoyu Wang, Yixiong Chen, Kangning Cui, Xilu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位庞大且高科技管弦乐团的指挥,乐团里的每一位乐手都是超级智能的机器人。在人工智能的世界里,这些机器人被称为“LLM 智能体(LLM agents)”,它们正变得越来越擅长解决复杂的问题,比如规划一次旅行或修复一段损坏的代码。但为了完成这些工作,它们需要一个装满“技能”的工具箱——这些是预先写好的指令或代码片段,告诉它们如何使用特定工具,比如计算器或地图。

问题在于,这些工具箱正变得越来越庞大。如果你要求机器人“策划一场惊喜派对”,它可能会掏出上千种技能:有些关于烘焙,有些关于发送邀请函,还有些关于预算管理。机器人必须弄清楚该使用哪些技能。通常,它会使用一个“检索器(retriever)”,这好比是一个图书管理员,负责扫描图书馆并挑选出那些听起来最相关的技能。这就像你向图书管理员询问关于“太空”的书,而他们递给你一本关于“太空旅行”的书,因为这两个词匹配上了。

但问题就在这里:仅仅因为一本书听起来相关,并不意味着它对你的特定作业真的有用。有时候,图书管理员递给你的书看起来完美无缺,但当你翻开它时,发现页面是空白的,或者故事逻辑不通。在人工智能的世界里,检查一个技能是否真的有效是非常昂贵的。让机器人尝试使用那个技能需要耗费时间、金钱和计算能力。如果机器人尝试了一个糟糕的技能,它就会白白浪费所有的精力。所以,大问题在于:我们如何在投入所有这些时间和金钱之前,就知道一个技能是否真的值得一试?


这篇论文介绍了一个聪明的新型 AI 智能体“保镖”,叫做 RADEG(奖励感知动态执行门控)。把 RADEG 想象成一个站在图书管理员(检索器)和机器人(智能体)之间的聪明保安。

通常,流程是这样的:图书管理员挑选出一组技能,然后机器人立即尝试使用它们。如果技能很差,机器人就会浪费时间和金钱,最终导致失败。这篇论文的作者意识到,图书管理员非常擅长寻找那些“看起来”相关的物品,但却极不擅长预测这些东西是否真的“有用”。他们称之为“相关性–效用差距(relevance–utility gap)”。这就像图书管理员因为你提到了“蛋糕”,就递给你一本名为《如何烘焙蛋糕》的书,但那本书实际上是在讲“如何用砖块盖一座蛋糕形状的房子”。它与“蛋糕”这个词相关,但对你的目标来说毫无用处。

为了解决这个问题,研究人员构建了 RADEG。这个新层级并没有取代图书管理员或机器人;它只是站在中间并提出了一个简单的问题:“如果我们让机器人尝试这组特定的技能,它真的能得到好的结果吗?”

RADEG 是如何学会成为一名优秀的保镖的呢?研究人员使用了一个包含 72 个不同任务的数据集,并为每个任务创建了几个“假设场景”。他们对图书管理员挑选出的技能进行了微小的改动:移除一个技能、添加一个随机技能,或者用一个看起来相似的技能进行替换。然后,他们让机器人尝试了所有这些不同的版本。他们发现了一些令人惊讶的事实:仅仅改变一个技能,就能让一次彻底的失败变成成功,或者反之亦然。这证明了图书м管理员的“相关性评分”(即技能与文字的匹配程度)是预测机器人是否能真正成功的糟糕指标。

因此,RADEG 从这些试错运行中学习。它观察问题和技能组合,并在机器人开始工作之前,预测其“效用”(即成功的概率)。如果 RADEG 认为这组技能是在浪费时间,它就会说“跳过(Skip!)”,从而避免机器人做无用功。如果它认为这组技能看起来很有前景,它就会说“通过(Go!)”,让机器人继续执行。

结果非常令人印象深刻。在测试中,RADEG 成功跳过了大约 68% 的机器人尝试(节省了大量的成本和时间),同时仍保留了 61% 的总成功点数。这意味着他们将工作量减半,但依然获得了大部分的好结果。更棒的是,RADEG 是“动态的”。随着机器人尝试新事物并获得新反馈,RADEG 可以更新自己的规则,而无需从头开始重新训练。它就像一个从每个进门的人身上学习的保镖,每天都在变得更聪明,而不需要一份新的职位说明书。

该论文还表明,即使当机器人发生变化(例如从一种类型的 AI 大脑切换到另一种)或图书管理员使用不同的方式寻找技能时,RADEG 依然表现良好。它是一个灵活且轻量级的工具,不需要重建整个系统。

简而言之,作者发现,仅仅因为一个技能“看起来正确”,并不意味着它“真的有用”。通过增加一个能在机器人开始工作前预测成功的智能学习门控,我们可以节省大量的计算能力,同时还能完成任务。这是一种从询问“这看起来相关吗?”到询问“这真的有用吗?”的转变——这一小小的改变,可以让 AI 智能体的运行变得更快、更便宜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →