← 最新论文
💬 NLP

SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards

本文提出了 SELAUR 框架,通过将熵、最低置信度和边界等不确定性指标融入奖励设计,使大语言模型代理能够利用内在不确定性信号进行自我进化,从而在 ALFWorld 和 WebShop 等基准测试中显著提升探索效率与任务成功率。

原作者: Dengjia Zhang, Xiaoou Liu, Lu Cheng, Yaqing Wang, Kenton Murray, Hua Wei

发布于 2026-02-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Dengjia Zhang, Xiaoou Liu, Lu Cheng, Yaqing Wang, Kenton Murray, Hua Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 SELAUR 的新方法,旨在让大型语言模型(LLM)变得更聪明、更擅长做复杂的“多步骤”任务(比如在网上购物、或者在虚拟房间里找东西)。

为了让你轻松理解,我们可以把训练一个 AI 代理(Agent)想象成教一个刚学开车的新手司机

1. 以前的做法:只看结果,不管过程

在传统的训练方法中,教练(奖励机制)只会在最后看结果:

  • 如果新手把车开到了目的地:教练大喊“太棒了!给你 100 分!”
  • 如果新手撞车了或者迷路了:教练直接说“不及格,0 分,重来。”

问题出在哪?
如果新手在开车过程中,明明知道前面有个大坑,但他还是犹豫着开过去了,最后撞车了。传统的教练只给 0 分,新手根本不知道具体是哪一步犹豫了,也不知道为什么会犹豫。他下次可能还会在同一个地方犹豫,或者因为害怕犯错而不敢尝试任何新路线。

2. SELAUR 的核心理念:关注“犹豫”和“不确定”

SELAUR 的作者认为,AI 在做出每一个决定时,内心其实都有一个**“不确定感”**(Uncertainty)。

  • 高不确定感 = 司机心里在想:“哎呀,前面是红灯还是绿灯?我该左转还是右转?我不太确定。”(这时候需要探索,多试几种方法)。
  • 低不确定感 = 司机心里很笃定:“这肯定是绿灯,直接冲!”(这时候需要奖励这种自信)。

SELAUR 就像一位超级耐心的教练,他不仅看结果,还时刻盯着司机的“心跳”(不确定感)。

3. SELAUR 是怎么工作的?(三个步骤)

第一步:给“犹豫”打分(不确定性估计)

教练会计算司机在每个动作时的“犹豫程度”。论文里用了三种方法来算这个分数:

  • 熵(Entropy):看司机脑子里的想法是不是太乱了(像是一团浆糊)。
  • 最低置信度(Least Confidence):看司机选的那个动作,他自己有多大的把握。
  • 差距(Margin):看司机选的动作和“第二好”的动作之间,差距大不大。如果差距很小,说明他很难抉择,犹豫感就强。

比喻:就像司机在路口,如果脑子里有 10 个想法在打架,犹豫感就很高;如果只有 1 个想法,犹豫感就很低。

第二步:把“犹豫”变成“路标”(聚合)

教练把这些零碎的“犹豫感”汇总起来:

  • 每一步的犹豫:刚才那个路口犹豫了吗?
  • 整条路的犹豫:这一趟下来,是不是大部分时间都很迷茫?

第三步:失败也能变宝藏(失败感知奖励重塑)

这是 SELAUR 最厉害的地方!

  • 如果任务成功了:照常给奖励,鼓励这种自信的行为。
  • 如果任务失败了:传统的教练直接给 0 分。但 SELAUR 会说:“虽然你撞车了,但我发现你在第 3 步犹豫了很久(高不确定感),这说明你当时其实察觉到了危险,只是没处理好。这个‘犹豫’本身是有价值的!"

于是,教练会根据你“犹豫”的程度,给你发一个**“安慰奖”或“探索奖”**。

  • 目的:告诉 AI,“不要害怕犯错,只要你在这个过程中表现出‘我在思考’、‘我在探索’,即使最后没做成,我也给你反馈,让你知道哪里需要改进。”

4. 为什么这很重要?(实际效果)

想象一下,如果你教一个 AI 去网上买一件特定的衣服(WebShop 任务):

  • 普通 AI:如果第一次买错了,它可能直接放弃,或者下次还在同一个错误的链接上死磕,因为它不知道哪里错了。
  • SELAUR 训练的 AI
    • 当它在一个错误的商品页面犹豫时,系统会标记:“这里你的不确定感很高,说明这个选择可能不对。”
    • 即使最后没买对,它也能从这次“失败的犹豫”中学到:“哦,原来在这个页面停留太久是不对的,下次我要早点跳出来。”
    • 它敢于尝试更多不同的搜索词,因为它知道,即使走弯路,只要带着“思考”去走,也能学到东西。

总结

SELAUR 就像是一个懂得心理学的教练。它不再只盯着“成功”或“失败”的终点,而是关注 AI 在路上的每一个心理活动

它告诉 AI:

“不要怕犯错,也不要盲目自信。当你感到‘不确定’时,那是你正在探索新知识的信号。即使最后失败了,只要你在这个过程中表现出了‘思考’,我就给你奖励,帮你把‘失败’变成‘经验’。”

通过这种方法,AI 在复杂的任务中(如 ALFWorld 和 WebShop 测试)表现得更加稳健,成功率更高,而且不容易陷入死胡同。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →