← 最新论文
🤖 AI

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

本文提出了 SkillC,这是一个通过引入对比式技能归因,利用配对 rollout 和自适应课程学习直接优化策略以实现无技能依赖的成功,从而增强大语言模型智能体自主技能内化的框架,该方法在无需运行时访问技能的情况下,在长视野任务上超越了现有基线。

原作者: Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个非常聪明的机器人去解决复杂的谜题,比如整理凌乱的房间或在线购买特定物品。为了帮助机器人更快地学习,你给它一张“小抄”(即一项技能),告诉它确切该采取哪些步骤。

训练机器人主要有两种方法:

  1. “永久小抄”法:你让机器人永远保留这张小抄。它学会了如何解谜,但从未学会在没有纸的情况下完成。一旦你拿走这张纸,它就会失败。
  2. “戒除”法:你起初给机器人小抄,但随后逐渐将其撤走。目标是让机器人最终能够完全独立地解决谜题。

问题:“内化盲区”
该论文指出,当前的“戒除”方法存在一个重大缺陷,作者称之为内化盲区

想象一位老师正在批改学生的试卷。

  • 在旧方法中,老师看到学生使用小抄的试卷得了 A,然后看到学生没有使用小抄的试卷得了 B。
  • 老师说:“A 考得真棒!”并给学生打高分。
  • 缺陷:老师没有意识到,这个"A"之所以可能,仅仅因为有小抄。老师继续奖励学生使用小抄,尽管目标本是让学生在不依赖小抄的情况下掌握知识。机器人会感到困惑:“我成功是因为我聪明,还是因为有人帮忙?”它分不清这两者的区别,因此从未真正学会独立。

解决方案:SKILLC(“并肩”教练)
作者提出了一种名为SKILLC的新框架来解决这个问题。他们使用了一种称为对比式技能信用分配的技术。

其工作原理如下,通过一个简单的类比来说明:

1. “并肩”赛跑(配对 rollout)

SKILLC 不再只是观察机器人一次在帮助下尝试、一次在无帮助下尝试,而是让机器人在每个任务中同时运行两场比赛

  • 比赛 A:机器人带着小抄尝试解谜。
  • 比赛 B:机器人不带小抄尝试解决完全相同的谜题。

2. “公正裁判”(双流优势)

现在,老师(即学习算法)会并排审视这两场比赛。

  • 如果机器人在比赛 A(有辅助)中获胜,但在比赛 B(无辅助)中失败,老师会意识到:“啊,机器人之所以成功仅仅是因为有小抄。我还不应该完全将其归功于它的智能。”
  • 如果机器人两场都赢了,老师会说:“太棒了!你在没有帮助的情况下解决了问题。这才是真正的技能!”

该系统会特别更多地奖励机器人在比赛 B(独立获胜)中的胜利,而如果它在比赛 B 中失败,则减少对比赛 A 获胜的奖励。这迫使机器人认识到,唯一真正重要的是独立解决问题。

3. “智能教练”(自适应课程)

该系统还像一位实时观察机器人进展的智能教练。

  • 早期:机器人没有小抄时表现很差。教练说:“继续使用小抄,但我们试着稍微减少一点依赖。”
  • 中期:机器人开始进步。教练注意到“有辅助”和“无辅助”之间的差距正在缩小。教练开始更快地撤走小抄。
  • 后期:机器人独自表现优异。教练说:“你不再需要小抄了。让我们彻底将其退役,并停止针对此特定任务的训练。”

为什么这很重要

该论文在两个环境中测试了这种方法:

  1. ALFWorld:一个基于文本的游戏,智能体需要完成家务(例如“把干净衬衫放进抽屉”)。
  2. WebShop:一个模拟的在线购物任务,智能体需要查找并购买特定物品。

结果:

  • SKILLC 最终学会了在没有任何小抄的情况下解决这些任务。
  • 其表现显著优于之前的“戒除”方法(成功率提高了约 4-5%)。
  • 它的表现甚至与那些永久保留小抄的方法相当,证明了机器人确实能够内化这些技能。

局限性(注意事项)

论文承认这种方法并不完美:

  • 成本高昂:同时运行两场比赛(有辅助和无辅助)在初期大约需要多消耗 26% 的计算机算力。
  • 需要高质量数据:如果机器人已经非常擅长某项任务,或者任务非常罕见,系统可能会在何时停止使用小抄的问题上产生混淆。

总结:
SKILLC 是一种训练 AI 智能体的新方法。它不是简单地缓慢移除辅助,而是不断比较“有辅助”的尝试与“无辅助”的尝试。通过特别奖励智能体在无辅助情况下的成功,它迫使 AI 真正内化技能,将“小抄使用者”转变为“自给自足的专家”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →