SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment
本文提出了 SkillC,这是一个通过引入对比式技能归因,利用配对 rollout 和自适应课程学习直接优化策略以实现无技能依赖的成功,从而增强大语言模型智能体自主技能内化的框架,该方法在无需运行时访问技能的情况下,在长视野任务上超越了现有基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一个非常聪明的机器人去解决复杂的谜题,比如整理凌乱的房间或在线购买特定物品。为了帮助机器人更快地学习,你给它一张“小抄”(即一项技能),告诉它确切该采取哪些步骤。
训练机器人主要有两种方法:
- “永久小抄”法:你让机器人永远保留这张小抄。它学会了如何解谜,但从未学会在没有纸的情况下完成。一旦你拿走这张纸,它就会失败。
- “戒除”法:你起初给机器人小抄,但随后逐渐将其撤走。目标是让机器人最终能够完全独立地解决谜题。
问题:“内化盲区”
该论文指出,当前的“戒除”方法存在一个重大缺陷,作者称之为内化盲区。
想象一位老师正在批改学生的试卷。
- 在旧方法中,老师看到学生使用小抄的试卷得了 A,然后看到学生没有使用小抄的试卷得了 B。
- 老师说:“A 考得真棒!”并给学生打高分。
- 缺陷:老师没有意识到,这个"A"之所以可能,仅仅因为有小抄。老师继续奖励学生使用小抄,尽管目标本是让学生在不依赖小抄的情况下掌握知识。机器人会感到困惑:“我成功是因为我聪明,还是因为有人帮忙?”它分不清这两者的区别,因此从未真正学会独立。
解决方案:SKILLC(“并肩”教练)
作者提出了一种名为SKILLC的新框架来解决这个问题。他们使用了一种称为对比式技能信用分配的技术。
其工作原理如下,通过一个简单的类比来说明:
1. “并肩”赛跑(配对 rollout)
SKILLC 不再只是观察机器人一次在帮助下尝试、一次在无帮助下尝试,而是让机器人在每个任务中同时运行两场比赛:
- 比赛 A:机器人带着小抄尝试解谜。
- 比赛 B:机器人不带小抄尝试解决完全相同的谜题。
2. “公正裁判”(双流优势)
现在,老师(即学习算法)会并排审视这两场比赛。
- 如果机器人在比赛 A(有辅助)中获胜,但在比赛 B(无辅助)中失败,老师会意识到:“啊,机器人之所以成功仅仅是因为有小抄。我还不应该完全将其归功于它的智能。”
- 如果机器人两场都赢了,老师会说:“太棒了!你在没有帮助的情况下解决了问题。这才是真正的技能!”
该系统会特别更多地奖励机器人在比赛 B(独立获胜)中的胜利,而如果它在比赛 B 中失败,则减少对比赛 A 获胜的奖励。这迫使机器人认识到,唯一真正重要的是独立解决问题。
3. “智能教练”(自适应课程)
该系统还像一位实时观察机器人进展的智能教练。
- 早期:机器人没有小抄时表现很差。教练说:“继续使用小抄,但我们试着稍微减少一点依赖。”
- 中期:机器人开始进步。教练注意到“有辅助”和“无辅助”之间的差距正在缩小。教练开始更快地撤走小抄。
- 后期:机器人独自表现优异。教练说:“你不再需要小抄了。让我们彻底将其退役,并停止针对此特定任务的训练。”
为什么这很重要
该论文在两个环境中测试了这种方法:
- ALFWorld:一个基于文本的游戏,智能体需要完成家务(例如“把干净衬衫放进抽屉”)。
- WebShop:一个模拟的在线购物任务,智能体需要查找并购买特定物品。
结果:
- SKILLC 最终学会了在没有任何小抄的情况下解决这些任务。
- 其表现显著优于之前的“戒除”方法(成功率提高了约 4-5%)。
- 它的表现甚至与那些永久保留小抄的方法相当,证明了机器人确实能够内化这些技能。
局限性(注意事项)
论文承认这种方法并不完美:
- 成本高昂:同时运行两场比赛(有辅助和无辅助)在初期大约需要多消耗 26% 的计算机算力。
- 需要高质量数据:如果机器人已经非常擅长某项任务,或者任务非常罕见,系统可能会在何时停止使用小抄的问题上产生混淆。
总结:
SKILLC 是一种训练 AI 智能体的新方法。它不是简单地缓慢移除辅助,而是不断比较“有辅助”的尝试与“无辅助”的尝试。通过特别奖励智能体在无辅助情况下的成功,它迫使 AI 真正内化技能,将“小抄使用者”转变为“自给自足的专家”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。