← 最新论文
💻 computer science

Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks

该论文提出了名为 COSPLAY 的协同进化框架,通过让大语言模型决策智能体从可学习的技能库中检索技能,同时由另一智能体从无标签数据中持续发现并更新技能,从而显著提升了智能体在长程交互环境(如游戏)中的多步推理与决策能力。

原作者: Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 COS-PLAY 的新系统,它的核心思想是教人工智能(AI)像人类一样“边玩边学,越玩越精”,特别是在那些需要长时间策略规划的游戏(比如《大富翁》、《文明》或复杂的电子游戏)中。

为了让你更容易理解,我们可以把这篇论文的核心内容想象成**“一个天才棋手和他的私人教练团队”**的故事。

1. 核心问题:为什么现在的 AI 玩游戏容易“翻车”?

想象一下,你让一个刚出生的婴儿(目前的普通大语言模型 AI)去下围棋或玩《文明》。

  • 它的弱点:它很聪明,能看懂规则,也能走一步算一步。但是,一旦游戏变长,它就容易**“失忆”**。它记不住刚才走了什么,也记不住之前成功的套路。
  • 后果:它就像是一个没有经验的实习生,每走一步都要重新思考“我现在该干嘛?”,结果往往是顾此失彼,在长局中因为缺乏连贯的策略而输掉。

2. 解决方案:COS-PLAY 的“双核”架构

COS-PLAY 没有试图把 AI 变得更“全知全能”,而是给它配了两个角色,让它们互相配合、共同进化:

角色 A:决策者(The Player)—— 场上的棋手

  • 它的任务:负责在游戏里实际操作,下棋、移动、攻击。
  • 它的秘密武器:它手里拿着一本**“技能秘籍”(Skill Bank)**。
  • 怎么工作:当棋手遇到复杂局面时,它不会从头瞎想,而是翻开秘籍:“哦,现在是开局阶段,我应该用‘侦察’技能”;“哦,现在对手要进攻了,我应该用‘防守’技能”。
  • 比喻:就像一个老练的司机,遇到红灯就踩刹车,遇到弯道就减速。它不需要每次都重新发明“怎么开车”,而是直接调用大脑里存好的“开车技能”。

角色 B:技能管理员(The Coach)—— 场下的教练

  • 它的任务:它不直接玩游戏,而是观察棋手怎么玩的。
  • 怎么工作:
    1. 录像分析:教练看棋手刚才的几十步棋(无标签的试玩过程)。
    2. 提炼套路:教练发现:“哎,棋手刚才连续三步都在试探对手,这其实是一个‘侦察’技能!”
    3. 写进秘籍:教练把这个“侦察”技能写进“技能秘籍”里,并标注清楚:什么时候用、怎么用它、用了会有什么效果。
    4. 清理旧书:如果某个技能好久没用了,或者发现新招更好,教练就会把旧技能删掉或修改。

3. 它们是如何“共同进化”的?(Co-Evolution)

这是这篇论文最精彩的地方。它们不是各干各的,而是一个闭环:

  1. 棋手拿着当前的“技能秘籍”去玩游戏,玩得越来越好。
  2. 教练看着棋手玩出的新花样,发现:“哇,刚才那个新打法很厉害,我要把它变成一个新的技能加进秘籍里!”
  3. 秘籍更新了,棋手下次玩的时候,手里就有了更厉害的招数。
  4. 棋手用新招数玩出了更好的成绩,教练又从中发现了更高级的套路……

比喻:
这就好比一个健身团队。

  • 决策者是正在举铁的运动员。
  • 技能管理员是教练。
  • 运动员练得越狠,教练越能总结出更科学的“深蹲技巧”;教练把技巧写进训练手册,运动员照着练,肌肉长得更快,又能练出更难的技巧。两者互相促进,最后运动员变成了世界冠军。

4. 实验结果:小模型也能打败大模型

论文在 6 种不同的游戏里做了测试(包括单人解谜游戏如《2048》、《超级马里奥》,以及多人策略游戏如《外交》、《阿瓦隆》)。

  • 惊人的成绩:COS-PLAY 使用的只是一个中等大小的 AI 模型(80 亿参数,相当于一个普通的手机 App 大小),但它通过这种“技能库”机制,在单人游戏中比目前世界上最强大的 AI(如 GPT-5.4 等)平均强了 25% 以上。
  • 社交游戏表现:在需要勾心斗角、谈判的多人游戏里,它也能和那些超级大模型打得有来有回,甚至更好。
  • 关键点:它不需要像以前那样训练几百万次,只需要很少的几次“试错”和“总结”,就能迅速学会新游戏的玩法(少样本学习)。

5. 总结:为什么这很重要?

以前的 AI 像是**“过目不忘但不会举一反三的学生”,每次遇到新情况都要重新背公式。
COS-PLAY 让 AI 变成了
“善于总结经验的专家”**。它学会了把复杂的长任务拆解成一个个小的、可重复使用的“技能包”(比如:侦察、进攻、防守、谈判)。

一句话总结:
这篇论文告诉我们,让 AI 变强的关键,不在于把它造得更大、更笨重,而在于给它一个**“会自我更新的技能笔记本”,让它学会“把经验变成技能,再用技能去创造新经验”**。这就是通往更智能、更自主的 AI 的一条新道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →