← 最新论文
🤖 AI

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

本文介绍了 MIND-Skill,这是一个多智能体框架,它通过由文本损失(重构、结果和评分标准)优化的归纳 - 演绎循环,自动生成高质量、可复用的大语言模型技能,以确保在复杂任务上的鲁棒性和泛化能力。

原作者: Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢但略显笨拙的机器人助手。你通过向它展示一段你完美执行某项特定任务(例如“在 Venmo 上给朋友发送退款”)的视频,来教它如何完成该任务。机器人会观看视频,但它不会仅仅机械地复制你的每一个动作,而是尝试为自己编写一本规则手册,以便未来能够完成类似的任务。

问题在于,如果机器人编写了一本糟糕的规则手册,它可能会陷入困境。它可能会死记硬背那位特定朋友的名字(过于具体),或者编写出过于模糊、毫无用处的指令(过于抽象)。

MIND-Skill 是一个新系统,旨在帮助这些 AI 智能体自动编写完美、高质量的规则手册。它通过一种巧妙的“教师与学生”游戏来实现这一目标,从而确保规则确实有效。

以下是其工作原理的简化分解:

1. 两个角色:教师与学生

该系统使用两个协同工作的 AI 智能体:

  • 教师(归纳智能体): 该智能体观看一段成功执行任务的视频。它的任务是编写一本通用的规则手册(即“技能”),解释如何完成任务,而不提及具体的姓名或数字。
  • 学生(演绎智能体): 该智能体充当测试角色。它仅获得教师编写的规则手册和原始任务描述。它尝试仅凭这些说明从头开始执行任务。

2. “重构”测试

这是其中的魔法所在。系统不仅仅询问:“学生是否得到了正确的答案?”它问的是:“学生是否遵循了与原始视频相同的逻辑?”

  • 如果教师编写的规则手册说“点击红色按钮”,而原始视频显示点击的是蓝色按钮,学生就会失败。系统会捕捉到这一点。
  • 如果教师编写的规则手册过于模糊(例如,“做那件事”),学生就会感到困惑并失败。
  • 如果教师编写的规则手册过于具体(例如,“点击用户 #123 的按钮”),系统会意识到这对其他人行不通。

系统将学生的表现与原始视频进行比较。如果两者匹配,则规则手册是好的;如果不匹配,系统就知道规则手册存在缺陷。

3. 三张“成绩单”

为了确保规则手册完美无缺,系统在每次尝试后都会给教师三张具体的“成绩单”(称为“损失”):

  1. “你是否遵循了步骤?”卡片(重构损失): 学生是否遵循了与原始视频相同的策略?(例如,他们是否都先检查邮件,然后点击发送?)
  2. “你是否完成了工作?”卡片(结果损失): 学生是否在实际世界中成功完成了任务?
  3. “这是一本好手册吗?”卡片(评分标准损失): 规则手册是否编写得当?是否清晰?是否避免了复制不应存在的具体细节(如姓名或 ID)?这确保了规则手册是一个有用的工具,而不仅仅是对某个特定事件的复制粘贴。

4. 改进循环

该系统一遍又一遍地运行这个游戏。

  • 教师起草一份草案。
  • 学生尝试执行。
  • 系统利用三张成绩单对草案进行评分。
  • 系统确切地告诉教师哪里出了问题(例如,“你包含了一个具体的名字;请将其删除”,或者“你跳过了安全检查”)。
  • 教师根据此反馈重写规则手册。

这一过程自动进行,不断打磨规则手册,直到其完美无瑕。

这有何特别之处?

大多数以前的方法只是要求一个聪明的 AI“总结”一段视频来编写规则手册。但 AI 经常犯错——要么过于模糊,要么过于具体。

MIND-Skill 的不同之处在于它会立即测试规则手册。这就像一位厨师写完食谱后,立即将其交给副厨师去烹饪这道菜。如果副厨师把食物烧焦了或使用了错误的食材,厨师就知道食谱有问题,并在其他人尝试之前将其修正。

结果

该论文在两个困难的环境中对此进行了测试:

  1. AppWorld: 一个模拟使用真实应用程序(如发送资金、预订票务、管理文件)的环境。
  2. BFCL-v3: 一个测试正确调用计算机函数的基准。

结果表明,使用 MIND-Skill 规则手册的智能体,在解决新的、未见过的任务方面,比使用其他方法生成的规则手册的智能体表现要好得多。即使“教师”AI 并非可用的最智能模型,测试过程也使得最终生成的规则手册如此出色,以至于其表现与由最智能模型生成的手册一样好。

简而言之: MIND-Skill 将 AI 智能体转变为自我改进的教师,它们通过不断测试这些手册是否真正有效,来编写属于自己的完美操作指南。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →