← 最新论文
🤖 AI

ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment

本文介绍了 ANDES,这是一个通过自我演进的“世界树”(World Tree)路由机制将数据生成转化为即插即用智能体技能的框架,旨在增强自主 AI 指令对齐,使较弱的智能体能够在严格的计算约束下实现最先进的性能。

原作者: Zhengyang Zhao, Shengjie Ye, Lu Ma, Hao Liang, Hengyi Feng, Wentao Zhang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengyang Zhao, Shengjie Ye, Lu Ma, Hao Liang, Hengyi Feng, Wentao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但缺乏经验的机器人助手如何变得更有用。你知道机器人需要通过例子(数据)来学习,但你不想亲自花好几年时间去手动编写这些例子。于是,你决定让另一个稍微聪明一点的机器人(“智能体”)来承担寻找和组织训练数据的任务。

问题在于,正如这篇论文的作者们所发现的,要求一个机器人去混乱的“开放互联网”中寻找好的例子,就像是派一个孩子去一座巨大的、嘈aw的图书馆里寻找特定的书。他们会被信息淹没,捡错书,或者陷入噪音之中。或者,如果你只是给他们一份静态的书单,当他们后来意识到自己缺少某种特定技能时,他们也无法进行调整。

迎来“Andes”:智能图书管理员技能

作者引入了一个名为 Andes(Agent Native Data Evolving Synthesis,智能体原生数据演化合成)的新工具。请记住,Andes 不仅仅是一个去外面搜索的机器人,它是一个你可以赋予你的训练机器人的超强力、即插即用的“图书管理员技能”

以下是 Andes 的工作原理,我们使用简单的比喻来解释:

1. “世界树”(无限地图)

想象一棵巨大的、活生生的地图,所有的主题都像家族树一样组织在一起。

  • 树干: 宽泛的主题(如“数学”或“编程”)。
  • 树枝: 特定的主题(如“代数”或“调试”)。
  • 叶子: 特定的场景(如“求解二次方程”或“修复一个损坏的循环”)。

通常,如果一个机器人尝试生成数据,它可能会反复选择同样的几片叶子,导致训练变得枯燥且重复。Andes 有一个特殊的机制叫做自我演化路由(Self-Evolving Routing)

  • 智能指南针: 当机器人需要学习“数学”时,Andes 不仅仅是随机挑选叶子。它使用一个指南针来找到数学领域中最相关的树枝。
  • 生长中的树: 如果机器人一直请求“代数”,Andes 会注意到那里的树木变得过于拥挤。它不会重复使用旧有的例子,而是会神奇地在原地长出新的树枝和叶子。它会发明新鲜、独特的场景,这样机器人就永远不会感到厌倦或陷入重复的死循环。

2. “两阶段厨房”(制作数据)

一旦 Andes 从树中挑选出了正确的“食材”(主题),它并不会直接把它们原样端上来。它会让这些食材经过一个两步走的厨房:

  • 第一阶段(厨师): 它创建一个问题和答案的草稿(就像一个粗略的食谱)。
  • 第二阶段(美食评论家): 第二个机器人会对这道菜进行品尝。它会检查:“这太简单了吗?逻辑断掉了吗?我们是不是连续做了50次同样的菜?”
    • 如果菜品很糟糕,它会被扔掉。
    • 如果菜品还可以但需要改进,厨师会进行修正。
    • 评论家还会为主要训练机器人写一份成绩单

3. “反馈循环”(对话)

这是最重要的部分。在旧系统中,机器人生成一次数据就会停止。而在 Andes 中,这是一个对话过程

  • 在评论家写完成绩单后,主要的训练机器人会阅读它。
  • 报告可能会说:“你生成了100道数学题,但它们全是关于加法的。你需要更多减法,而且这三个例子中的逻辑很薄弱。”
  • 训练机器人随后会说:“明白了!” 并调整它的下一个请求,以专注于减法并修复逻辑。
  • Andes 会倾听这个新请求,并生成下一批完美契合刚才发现的知识缺口的训练数据。

为什么这很重要?

研究人员在名为 PostTrainBench 的基准测试上测试了该工具,该测试衡量了机器人自我教学的能力。

  • 困境: 没有 Andes,即使是非常先进的机器人也会在寻找优质数据方面感到吃力,其表现往往比它们试图提升的原始模型还要差。它们要么迷失在噪音中,要么陷入循环。
  • 成功: 当研究人员将 Andes 技能 交给一个相对“较弱”的机器人时,它突然变成了一位大师级的老师。它在这一基准测试上取得了有史以来最好的结果,甚至击败了那些没有配备此特定工具的更强大的机器人。

总结:
Andes 通过提供一个动态的、自我更新的图书馆和一个智能反馈循环,解决了“我们如何教机器人如何教它自己”的问题。它不再强迫机器人漫无目的地在互联网中游荡,而是作为一个专门的工具,能够立即生成高质量、多样化且完美针对性的训练实例,同时根据机器人的进度不断修正自身的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →