← 最新论文
💬 NLP

TodoEvolve: Learning to Architect Agent Planning Systems

本文提出了 TodoEvolve,一种通过 PlanFactory 模块化设计空间和基于阻抗引导偏好优化(IGPO)的训练方法,能够自主合成并动态调整任务特定规划架构的元规划范式,在提升智能体处理复杂任务能力的同时,实现了比人工设计方案更高的性能与效率。

原作者: Jiaxi Liu, Yanzuo Jiang, Guibin Zhang, Zihan Zhang, Heng Chang, Zhenfei Yin, Qibing Ren, Junchi Yan

发布于 2026-02-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaxi Liu, Yanzuo Jiang, Guibin Zhang, Zihan Zhang, Heng Chang, Zhenfei Yin, Qibing Ren, Junchi Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 现状:只会“照本宣科”的笨厨师

现在的 AI 智能体在处理复杂任务时,通常是靠人类预先写好的“剧本”(固定流程)。

  • 比喻: 就像一个厨师,无论客人点的是“简单的白灼青菜”还是“复杂的满汉全席”,他都必须按照同一套流程:洗菜 \rightarrow 切菜 \rightarrow 开火 \rightarrow 装盘。
  • 问题: 做青菜时,这套流程太慢、太浪费资源;做满汉全席时,这套流程又太简单,根本应付不了复杂的火候和配菜顺序。这就是论文里说的“缺乏灵活性”和“结构单一”。

2. TodoEvolve 的核心:自带“设计图”的超级大脑

TodoEvolve 不再给 AI 一个固定的剧本,而是给了它一个**“设计工具箱” (PlanFactory)** 和一个**“架构师大脑” (Todo-14B)**。

这个“设计工具箱”里有四种核心零件:

  1. 拓扑结构 (Topology): 决定办事流程的长相。是像排队一样的“直线型”?还是像树枝一样的“分叉型”?或者是像蜘蛛网一样的“复杂网状型”?
  2. 初始化 (Initialization): 决定第一步怎么起步。
  3. 自适应 (Adaptation): 决定什么时候发现“不对劲”需要改计划。
  4. 导航 (Navigation): 决定下一步具体该指挥谁去干活。

现在的 AI 进化成了这样:
当任务来临时,AI 架构师先看一眼任务:“哦,这是一个简单的查天气任务,我直接用**‘直线型’流程就行了,省时省力。”;如果是“帮我写一个复杂的软件工程”,它会立刻想:“这个得用‘网状并行型’**流程,好几个模块得同时开工,还得随时根据报错改计划。”

3. 它是怎么练成的?(IGPO 训练法)

论文提到了一种很厉害的训练方法叫 IGPO(阻抗引导的偏好优化)

  • 比喻: 想象你在教一个学徒设计流程。如果学徒设计的流程虽然能把菜做出来,但用了 10 个锅、烧了 3 小时火(效率极低),你不会夸他。
  • 训练逻辑:
    • 第一步(SFT): 先教它正确的语法,让它学会怎么写“设计图”。
    • 第二步(IGPO): 重点来了!如果两个方案都能完成任务,系统会通过一个叫**“认知阻抗” (Cognitive Impedance)** 的指标来打分。这个指标就像一个“性价比探测器”,专门惩罚那些“绕弯路”、“浪费 Token(精力)”或“流程冗余”的设计。
    • 结果: AI 学会了不仅要“做成”,还要“优雅、快速、省钱地做成”。

4. 总结:它强在哪里?

通过实验证明,TodoEvolve 带来的变化是革命性的:

  • 更聪明: 在处理极其复杂的任务(如 GAIA 测试集)时,表现远超那些死板的传统模型。
  • 更全能: 不管你用的是哪种底座模型(比如 GPT 或 DeepSeek),它都能像“外挂”一样给它们装上强大的架构设计能力。
  • 更高效: 它不会为了解决简单问题而大动干戈,也不会为了复杂问题而束手束脚。

一句话总结:
TodoEvolve 让 AI 从一个“只会按指令行事的打工人”,变成了一个“能根据问题复杂程度,自动设计最优工作方案的超级项目经理”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →