← 最新论文
🤖 AI

Knowledge-Centric Agents for Workflow Generation

本文提出了一种以知识为核心的框架,该框架通过学习从真实世界案例中进行层级知识的反转、注入与推理,增强了视觉创作系统中的工作流生成能力,从而实现了比现有的直接文本到 JSON 方法更优越的结构连贯性和执行成功率。

原作者: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用乐高积木搭建一台复杂的机器,但你不是用双手将它们拼在一起,而是必须仅用文字向机器人描述整个蓝图。这就是 ComfyUI 的世界,这是一个流行的用于利用人工智能生成图像的工具。在这个系统中,创作过程中的每一步——比如改变颜色、锐化面部或放大图像——都是一个独立的“模块”或“节点”。为了获得理想的结果,你必须按照非常特定的顺序连接数百个这样的模块,就像一个巨大且复杂的电路板。如果你连错了两个模块,或者忘记插上电源线(参数),整台机器就会发出咔哒声并停止工作。

长期以来,人们一直尝试使用大语言模型(LLMs)——即那些能够写故事或回答问题的智能 AI——来自动构建这些蓝图。这个想法很简单:告诉 AI,“给我做一个蒸汽朋克飞艇的图片”,然后让它吐出完美的乐高说明书。但问题在于:这些 AI 模型擅长写句子,但在构建复杂结构方面表现得很糟糕。它们经常忘记模块是如何连接的,混淆指令,或者创建出那些在纸面上看起来很完美、但在实际构建时却会崩溃的蓝图。它们缺乏人类专家那种知道“为什么要将模块 A 连接到模块 B”,而不仅仅是知道“应该将 A 连接到 B”的经验。

这引出了由 Zhendong Li 及其团队发表的一篇新论文,他们提出了一种巧妙的新方法,教 AI 成为一名大师级构建师。他们并没有仅仅要求 AI 去猜测最终的蓝图,而是教它像人类专家设计师一样思考。他们称之为“以知识为中心”(Knowledge-Centric)的方法。可以这样理解:如果你想教一个学生如何烤出一个完美的蛋糕,你不能只展示成品蛋糕并说,“模仿这个”。你要教他们策略(为什么先搅拌鸡蛋)、骨架(没有具体测量值的步骤列表)以及最后的食谱(面粉的具体克数)。

作者发现,现有的 AI 方法之所以失败,是因为它们试图直接从用户的请求跳跃到最终混乱的代码。为了解决这个问题,他们发明了一个被称为“知识反转、注入与推理”的三步流程。

首先,他们将数千个由人类创建的真实、可运行的蓝图通过一个“逆向工程”过程进行处理。他们剥离了杂乱的细节,以寻找隐藏的模式。这就像拆解一千辆不同的汽车,以弄清楚发动机运作的一般规则,而不是仅仅记住某一台特定汽车的形状。他们将这些蓝图提炼为三个层次:

  1. 高层策略:宏观计划(例如:“我们需要先修复面部,然后再改变风格”)。
  2. 骨架伪代码:步骤的粗略轮廓,不包含具体数值。
  3. 完整伪代码:准备好进行构建的完整、详细的指令。

接下来,他们将这些提炼后的知识“注入”到 AI 模型中。他们不仅仅是喂给它数据;他们教会了模型通过这些层次进行推理。他们向模型展示:“这是一个任务,这是专家会使用的策略,以及该策略如何转化为一个骨架。”这就像是给学生一本解释烹饪逻辑,而不仅仅是提供食谱的书。

最后,当用户请求一张新图像时,AI 不会仅仅靠猜测。它通过学习到的层次进行“推理”来得出解决方案。它首先确定高层策略,然后构建骨架,最后填充具体细节。论文还包含了一个“自我完善”步骤,即 AI 在最终确定计划之前会检查自己的工作,询问:“我正确连接这些模块了吗?”

结果令人印象深刻。团队在一个包含 900 多个真实任务的数据集上,将该方法与其他 AI 工具进行了对比测试。其他方法能创建成功蓝图的次数不到一半,而这种新的“以知识为中心”的智能体在 86.9% 的案例中取得了成功。在构建复杂、多样化结构方面,该方法在多样性量表上得分为 152,而次优方法仅达到 42。即使在面对从未见过的全新、困难的任务时,它依然能以 66.7% 的成功率胜出,远超竞争对手。

作者指出,通过教 AI 理解工作的“结构”和“推理”,而不仅仅是记忆模式,我们可以创造出更可靠的智能体。他们承认,当被要求使用训练数据中未出现的非常罕见、不寻常的模块时,系统仍会遇到一些困难,但总体而言,他们已经证明了赋予 AI 一个关于专家如何思考的“心理模型”是构建更好、更复杂创意工具的关键。这是一种从要求机器人“猜答案”到教它“如何思考”的转变,将一个脆弱、易错的过程变成了一门稳健、专家级的工艺。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →