← 最新论文
🤖 AI

Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents

本文介绍了协作智能体推理工程(CARE),这是一种系统化、分阶段门控的方法论,它利用领域专家、开发者和大型语言模型辅助智能体三方协作的工作流,将非正式领域意图转化为严谨、可验证的规范,以在科学领域构建可靠的智能体。

原作者: Rahul Ramachandran, Nidhi Jha, Muthukumaran Ramasubramanian

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Rahul Ramachandran, Nidhi Jha, Muthukumaran Ramasubramanian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试构建一个高度熟练的机器人助手,以帮助科学家在庞大的图书馆中查找特定数据。过去,人们试图通过直接与这些机器人对话、猜测该说什么并寄希望于最佳结果来训练它们。这就像试图通过向狗大喊随机词汇来教它进行复杂的数学运算;有时或许能奏效,但大多数情况下都是一场充满试错的混乱。

本文介绍了CARE(协作代理推理工程),这是一种构建此类 AI 助手的崭新且严谨的方法。CARE 不再依赖猜测,而是将构建 AI 视为建造桥梁:你需要严格的蓝图、专家团队以及分步检查流程。

以下是 CARE 的工作原理,分解为简单的概念:

三方团队

CARE 不仅仅是人与计算机的对话,而是三方之间的对话:

  1. 领域专家(SMEs): 了解游戏规则(例如“我们只信任 2020 年的数据”或“切勿猜测答案”)的科学家。
  2. 开发人员: 懂得如何构建机器人的工程师。
  3. “辅助代理”: 这些是特殊的 AI 助手,其唯一职责是帮助人类彼此沟通。可以将它们视为超级高效的书记员翻译。它们倾听科学家的意见,提出澄清性问题,并将规则以清晰、结构化的格式记录下来,以便开发人员理解。

问题:“锯齿状前沿”

论文指出,AI 就像一座锯齿状的山脉。有时它极其聪明且乐于助人;而有时它却感到困惑并编造事实。如果你是专家,你知道如何导航安全路径;如果你是新手,则可能会误入悬崖。CARE 的目标是构建 AI,使其无论由谁使用,都能像专家一样行事。

CARE 流程:五步施工现场

CARE 并非只是输入提示并寄希望于最佳结果,而是采用“阶段门控”流程。这意味着,除非当前步骤获得人类批准,否则无法进入下一步。

  1. 范围界定与分解: 团队定义目标。这个机器人确切应该做什么? 辅助代理协助写下边界。
  2. 关键信息提取: 团队收集“工具”和“背景”。机器人可以访问哪些数据库?正确的答案看起来是什么样的? 辅助代理将这些答案转化为检查清单。
  3. 推理策略与护栏: 这是最重要的部分。团队决定机器人如何思考。它何时应该寻求帮助?何时应该说“我不知道”? 辅助代理起草这些规则,并由人类予以批准。
  4. 提示架构: 只有在规则确定后,团队才会编写 AI 的实际指令(即“提示”)。由于规则已经清晰,提示仅仅是对这些已批准规则的翻译,而非猜测。
  5. 基准测试与验证: 在机器人投入工作之前,它需要参加测试。团队创建一组问题,以验证机器人是否真的遵循了他们写下的规则。

“辅助代理”类比

将辅助代理想象成一位施工工头

  • 科学家(SME)说:“我需要一堵既安全又坚固的墙。”
  • 开发人员说:“好的,我来建造。”
  • 如果没有工头,他们可能会争论“坚固”的具体含义,或者开发人员可能会建造一面看起来不错但会倒塌的墙。
  • 有了辅助代理,它会介入并说道:“科学家,‘坚固’是指能承受 500 磅的重量吗?开发人员,你的计划是否符合这 500 磅的要求?”它将确切的技术规格写入合同(即“工件”)。如果计划后来发生变化,合同也会相应更新,每个人都能确切知道发生了什么变化。

现实世界测试:NASA 案例研究

为了证明这行之有效,团队为 NASA 构建了一个 AI 代理,用于搜索海量的地球科学数据目录(NASA 通用元数据仓库)。

  • 竞赛: 他们构建了两个代理。
    • 代理 A(CARE 代理): 使用带有辅助代理的严格五步 CARE 流程构建。
    • 代理 B(基线): 采用“旧方法”构建(仅使用相同的 AI 模型和工具,但没有严格的 CARE 流程)。
  • 结果:
    • 在包含 621 个问题的自动化大规模测试中,CARE 代理在71.7%的情况下率先找到正确答案,而旧方法仅为69.1%
    • 在由真实 NASA 科学家创建的较小且更难的测试(43 个问题)中,CARE 代理在27.2%的情况下将正确答案列入前 5 个结果,优于旧方法的20.2%

核心结论

论文声称,通过采用一种结构化流程,让人类与“辅助代理”在构建 AI 之前共同制定清晰的规则,可以获得更可靠、更安全且性能更优的机器人。它将“提示工程”这一混乱的艺术转变为可预测的工程学科。

重要说明: 论文仅针对查找科学数据测试了该方法。除非未来的工作明确提及,否则该方法并不声称适用于医疗诊断、法律建议或其他特定领域,而本文并未涵盖这些内容。其成功严格局限于所提供的 NASA 数据搜索示例。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →