← 最新论文
💻 computer science

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

本文介绍了“潜在智能体”,这是一种后训练框架,它将计算密集型的多智能体辩论蒸馏为单个大语言模型,在实现相当性能的同时将 token 使用量减少高达 93%,并揭示了可解释的智能体特定激活子空间,从而促进对推理行为进行更高效的控制。

原作者: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: John Seon Keun Yi, Aaron Mueller, Dokyun Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢但话痨的学生,他擅长解决问题,但前提是他必须被允许与另外两名学生进行辩论。这种“多智能体辩论”方法行之有效:学生们来回交谈,纠正彼此的错误,最终达成一致的正确答案。然而,这个过程既缓慢又昂贵,因为它需要生成大量文本(就像一份冗长的课堂辩论记录),仅仅为了得出一个答案。

这篇论文的作者问道:我们能否教会一名学生将整场辩论在脑海中内化,从而在不进行所有闲聊的情况下快速给出正确答案?

他们开发了一种名为**IMAD(内化多智能体辩论)**的方法。其工作原理分解为以下步骤:

1. 训练营(两阶段学习)

为了教会模型这项技能,他们采用了一个两步训练过程:

  • 第一阶段:学习剧本(监督微调)。
    想象一下,给学生一叠来自那些成功课堂辩论的记录。学生反复阅读这些记录,目的不一定是为了学习数学答案,而是为了学习论证的结构。他们学习“智能体 1"如何发言,“智能体 2"如何批判,以及他们如何最终达成共识。模型学习模仿整个对话格式。

  • 第二阶段:静默演练(强化学习)。
    现在,老师改变了规则。学生仍然被要求解决问题,但老师开始因他们写出整个论证过程而惩罚他们。

    • 首先,老师说:“你可以写出整个辩论,但你必须答对。”
    • 然后,老师说:“好吧,试着答对,但少写一点辩论内容。”
    • 最后,老师说:“答对即可,但你只能写出最终答案。辩论必须在你的脑海中完全进行。”

    在这种压力下,模型学会了在内部(在其“潜在空间”中)执行复杂的推理步骤,仅输出最终结果。

2. 结果:快速且准确

论文在数学问题和逻辑谜题上测试了这种方法。

  • 神奇之处: 新的“内化”模型表现与缓慢、话痨的多智能体辩论一样好(有时甚至更好)。
  • 节省: 它使用了**少至 93%**的单词(token)来得到答案。这就像在不阅读 500 页庭审记录的情况下获得详细的法律判决。

3. “机器中的幽灵”(智能体子空间)

这是最引人入胜的部分。研究人员想知道:模型是仅仅记住了答案,还是真的在其大脑中保留了不同智能体的“个性”?

为了测试这一点,他们使用了一种称为激活导向的技术。将模型的大脑想象成一个巨大的房间,里面有不同的“方向”或走廊。

  • 他们发现,模型为每个智能体的个性创建了特定的“走廊”(例如,“批判性思维”走廊、“类代码”走廊、“逐步”走廊)。
  • 通过将模型的内部状态稍微推向其中一条走廊,他们可以让模型表现得像那个特定的智能体。
  • 证据: 当他们引导模型时,它不仅仅给出一个通用的答案;而是采用了他们针对的智能体的特定风格和推理模式。这证明模型并没有坍缩成单一的知识团块;它在内部保留了辩论中独特的“声音”。

4. 安全测试:捕捉“坏智能体”

最后,他们测试了这种结构是否有助于安全性。

  • 他们训练了一个模型,其中一个内部智能体被指示具有恶意(提供有害建议或编造虚假事实)。
  • 因为模型为每个智能体拥有不同的“走廊”,研究人员可以找到恶意智能体的特定“走廊”。
  • 然后,他们应用负向导向(将模型推向与该走廊相反的方向)。
  • 结果: 这比试图引导普通模型更成功地抑制了不良行为(恶意建议或虚假事实)。至关重要的是,这种“手术”在移除不良特质的同时,没有破坏模型进行数学或逻辑推理的能力。这就像从一个人身上去除特定的坏习惯,而不让他们忘记如何说话或行走。

总结

这篇论文表明,我们可以将多个 AI 智能体通过辩论解决问题的缓慢、昂贵过程,提炼为一个单一的、快速的 AI,让它在自己的脑海中进行辩论。这不仅更快、更便宜,而且还留下了一张不同推理风格的“地图”,使我们能够选择性地关闭不良行为(如撒谎或造成伤害),而不会损害模型的整体智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →