← 最新论文
💬 NLP

We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong

本文提出自适应多分支引导(AMBS),这是一种两阶段的一对多 Transformer 框架,通过将特定于目标的变换相对于共享表示进行参数化,使大语言模型能够同时对齐有益性、无害性和诚实性目标,从而在保持推理效率的同时克服先前方法的干扰与不一致性问题。

原作者: Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢但略显混乱的厨师(即人工智能),他正试图为你烹饪一顿大餐。你希望这顿饭既有用(美味且饱腹),又无害(不含毒药或危险食材),还要诚实(不谎报锅中内容)。

过去,试图让这位厨师同时做到这三点,就像同时对着他的耳朵大喊三条相互冲突的指令:“要辣!”“别放盐!”“必须甜!”厨师会感到困惑,常常忽略一条指令而专注于另一条,更糟糕的是,端上来的菜要么安全但难以下咽,要么美味却有毒。

本文介绍了一种引导这位厨师的新方法,称为AMBS(自适应多分支 steering)。以下是其工作原理,使用简单的类比说明:

问题所在:“独厨”与“困惑团队”

以往的方法尝试通过两种方式修正这位厨师,但两者都有缺陷:

  1. 独厨:他们一次只给厨师一套指令。如果希望食物安全,就告诉厨师忽略口味;如果希望食物美味,就忽略安全。厨师无法平衡两者。
  2. 困惑团队:较新的方法尝试将厨师拆分为三个独立的克隆体(一个负责安全,一个负责口味,一个负责真实),并行工作。但由于这些克隆体彼此不交流,也不共享“基础记忆”,它们往往给出三个完全不同且相互矛盾的答案。一个克隆体可能说“吃这个”,而另一个却说“别吃那个”。

解决方案:带有“专用调整”的“共享蓝图”

作者提出了一种更聪明的厨房运行方式,采用1 对 N Transformer架构。可以这样理解:

  1. 第一阶段:共享蓝图(“基础”)
    并非为每个目标从头开始,厨师首先根据你的订单创建一份单一、完美的菜肴蓝图。这就是“共享表示”。它是厨师理解食材和基本食谱的共同基础。

  2. 第二阶段:专用调整(“分支”)
    现在,厨师不再制作三道完全不同的菜,而是基于同一份蓝图制作三个副本

    • 副本 A(有用性):厨师在这个副本上添加一点“香料”,使其更实用。
    • 副本 B(无害性):厨师在这个副本上添加一点“安全过滤器”,以去除毒素。
    • 副本 C(诚实性):厨师在这个副本上添加一点“事实核查”,确保信息准确。

    魔法技巧:厨师不会为每个副本重写整份食谱。他们仅对共享蓝图添加微小、特定的调整(偏差)。这确保了三个副本仍然看起来像同一道菜,只是风味不同。它们保持关联,因为它们都源自同一个基础。

  3. 最终菜品(解码)
    最后,厨师不会端给你三盘不同的菜。他会审视所有三个经过微调的版本,并将它们融合成一道单一、完美的菜肴,同时兼具美味、安全和诚实。

为何此法更优

  • 不再困惑:由于所有“克隆体”都从同一蓝图出发,它们不会各自偏离。它们保持同步。
  • 不再覆盖:在旧方法中,让食物安全会意外抹去风味。而在新方法中,“安全调整”是叠加在“风味调整”之上的,因此你能同时获得两者。
  • 高效:厨师只需烹饪一次基础食谱。其余部分只是快速、微小的调整。这意味着厨房运行迅速,且不消耗额外能源。

结果

作者在多个不同的 AI 模型(如 LLaMA、Mistral 和 Gemma)上测试了这种"AMBS"方法。他们发现:

  • AI 在同时做到有用、无害和诚实方面变得出色得多。
  • 它不会困惑或“崩溃”(即为了安全而放弃诚实)。
  • 它运行迅速,且不需要昂贵的计算资源。

简而言之,本文表明,如果你为 AI 提供一个共享基础,然后让它针对不同目标进行微小、特定的调整,它就能满足你的所有要求,而不会陷入困惑或在任何一项上失手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →