← 最新论文
💻 computer science

Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning

本立场文件认为,实现认知对齐——即人工智能系统的推理与沟通方式与人类用户相似——对于构建值得信赖的高风险决策工具至关重要,并概述了一项旨在弥合当前方法与这一关键目标之间差距的研究议程。

原作者: Vijay Keswani, Breanna K. Nguyen, Cyrus Cousins, Vincent Conitzer, Walter Sinnott-Armstrong, Jana Schaich Borg

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Vijay Keswani, Breanna K. Nguyen, Cyrus Cousins, Vincent Conitzer, Walter Sinnott-Armstrong, Jana Schaich Borg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何做决定。在计算机科学领域,这被称为“人工智能对齐”(AI alignment)。这是一门确保机器的目标和行为与人类真实意图相匹配的艺术。这就像是在训练一只非常聪明、动作极快的狗。你希望它去捡球,而不是去追松鼠,而且你希望它能理解你为什么要让它去捡球。但这里有一个棘手的地方:有时机器人得到了正确的答案(它捡回了球),但它实现目标的逻辑却完全不同,甚至很古怪(比如它可能认为那个球是一只松鼠)。这被称为“认知失调”(cognitive misalignment)。

大多数人认为,只要机器人是准确的,我们就应该感到满意。但如果机器人的思考方式让我们感到完全陌生呢?如果一个机器人用一种对人类来说看起来像魔法的方法来解决数学问题,即便答案是正确的,情况又会如何?这篇论文提出了一个重大问题:在生命或重大价值受到威胁的情况下,我们到底是在乎机器人的决策结果,还是在乎它的思考方式?作者指出,对我们许多人来说,“如何思考”与“决定什么”同样重要。我们希望我们的 AI 像一个深思熟虑的人类,而不仅仅是一个超高速的计算器。

这篇论文的核心观点:我们想要一个像我们一样思考的机器人

这篇论文是对构建人工智能的科学家们发出的行动号召。作者认为,我们需要构建“认知对齐”的 AI。这不仅意味着 AI 要给出正确的答案,还意味着 AI 的推理过程要让过程感觉对人类来说是熟悉且可理解的,并且它能够清晰地解释其步骤。

为了测试这个想法,研究人员进行了一项针对 150 人的调查。他们让参与者想象三种类型的 AI:

  1. 过程隐藏型 AI:一个黑盒。它会给出一个答案,但你完全不知道它是如何得到这个答案的。
  2. 机器推理型 AI:它会解释自己的答案,但其逻辑是怪异、陌生且难以被人类理解的(比如一段用人类听不懂的语言编写的数学证明)。
  3. 人类推理型型 AI:它使用类似于一个深思熟虑、见多识广的人类所使用的逻辑来解释其答案。

研究人员确保告诉所有人,这三种 AI 的准确率是完全相同的。他们问道:“如果它们都能得到正确答案,你会信任哪一个?”

研究发现:我们渴望“人类式”的逻辑

结果非常明确,尤其是在严肃的场合。当任务属于低风险情况,如预测天气或安排会议时,人们并不太在意使用哪种 AI。但当风险升高——例如决定哪位患者可以获得肾脏移植、谁应该获得保释,或者军事导弹应该瞄准何处时——人们强烈倾向于选择人类推理型 AI

事实上,在测试的 16 个高风险场景中,有五个场景中,统计学上的显著多数人群选择了那个像人类一样思考的 AI。作者发现,超过 25% 的人将“决策方式与你在拥有充足时间和信息时所做出的决策相似”这一质量评为“至关重要”。另有 25% 的人将其评为“非常理想”。

论文表明,当生命受到威胁时,我们不仅想要一个正确的答案;我们还想要知道“为什么”。我们希望知道 AI 是否考虑了我们也会考虑的因素,比如同理心、公平性或特定的医疗细节。如果一个 AI 使用的是一种“外来”逻辑,即使它是正确的,也会让人感到风险和不信任。这就像是一位外科医生救了你的命,但他使用的是一种你从未见过且无法向你的家人解释的医疗技术。你虽然活了下来,但你可能会感到恐惧。

当前 AI 的问题

作者指出,目前大多数 AI 是通过“自下而上”的方法构建的。科学家们向 AI 输入数百万个关于人类选择的案例,并教它模仿这些结果。这就像是通过重复成千上上遍某个短语来教鹦鹉说“我爱你”。鹦鹉说出了正确的词汇,但它并不真正理解背后的情感。

目前的 AI 对齐方法通常无法检查 AI 的推理过程是否与人类的推理相匹配。它们仅仅检查最终答案是否正确。论文认为这是一个问题,因为:

  • 无法验证的解释:许多现代 AI 模型(如深度神经网络)是“黑盒”。即使它们尝试解释自己,我们也无法确定它们是否在如实陈述其做出决策的真实过程。
  • 认知失调:即使我们能看到 AI 如何思考,它使用的逻辑也往往让类人类感到完全陌生。例如,AI 可能会基于一个人类在现实生活中不会使用的复杂数学公式来做决定。

未来需要做什么

论文并未声称我们已经解决了这个问题。相反,它概述了一个研究议程来解决它。作者建议我们需要:

  • 衡量对齐度:开发新的方法来测试 AI 的思考过程是否真的与人类的思考过程相匹配。这可能涉及要求人们解释他们的选择,或者通过观察他们的注视方式(眼动追踪)来了解他们关注哪些信息。
  • 构建更好的工具:创建可以被“微调”以模拟特定个人或群体思考方式的 AI。想象一下,一个可以根据医生的特定诊断方式或法官权衡证据的方式进行调整的 AI。
  • 处理冲突:有时人们口头上说想要某种东西(如公平),但他们的行为却显示他们想要另一种东西(如速度)。论文建议我们需要交互式工具,帮助人类弄清楚他们真正希望 AI 做什么,而不是仅仅根据他们过去的经历进行猜测。

总结

这篇论文表明,对于 AI 要想在医疗、法律或军事决策等高风险领域真正成为值得信赖的伙伴,它需要的不仅仅是聪明。它需要实现“认知对齐”。它需要以一种人类可以理解的方式进行推理,以一种我们能理解的方式解释其步骤,并允许我们验证其逻辑是否符合我们的价值观。作者认为,如果没有这一点,无论 AI 声称多么准确,许多人根本不会信任它到足以让它做出那些艰难的抉择。这不仅仅是得到正确答案的问题,更是在于与机器进行一场对我们而言有意义的对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →