← 最新论文
🤖 AI

Definitional alignment before capability alignment: a Design-Science framework for adjudicating claims about AGI

本文提出了 DAF-AGI,这是一个设计科学框架,它通过建立序数标准和治理审计来评估相互竞争的操作化定义,从而通过优先考虑定义一致性而非能力一致性,来裁定关于 AGI 到达的冲突性主张。

原作者: J. E. Aguilera Briones

发布于 2026-06-12
📖 2 分钟阅读☕ 轻松阅读

原作者: J. E. Aguilera Briones

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 J. E. Aguilera Briones 的论文 《能力对齐之前的定义对齐》(Definitional alignment before capability alignment) 的解释,采用了简单的语言和富有创意的类比。

核心问题:“抵达”论辩

想象一群人正在争论一辆新车是否属于“超级跑车”。

  • A 人说:“是的,它是超级跑车,因为它能跑 200 英里/小时。”
  • B 人说:“不,它不是。它不会漂移,而且引擎不是 V12 型。”
  • C 人说:“它是什么并不重要;如果它能自己开车去商店,它就是超级跑车。”

他们都在观察同一辆车。他们对事实(速度、引擎、功能)都达成了一致。但他们无法就结论达成一致,因为他们使用的是不同的规则手册来定义什么是“超级跑车”。

这篇论文指出,人工智能通用智能(AGI)领域正陷入这种完全相同的争论中。一些公司说:“我们已经抵达了!”因为他们的 AI 能写出优秀的程序代码。另一些人则说:“我们还有几十年的路要走!”因为他们的 AI 还无法进行长期记忆或解决全新的谜题。这种分歧不在于技术本身,而在于谁有权编写规则手册以及规则到底规定了什么

解决方案:“规则手册审计员”(DAF-AGI)

作者认为,试图编写一个“唯一的真理定义”是不可能的(因为每个人都有不同的目标),因此他构建了一个名为 DAF-AGI 的工具。

不要把 DAF-AGI 看作是一个决定胜负的法官,而要把它看作是一个透明度审计员。它就像是定义的“营养成分表”。当有人声称“这个 AI 是 AGI”时,审计员不会简单地回答“是”或“否”,而是会询问:

  1. 你在衡量什么?(是速度?是记忆力?还是它节省了多少资金?)
  2. 规则是谁写的?(是制造该 AI 的公司自己编写的规则吗?)
  3. 规则可以被更改吗?(如果 AI 失败了,他们能否通过修改规则让它通过测试?)

五种“规则手册”(测量维度家族)

论文研究了人们尝试定义 AGI 的五种最常见方式,并对其进行了审计:

  1. “速度计”(性能优越性):

    • 规则: “如果 AI 在某些任务上比人类更快/更好,它就是 AGI。”
    • 缺陷: 这很容易作弊。你可以只挑选 AI 擅长的任务(如写邮件),而忽略它不擅长的任务(如长期规划)。这就像说一个跑步者是奥运选手,仅仅因为他在自己练习过的赛道上赢了一场比赛,却忽略了他无法在沙地上奔跑。
    • 结论: 可靠性低。
  2. “钱包”(经济替代性):

    • 规则: “如果 AI 能以更低的成本完成人类的工作,它就是 AGI。”
    • 缺陷: 这混淆了“智能”与“经济学”。一个机械臂之所以能取代工厂工人,是因为它更便宜,而不是因为它更“聪明”。
    • 结论: 褒贬不一。 对经济学有效,但对衡量智能无效。
  3. “地图”(能力本体论):

    • 规则: “我们有一张涵盖不同技能(记忆、推理、创造力)的地图。AI 在地图上的哪个位置?”
    • 缺陷: 这是一张很棒的地图,但制图者(实验室)决定了“终点线”在哪里。
    • 结论: 结构良好,但制图者控制着终点线。
  4. “成绩单”(心理测量等同性):

    • 规则: “AI 必须匹配受过良好教育的成年人的完整认知剖面。”
    • 缺陷: 这是最难的测试。目前的 AI 就像是数学天才,但记忆力却像金鱼一样。它们无法通过这项测试,因为它们的表现是“参差不齐”的(在某些方面极强,在另一些方面极弱)。
    • 结论: 可靠性高,但目前的 AI 无法通过。
  5. “学习速度”(技能获取):

    • 规则: “智能在于你学习一个从未见过的谜题的速度。”
    • 缺陷: 目前的 AI 擅长背诵旧谜题,但在解决全新谜题方面表现糟糕。
    • 结论: 可靠性高,但目前的 AI 无法通过。

重大发现:“程式化主张”(The Stylized Claim)

论文测试了一个流行的说法:“当前的 AI 是 AGI,因为它在许多任务上超越了受过良好教育的成年人。”

当审计员(DAF-AGI)检查这一说法时,它发现了一个魔术技巧

  • 该主张使用了**“速度计”*规则(在某些*任务上胜过成年人)。
  • 但它借用了**“成绩单”**的标签(“受过良好教育的成年人”)。
  • 如果你真正应用“成绩单”规则,AI 会失败,因为它存在记忆缺陷。
  • 如果你应用“速度计”规则,它确实通过了,但这仅仅是因为公司挑选了容易的任务。

结论: 该主张是“定义不明”的。它混合了一个宽松的规则和一个严格的标签,从而使 AI 看起来比实际情况更聪明。论文指出,除非我们先就使用哪本规则手册以及谁有权修改规则达成一致,否则我们无法宣布“AGI 已抵达”。

“定义主权”的概念

这是论文中最重要的政治观点。

想象一个依赖进口食品的国家。

  • 场景 A: 他们向邻国购买食物。邻国决定了什么是“新鲜”。如果邻国明天改变了“新鲜”的定义,这个国家只能接受,否则就会挨饿。
  • 场景 B: 这个国家购买食物,但他们拥有自己的检查员。他们可以说:“我们接受你今天对‘新鲜’的定义,但如果你改变了定义,我们会进行审计并可能拒绝接收。”

作者称之为**“定义主权”
许多国家(以及公众)目前处于
场景 A**。他们是“定义接受者”。他们接受由美国或中国少数几家强大的科技实验室所编写的关于 AGI、“高风险 AI”或“成熟度”的定义。

  • 如果一家实验室说“这是 AGI”,并由此引发了法律变动或股市崩盘,世界不得不接受它。
  • 论文认为,各国需要具备审计、质疑和修订这些定义的能力。他们不需要从头编写自己的定义,他们只需要拥有说“不,那个定义对我们不起作用”或“我们需要验证那项主张”的力量。

总结:这篇论文到底说了什么?

  1. 我们无法就 AGI 是什么达成一致,因为不同群体有着不同的目标(营销、安全、投资)。
  2. 仅仅增加数据并不能解决问题。 即使 AI 变得更聪明,除非我们先解决定义问题,否则我们仍会为它是否算作“通用”智能而争论不休。
  3. 目前的“抵达”主张是站不住脚的。 它们通常通过将宽松的规则与严苛的标签混合使用,来伪造系统已达标的假象。
  4. 治理是关键。 我们不应再问“这是不是 AGI?”,而应开始问“是谁写了这条规则说这是 AGI,我们能否审计他们?”
  5. 主权至关重要。 国家和公众需要有权挑战那些“进口”的技术定义,否则他们将被那些他们既没参与编写、也无法修改的规则所统治。

简而言之: 在我们争论机器人是“活着”还是“聪明”之前,我们需要先同意谁有权拿着那本字典,并确保他们没有为了自己的钱包而随意篡改定义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →