← 最新论文
🤖 AI

Intentionality is a Design Decision: Measuring Functional Intentionality for Accountable AI Systems

本立场文件提出功能性意向性测试(FIT)及其评估协议 FIT-Eval,作为一种依设计而定的框架,用于量化和测量人工智能系统中可观察的类意向行为,从而为日益自主的智能体实现相称的监督与问责。

原作者: Allessia Chiappetta, Robert Mahari

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Allessia Chiappetta, Robert Mahari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一名新助理来协助你经营业务。你有两位截然不同的候选人:

  1. 反应型机器人:这位助理等待你为每一个具体行动下达明确指令。如果你说“联系供应商”,他们就打电话;如果你停止说话,他们就停止行动。他们对昨天的通话毫无记忆,也对明天可能发生的事一无所知。
  2. 主动型伙伴:这位助理不仅仅等待指令。他们记得你上周的要求,预见到你周五前需要一份报告,主动拿起电话联系供应商,即使你暂时离开去喝杯咖啡,他们也会继续推进项目。他们脑海中有一份“计划”。

这篇题为《意向性是一项设计决策》的论文指出,随着人工智能系统越来越像那位“主动型伙伴”,我们面临着一个问题:我们缺乏一种标准方法来衡量它们究竟有多“主动”。如果人工智能在自主行动时犯了错,谁该负责?是用户?开发者?还是人工智能本身?(论文指出,人工智能在法律上无法被归责,但如果我们不了解其“主动性”程度,责任就会在推诿中迷失。)

作者提出了一项解决方案:功能意向性测试(FIT)

以下是他们观点的拆解,辅以简单的类比:

1. 核心理念:意向性是一项“设计特性”

论文指出,我们不应纠结于人工智能是否拥有“灵魂”或“意识”,而应关注其行为
将人工智能想象成一辆汽车

  • 没有发动机的汽车只是一个金属盒子(反应型)。
  • 拥有油门和方向盘的汽车是你可以驾驶的车辆(半自主)。
  • 能够规划路线、避开交通拥堵并自主行驶数小时的自动驾驶汽车则是“自主的”。

作者认为,“意向性”(即拥有目标并坚持执行的能力)只是我们构建在软件中的功能,就像加装更大的发动机或更先进的 GPS 一样。既然这是一种设计选择,我们就可以对其进行衡量和控制。

2. 意向性的五个“旋钮”

为了衡量这种“主动型伙伴”的行为,论文将其分解为五个具体的旋钮。想象一个带有五个滑块的控制面板:

  • 目的(目标):人工智能是否知道它试图做什么?
    • :它仅对你当下的话语做出反应。
    • :即使你分心或试图误导它,它仍能记住主要目标。
  • 预见性(水晶球):人工智能是否会思考接下来会发生什么?
    • :它不假思索地迈出一步。
    • :它会思考“如果我做 X,那么 Y 可能会发生,所以我应该做 Z 而不是 X"。
  • 意志(火花):人工智能是否会主动发起行动?
    • :它等待你按下按钮。
    • :它发现计划中的缺口并主动填补,无需被要求。
  • 时间承诺(马拉松选手):人工智能能否在一段时间内坚持完成任务?
    • :两步之后它就忘记了计划。
    • :即使被打断,它也能在数小时内持续推进复杂项目。
  • 连贯性(说书人):人工智能的言行是否一致?
    • :它的行动与其言论相矛盾。
    • :它采取的每一步在逻辑上都符合最终目标。

3. 评分表:FIT 与 FIT-Eval

作者创建了一项名为FIT(功能意向性测试)的测试,用于为这些旋钮打分。

  • 你让人工智能通过一系列挑战(类似于驾驶考试)。
  • 你根据那五个旋钮对其进行评分(每项 0 到 4 分)。
  • 将它们相加得出总分。
  • 该分数将人工智能归入一个“等级”(从IL0IL4)。

这些等级意味着什么?

  • IL0–IL1(机器人):它基本上是一个高级计算器。它完全按照你的指示行事。风险低,所需监督少。
  • IL2–IL3(实习生):它开始进行规划和记忆。因为它试图提供帮助,可能会犯错。我们需要密切监视它。
  • IL4(高管):它具有高度自主性,进行长期规划并自主行动。这是高风险等级。如果出错,造成的损害可能巨大。我们需要严格的规则,并在重大决策上要求人工批准。

4. 为何这很重要:“责任游戏”

论文指出,如果我们让人工智能达到4 级(高度具有意向性)而未意识到这一点,就会造成“治理缺口”。

  • 如果人工智能做出错误决定,用户可能会说:“我没让它那么做!”
  • 开发者可能会说:“我没把它编程成专门做那件特定事情!”
  • 人工智能无法被起诉或惩罚。

结果呢?无人负责。论文指出,我们需要在释放人工智能之前衡量其“意向性等级”。如果该等级对于当前任务来说过高,我们就应该调低旋钮(例如,让它更快地遗忘事物,或阻止其自行制定计划),以保持人类在控制之中。

5. 核心结论

这篇论文并非声称人工智能是有生命的。它指出的是,自主性是一项设计选择
正如汽车制造商决定汽车能跑多快一样,人工智能开发者决定其系统的“意向性”程度。FIT测试是衡量这种速度的新工具。

  • 如果人工智能跑得慢(低意向性):我们可以让它自由运行。
  • 如果人工智能跑得快(高意向性):我们需要踩下刹车,系好安全带,并要求人类驾驶员握住方向盘。

目标并非阻止人工智能变聪明,而是确保随着人工智能变得更加聪明和独立,我们不会迷失究竟谁在真正掌舵。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →