Towards an Argumentative Foundation for Evaluative AI
本立场文件主张将计算论证作为评估型人工智能的正式基础,从而使系统能够通过以可解释且可质疑的方式呈现带有证据的竞争性假设,来支持人类决策。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一座巨大的、嘈杂的图书馆,书本正试图帮助你解开一个谜团。在人工智能的世界里,关于这些数字助手应该如何与我们交流,存在着一场大辩论。长期以来,标准的方法就像一位严厉的图书管理员,指着一本书说:“这就是答案。相信我。”这被称为“推荐”(recommendation),虽然它很快,但往往会让我们停止独立思考。我们可能会盲目跟随建议,或者完全忽略它而不去理解原因。但有一种更新颖、更令人兴奋的想法叫做评估型人工智能(Evaluative AI)。这种 AI 不会大声喊出一个最终答案,而是更像一位友好的辩论教练。它会陈述几种可能的理论,展示支持每种理论的证据,同时也展示反对它们的证据。它邀请你介入其中,观察线索,然后由你自己决定哪种理论最合理。这让你始终处于驾驶座上,使 AI 成为你的伙伴而非老板。
这篇论文由来自英国和澳大利亚大学的研究团队撰写,提出了一种构建这种“辩论教练”型 AI 的具体且强大的方法。他们认为,完成这项工作的最佳工具是所谓的论证(Argumentation)。请不要将其视为一场叫嚣式的争吵,而应将其视为一种结构化的“连点成线”游戏:每一条证据都是一个节点,而它们之间的链接则展示了它们是如何相互支持或攻击的。作者提议使用一种称为加权定量双极论证框架(Weighted Quantitative Bipolar Argumentation Frameworks, wQBAFs)的数学框架。用通俗易懂的话来说,这是在绘制一张地图,其中每个线索都有一个“置信度分数”(有多强)和每条连接都有一个“权重”(影响力有多大)。通过计算这些数字,AI 可以创建一个最佳理论的排名列表,而不仅仅是一个猜测。论文指出,这种方法优于以往的方法,因为它具有透明性——你可以清楚地看到为什么某个理论排名很高——而且最重要的是,它是可质疑的(contestable)。如果你认为某个线索是错误的,或者某个连接很微弱,你可以挑战它,调整数值,并观察排名如何变化。这把 AI 从一个黑匣子变成了一个协作式工作坊,人类和机器可以在这里进行辩论、完善并就最佳路径达成共识。
核心理念:从“这是答案”到“让我们辩论”
作者首先指出,我们目前使用 AI 的方式存在缺陷。大多数系统运作在“推荐并解释”的模型之上。AI 选出一个赢家,然后试图为其辩护。问题在于?研究表明,这会导致人们停止思考。他们要么产生“认知固着(cognitive fixation)”——像被催眠的兔子一样盯着 AI 的选择;要么完全不加思考地直接否定它。
为了解决这个问题,论文倡导使用评估型人工智能(Evaluative AI, EAI)。EAI 不会递给你一个单一的推荐,而是提供一份合理的假设(猜测)菜单,并附带每种假设的“优缺点”。想象一下医生使用 AI 来诊断病人。AI 不会说“肯定是肺炎”,它可能会说:“这里有三种可能性:病毒性肺炎、细菌性肺炎或哮喘。这是支持每种情况的证据,这也是反对它们的证据。由您决定。”
解决方案:“论证图谱”游戏
论文提出,构建这种系统的最佳方式是使用论证(Argumentation)。作者建议使用一种特定的数学结构,称为 wQBAF(加权定量双极论证框架)。让我们用一个比喻来拆解它。
想象一个巨大的、漂浮着的发光节点网络。
- 节点(Nodes): 有些节点是证据(如“高烧”或“咳嗽”),有些是假设(如“病毒性肺炎”或“哮喘”)。
- 连接(Connections): 线条连接这些节点。有些线是绿色(支持),意味着“这个线索让那个理论更有可能”;其他的线是红色(攻击),意味着“这个线索让那个理论可能性降低”。
- 权重(Weights): 每个节点都有一个基础分(该线索初始有多强);每条线都有一个权重(该连接的影响力有多大)。
在论文的示例中,患者有高烧和咳嗽。这些是起始节点。发烧可能强烈支持“病毒性肺炎”,但对“哮喘”的支持较弱。AI 不仅仅是在猜测;它在运行计算。它查看基础分和连接的强度,然后根据绿线和红线的拉锯战来“重新计算”每个假设的强度。
结果不是一个单一的答案,而是一个排名列表。拥有最高最终强度的假设排在首位,紧随其后的是次优的选择,依此类推。在论文的医疗案例中,系统可能会将“抗病毒疗法”和“抗生素”列为同样强(两者强度分均为 0.40),而“支气管扩张剂”则较低(0.31)。
为什么这种方法很特别
作者认为,这种论证方法具有其他方法所缺乏的三种“超能力”:
- 可解释性(Explainability): 因为系统建立在可见的论证图谱之上,它可以解释为什么某个假设排名很高。它可以指向特定的“高烧”节点以及连接到“病毒性肺炎”的强绿色线条,并说:“这就是为什么我们认为这是首选的原因。”这不是魔法,而是一条可追溯的路径。
- 可质疑性(Contestability): 这是最重要的一点。在许多 AI 系统中,如果你不同意,你就束手无策。在这里,因为系统仅仅是一张权重和连接的地图,你可以改变这张地图。如果你认为“咳嗽”这个症状不像 AI 认为的那样重要,你可以降低它的权重。如果你有了新的证据,你可以添加一个新的节点。系统会立即重新计算排名。这使用户从被动的观察者变成了主动的参与者,可以挑战 AI 的推理。
- 多智能体协作(Multi-Agent Collaboration): 论文设想了一个未来,不同的“智能体”(也许一个是人类医生,另一个是专门的数据库,第三个是不同的 AI 模型)各自构建自己的论证图谱。然后,它们可以合并各自的图谱,相互辩论,并融合彼此的观点,以创建一个更强大、更稳健的最终排名。这就像是一个专家圆桌会议,每个人都带来了自己的笔记,并进行辩论,直到共同找到最佳解决方案。
游戏的规则
为了确保这个系统行为理性,作者提出了一套该排名系统应遵循的“原则”。它们就像公平游戏的规则:
- 单调性(Monotonicity): 如果你增加了支持某种理论的证据,它的排名绝不应该下降。
- 平衡性(Balance): 如果你加入了等量的“正向”和“负向”证据,排名不应发生变化。
- 支配性(Dominance): 如果一个理论拥有比另一个理论更多或更强的支持性证据(在面对相同的反对证据时),它必须排名更高。
- 稳健性(Robustness): 数据的微小变化不应导致整个排名发生疯狂的剧烈跳变。
- 可解释性与可质疑性: 如前所述,系统必须能够解释其逻辑,并允许人类对其进行挑战。
论文指出,许多现有的数学论证方法已经满足了前四条规则,但作者建议我们需要继续开发新方法,以确保系统也具备稳健性和真正的可质疑性。
局限性与未来
作者谨慎地表示,他们并未声称解决了所有问题。他们承认,构建这些论证图谱是非常困难的。目前,让 AI 正确识别所有论证、连接及其权重仍然是一个主要的瓶颈。他们建议,较新的“大语言模型”(我们熟知的智能聊天机器人)可能会帮助自动构建这些图谱,但目前还不完美。
他们还警告了“可质疑性”这一特征。如果人类可以改变权重,那么什么能阻止有人故意破坏系统呢?他们建议我们可能需要“权限化”系统,即只有受信任的用户才能更改规则,或者需要衡量修改者可信度的方法。
最后,他们承认在多智能体世界中,不同的专家可能会产生深刻的分歧。有时,并不存在唯一的“正确”答案。他们系统的目标不是强迫所有人达成一致,而是以一种结构化、透明的方式管理这种分歧,从而帮助人类应对冲突。
简而言之,这篇论文不仅提出了一种新算法,更提出了一种新的 AI 哲学。它表明,智能机器的未来不在于它们成为房间里最聪明的人,而在于它们成为人类辩论的最佳促进者,帮助我们权衡证据、挑战假设,并达成我们真正可以信任的决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。