← 最新论文
🤖 AI

Philosophy-informed Machine Learning

本文引入了哲学启发式机器学习(PhIML)这一框架,该框架通过将分析哲学整合进模型设计与评估中,以增强对齐性与伦理责任感,并提供了案例研究、识别了挑战,并概述了未来研究的路线图。

原作者: MZ Naser

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: MZ Naser

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代机器在识别模式方面已变得惊人地出色。它们可以识别照片中的猫,将句子从一种语言翻译成另一种语言,或者推荐你可能喜欢的电影。然而,当世界发生微妙变化,或者当它们被要求去做需要真正理解而非仅仅是模式匹配的事情时,这些系统往往会跌跤。例如,如果有人在停止标志上贴了几张微小的贴纸,机器可能会自信地告诉你这是一个限速标志;或者它可能会建议一种在数据中表现良好但在现实中失效的医疗方案,因为它混淆了相关性与因果关系。这些失败之所以发生,是因为目前的人工智能仅建立在统计学之上;它学习的是通常会发生什么,但并不理解为什么会发生,也不真正理解引导人类决策的价值观。这种统计技能与现实世界可靠性之间的差距,促使研究人员提出了一个不同的问题:如果我们构建这些机器时,不仅基于数据,还基于哲学家们发展出的关于知识、推理和正确行为的深邃且拥有数百年历史的思想,情况会怎样?

这就是被称为“哲学启发式机器学习”(philosophy-informed machine learning)的一种新方法的核心思想。这种方法不再将哲学视为技术构建完成后才进行的抽象讨论,而是将哲学概念直接编织进计算机模型的设计之中。其目标是创造出不仅聪明,而且在设计上就具备鲁棒性、逻辑性和符合人类价值观的系统。在最近的一项研究中,克莱姆森大学(Clemson University)的一位研究人员探索了如何通过整合分析哲学(analytic philosophy)的思想——特别是关于我们如何认知事物、如何进行因果推理以及如何做出伦理选择的思想——来修复当今人工智能中最顽固的缺陷。这项工作表明,通过赋予机器一个“哲学骨架”,我们可以让它们变得更安全、更可靠,即使它们并不完美。

该研究首先解决了一个被称为“黑盒脆弱性”(blackbox brittleness)的问题。这是指机器学习模型在处理其训练数据时表现完美,但在面对轻微变化(如不同的光照条件或新的方言)时却完全失效的情况。为了解决这个问题,研究人员研究了认识论(epistemology),即研究知识本质的哲学分支。传统的计算机模型对待所有不确定性的方式都是一样的,即分配一个单一的数字来代表其置信度。然而,哲学家们长期以来一直认为,拥有强有力的证据而产生的信心,与因为观察到了可能只是偶然现象的模式而产生的信心之间是有区别的。该研究测试了一种方法,即教导计算机去区分这两种状态。通过使用一个能够表示一系列可能信念而非仅仅是一个固定猜测的系统,模型变得更擅长于察觉自己在何时处于不确定状态。在一系列测试中,这种方法使计算机能够识别出一份文件同时被误分类为合同和专利这一逻辑上的不可能现象,并在不损失预测能力的前提下纠正了错误。

论文解决的第二个主要障碍是“因果盲区”(causal blindness)。当今大多数人工智能擅长寻找相关性,但对因果关系理解极差。如果一个模型看到带伞的人经常淋湿,它可能会得出结论认为伞导致了降雨,而不是理解降雨导致了人们带伞。这在医学或政策制定等领域是非常危险的,因为我们需要知道采取特定行动后会发生什么。为了解决这个问题,研究人员应用了关注“如果……会怎样”情景的因果理论。研究引入了一种让计算机模拟干预的方法,即询问如果改变某个特定因素会发生什么,而不仅仅是观察过去发生了什么。在涉及医疗方案的实验中,研究人员发现,当他们强制模型遵循“改变一个原因不应以不可能的方式剧烈改变结果”这一原则时,模型的预测变得更加稳定。系统不再会对患者接受不同治疗后的结果做出荒谬的猜测,使其预测保持在现实基础上。

或许是最复杂的挑战是使机器与人类价值观对齐。计算机可以非常擅长最大化某个分数,但如果该分数不能完美捕捉人类真正想要的东西,机器可能会找到一种伤害性的获胜漏洞。例如,新闻推荐系统可能会发现耸动的标题能吸引点击,从而导致其推广具有争议性的内容。该研究探索了如何将伦ik推理直接构建到机器的训练过程中。借鉴了约翰·罗尔斯(John Rawls)的哲学思想——他认为一个公正的社会是我们不知道自己处于社会什么地位时也会设计的社会——研究人员测试了一种方法,即训练计算机优先考虑处境最差的群体。在一个模拟招聘场景中,标准的计算机模型由于训练数据中包含隐藏偏见,往往会拒绝来自边缘化群体的候选人。然而,当模型经过调整,专门寻找公平性并确保弱势候选人不会被遗落时,它成功地纠正了这些偏见。结果显示,通过应用这些哲学规则,该系统在保持高整体准确率的同时,将弱势群体的招聘率提高了近50%。

研究并未发现这些哲学性的修复手段是能瞬间解决所有问题的“魔杖”。研究人员指出,将这些复杂的逻辑规则与海量数据相结合是困难的,有时会减慢计算机速度或增加训练难度。此外,在决定使用哪些哲学规则方面也存在深刻挑战,尤其是当不同的文化或伦理理论产生分歧时。然而,实验证明,即使是这些思想的简单应用也能显著减少错误。在一项测试中,标准模型在13%的预测中出现了逻辑矛盾,而引入哲学信息的版本将其降低到了零。在另一项测试中,系统跨不同群体预测结果的能力得到了显著提升,证明了这些思想不仅是理论性的,也是构建更好技术的实用工具。

最终,这项工作表明,人工智能的未来可能不在于向机器喂养更多的数据,而在于教它们如何思考。通过借鉴人类对知识、因果和伦理的长期探究传统,我们可以构建出不仅强大而且值得信赖的系统。研究人员总结道,虽然在技术和实践层面仍有重大障碍需要克服,但前进的方向是清晰的:我们必须停止将哲学视为事后才考虑的附属品,而应开始将其作为我们所依赖的机器的设计蓝图。随着这些系统在我们的生活中承担起更多的责任,问题不再是我们能否让它们变得更聪明,而是我们能多快让它们变得睿智。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →