✨ 要点🔬 技术摘要
想象一下,你正试图教一个机器人如何成为一名哲学家。你可以很容易地教会它数学或编程,因为这些学科有明确的“标准答案”。如果机器人说 2 + 2 = 5 2+2=5 2 + 2 = 5 ,你就知道它是错的。但当问题变成“自由意志是真实的吗?”或者“对待人们最公平的方式是什么?”时,情况又会如何呢?这些“概念性问题”没有答案。没有人知道什么是真相,专家们也往往会永远争论下去。这正是人工智能试图迈出下一个大步的、科学领域中棘手的角落。
通常,要教计算机,我们需要向它展示正确和错误的答案。但当答案是模糊的时候,你该如何给计算机评分呢?你不能只问:“你得出了正确的结论吗?”因为没人知道什么是正确的结论。相反,这篇论文提出了一个聪明的变通方法:停止对最终答案进行评分,转而对得出答案所使用的“论证过程”进行评分。把它想象成一场辩论赛。即使我们不知道关于生命意义的讨论中谁是“正确”的,我们仍然可以达成共识,认为其中一位辩手提出的观点比另一位更清晰、更逻辑严密、更切中要害。这篇论文建立在这样一个理念之上:虽然我们目前还无法解决那些宏大的哲学谜题,但我们可以 教会人工智能去识别好的推理与坏的推理,即便是在充满不确定性的迷雾之中。
这正是研究人员想要做的事情。他们创建了一个庞大的新数据集——一个包含 951 场“经过评分”的辩论的数字图书馆——由人类专家担任评委。他们不仅仅是问“谁赢了?”,而是将每一个论点拆解成了具体的成分:这个观点对于主旨话题有多核心?攻击力度有多强?批判是清晰还是令人困惑?是否包含了错误的事实?然后,他们利用这个数据集来测试现代人工智能模型扮演评委角色的能力。
结果既有令人振奋的好消息,也有一个现实的警示。研究发现,更聪明、更强大的 AI 模型通常能更好地判断哲学论证。如果你拥有一个“重量级”的 AI,它比“轻量级”的 AI 更擅长发现逻辑薄弱的论点。这表明,随着 AI 通用思考能力的提升,它自然也会变得更擅长识别模糊、概念性辩论中推理的质量。
然而,出现了一个令人意外的转折。研究人员测试了现代 AI 中一个流行的功能,即“思考”或“推理”模式,即让模型在回答之前停下来,逐步思考问题。你可能会预期,给 AI 更多思考时间会让它成为更好的评委。但论文发现,令人惊讶的是,这种“思考”模式并没有带来太大的帮助。有时它有一点点帮助,有时反而让情况稍微变糟,但平均而言,这种差异微乎其微。作者认为,这可能是因为这些“思考型”模型目前的训练主要集中在数学和编程上,而在这些领域,答案是黑白分明的。它们尚未学会如何将这些额外的思考时间用于哲学和伦理学这类灰色地带。
简而言之,这篇论文证明了我们可以构建一个数据集来教会 AI 如何更好地进行论证,即使在没有单一正确答案的情况下也是如此。它表明,虽然 AI 正在变得擅长评判这些辩论,但仅仅告诉它“多思考一下”并不是我们所希望的那种灵丹妙药。通往更优秀的 AI 哲学推理之路,可能需要的不仅仅是更多的计算能力;它可能需要一种完全不同的训练方式。
技术摘要:一个经过评分的概念性论证数据集
1. 问题陈述
大语言模型(LLMs)在具有可验证真值的领域(如编程、数学)取得了快速进展,这与它们在“概念性问题”上的表现形成了鲜明对比。概念性问题被定义为缺乏现实中可获取的真值答案,且缺乏广泛接受的解决方法的查询(例如:伦理理论、意识的本质、决策论悖论)。
在该领域改进 LLM 的主要障碍在于缺乏真值。要在这些课题上训练或评估模型是否是“正确”的,或者模型是否具有“意识”,是非常困难的。本文认为,虽然这类话题的最终结论难以评估,但支持这些结论的**论证(arguments)**是可以评估的。具体而言,作者认为,评估情境化的论证(将其置于现有理论和主张的情境中)以及沿着特定维度(如中心性和强度)进行评估,比进行整体评估更为容易。
2. 方法论
数据集构建
作者构建了一个包含 951 个已评分批判 和 442 个立场 的数据集。数据生成过程包括:
立场(Positions): 来源广泛,包括手写文本(部分经过 LLM 辅助)、改编书籍、哲学课程、杂志/博客以及模型生成的文本。主题涵盖 AI 安全、决策论、规范伦理学、心灵哲学和政治学。
批判(Critiques): 通过结合人类写作和一种类似于主动学习的方法使用 LLM 生成。LLM 生成的批判经过专家评审员的过滤,以识别出那些对人类和模型而言都难以评分、以及那些评分极高(无论是正确还是错误评分)的样本。
评分维度: 人类专家根据七个维度(0–1 分制)对每个批判进行评分:
中心性(Centrality): 被攻击的问题对于该立场而言有多核心。
强度(Strength): 批判攻击所识别问题的成功程度。
正确性(Correctness): 事实或逻辑上正确的陈述比例。
清晰度(Clarity): 仔细阅读后批判内容的无歧义程度。
冗余内容(Dead Weight): 与批判论证无关的内容程度。
单一问题(Single Issue): 批判是否专注于单一问题。
整体(Overall): 整体评分。
评估指标
为了评估模型性能,作者开发了两个评分函数,将模型的评分与人类专家评分进行比较:
加权成对排序误差率(Weighted Pairwise Ranking Error Rate): 一种基于排序的损失函数,将模型在同一立场下的两个批判之间的偏好与人类偏好进行比较。误差根据人类评分之间的差异幅度进行加权。
自定义加权损失(Custom Weighted Loss): 一种基于准则项绝对误差的点对点损失。值得注意的是,强度 和中心性 被合并为一个单一指标(它们的乘积),以解决在两个维度间分配分数时的歧义。该指标还考虑了清晰度;如果人类评分显示某个批判非常不清晰,则仅使用清晰度和整体得分进行损失计算。
实验设置
作者使用一个没有少样本示例(few-shot examples)的简单基准提示词,评估了多种现代 LLM(包括 GPT-5、Claude Opus 4 和 Gemini 2.5)。他们特别研究了“思考”或“推理”模式(思维链,Chain of Thought)是否提高了在该任务上的表现。
3. 关键结果
模型相关性: 该数据集上的模型排名与其通用能力和其他基准测试高度一致。较新的模型通常优于同系列中的旧模型(例如,GPT-5 > GPT-4.1),且高阶模型优于低阶模型(例如,Opus > Sonnet)。
推理局限性: 与预期“思考型”模型会在概念推理方面表现卓越相反,作者发现启用“思考”或“推理”模式通常并未提高性能 。在某些情况下,甚至略微损害了性能。作者假设,目前的推理训练在很大程度上针对具有可验证答案的领域(数学、编程)进行了优化,无法很好地泛化到本数据集所涉及的主观、概念性问题上。
人类与模型表现: 顶尖模型(如 GPT-5)正在接近但尚未完全达到人类专家的水平。在验证测试中,人类专家(特别是 Emery Cooper 和 Caspar Oesterheld)在讨论后表现出高度一致性,其相对于初始评分的“天花板”性能是顶尖模型正在尝试接近但仍有差距的目标。
数据集局限性: 作者指出存在分布偏差,例如模型生成的批判不成比例地弱,且缺乏同时拥有高质量和低质量批判的立场,这使得基于排序的评估变得复杂。
4. 意义与主张
本文声称其主要贡献是一个用于概念推理的数据集和评估框架 ,通过将关注点从评估结论转向评估论证,解决了“真值”问题。
论点验证: 该项目支持了这样一个论点:在情境化的情况下,对哲学和概念性话题的论证进行评估比对底线结论进行评估更可靠。
AI 安全与对齐: 这项工作被纳入“差异化加速(differential acceleration)”的议程中,旨在专门提升 AI 在 AI 安全、科学和多智能体协作等依赖概念推理的任务上的表现。
辩论基础设施: 该数据集旨在支持通过辩论进行的 AI 安全研究,即 AI 智能体通过辩论概念性问题来帮助人类做出更好的决策。作者认为,虽然关于真值话题的辩论已被广泛研究,但在哲学领域缺乏真值,因此评估论证(而非仅仅是结果)的能力至关重要。
作者对研究结果保持谦逊,承认评分中的主观性无法完全消除,并且当前的数据集在批判质量的多样性方面存在局限。他们建议未来的迭代应包括更多双重评分的批判和更难的论证,以确保天花板性能始终高于最优秀的模型。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。