← 最新论文
💻 computer science

A dataset of rated conceptual arguments

本文介绍了一个包含针对 442 篇关于概念性问题(如 AI 安全与伦理)立场文本的 951 条专家评分批判的数据集,旨在评估大语言模型评估单个论点能力,并发现这些任务上的表现与模型的通用能力排名相关。

原作者: Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何成为一名哲学家。你可以很容易地教会它数学或编程,因为这些学科有明确的“标准答案”。如果机器人说 2+2=52+2=5,你就知道它是错的。但当问题变成“自由意志是真实的吗?”或者“对待人们最公平的方式是什么?”时,情况又会如何呢?这些“概念性问题”没有答案。没有人知道什么是真相,专家们也往往会永远争论下去。这正是人工智能试图迈出下一个大步的、科学领域中棘手的角落。

通常,要教计算机,我们需要向它展示正确和错误的答案。但当答案是模糊的时候,你该如何给计算机评分呢?你不能只问:“你得出了正确的结论吗?”因为没人知道什么是正确的结论。相反,这篇论文提出了一个聪明的变通方法:停止对最终答案进行评分,转而对得出答案所使用的“论证过程”进行评分。把它想象成一场辩论赛。即使我们不知道关于生命意义的讨论中谁是“正确”的,我们仍然可以达成共识,认为其中一位辩手提出的观点比另一位更清晰、更逻辑严密、更切中要害。这篇论文建立在这样一个理念之上:虽然我们目前还无法解决那些宏大的哲学谜题,但我们可以教会人工智能去识别好的推理与坏的推理,即便是在充满不确定性的迷雾之中。

这正是研究人员想要做的事情。他们创建了一个庞大的新数据集——一个包含 951 场“经过评分”的辩论的数字图书馆——由人类专家担任评委。他们不仅仅是问“谁赢了?”,而是将每一个论点拆解成了具体的成分:这个观点对于主旨话题有多核心?攻击力度有多强?批判是清晰还是令人困惑?是否包含了错误的事实?然后,他们利用这个数据集来测试现代人工智能模型扮演评委角色的能力。

结果既有令人振奋的好消息,也有一个现实的警示。研究发现,更聪明、更强大的 AI 模型通常能更好地判断哲学论证。如果你拥有一个“重量级”的 AI,它比“轻量级”的 AI 更擅长发现逻辑薄弱的论点。这表明,随着 AI 通用思考能力的提升,它自然也会变得更擅长识别模糊、概念性辩论中推理的质量。

然而,出现了一个令人意外的转折。研究人员测试了现代 AI 中一个流行的功能,即“思考”或“推理”模式,即让模型在回答之前停下来,逐步思考问题。你可能会预期,给 AI 更多思考时间会让它成为更好的评委。但论文发现,令人惊讶的是,这种“思考”模式并没有带来太大的帮助。有时它有一点点帮助,有时反而让情况稍微变糟,但平均而言,这种差异微乎其微。作者认为,这可能是因为这些“思考型”模型目前的训练主要集中在数学和编程上,而在这些领域,答案是黑白分明的。它们尚未学会如何将这些额外的思考时间用于哲学和伦理学这类灰色地带。

简而言之,这篇论文证明了我们可以构建一个数据集来教会 AI 如何更好地进行论证,即使在没有单一正确答案的情况下也是如此。它表明,虽然 AI 正在变得擅长评判这些辩论,但仅仅告诉它“多思考一下”并不是我们所希望的那种灵丹妙药。通往更优秀的 AI 哲学推理之路,可能需要的不仅仅是更多的计算能力;它可能需要一种完全不同的训练方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →