Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas
本文介绍了 VirtueMap,这是一个通过亚里士多德美德伦理学来评估大语言模型伦理决策模式的框架,该框架通过将对困境的响应与经人类验证的基准真相进行排序,从而生成诸如智慧、正义和勇气等美德的比较剖面。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图描述一位新朋友的性格,但你并没有问他们“你是一个好人吗?”(这是一个很难用“是”或“否”来回答的问题),而是通过询问他们在一系列棘手的日常情境中会如何处理问题。你寻找的不是“正确”的答案,而是他们在如何权衡自己的价值观。
这正是论文 《通过伦理困境进行人工智能的亚里士多德式美德剖析》(Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas) 所做的事情,只不过对象是人工智能。
以下是他们项目 VirtueMap 的拆解,使用了简单的类比:
1. 问题所在:AI 太过非黑即白
通常,当我们测试 AI 时,我们会问:“这个答案是对还是错?”
但现实生活并非如此。有时,说出真相会伤人的感情;有时,保持公正意味着需要表现得有些严厉;有时,你必须在勇敢与谨慎之间做出选择。
作者认为,AI 模型会根据不同的“优先级”做出不同的选择。有的 AI 可能会始终选择诚实的答案,即使它显得生硬;另一个 AI 可能会选择礼貌的答案,即使它略显含糊。两者在各自的维度上都是“符合伦理”的,但它们拥有不同的性格。
2. 解决方案:“性格图谱”
作者没有给 AI 打“通过/失败”的分数,而是创建了一个 VirtueMap。你可以把它想象成一个五星雷达图(五边形形状),它根据五种古希腊美德来衡量一个 AI 的“性格”:
- 实践智慧 (Practical Wisdom): 知道在特定情况下该做正确的事(而不只是遵循规则)。
- 正义 (Justice): 公平对待并给予每个人应得的东西。
- 诚实 (Truthfulness): 诚实且不隐瞒事实。
- 勇气 (Courage): 即使面临恐惧或代价,也去做正确的事。
- 节制 (Temperance): 知道何时克制,不做得过头。
3. 测试方法:“排序游戏”
研究人员不仅仅是让 AI 选择一个答案。他们给出了 7 个日常伦理困境(例如:“你发现了一个电子表格错误;你是立即修复它,还是稍后再处理?”)。
对于每个困境,都有 5 种可能的反应。
- 旧方法: 问 AI,“哪一个是最好的?”
- VirtueMap 方法: 要求 AI 将这 5 个选项进行排序,从“最符合伦理”到“最不符合伦理”。
通过观察 AI 如何对所有选项进行排序,我们可以看到它的完整“性格”。它是讨厌“虽然诚实但无礼”的选项?还是偏爱“虽然谨慎但含糊”的选项?
4. “地面真值”:通过人类进行校验
他们如何知道哪种排序代表“勇气”或“正义”?
他们并没有凭空猜测。他们邀请了 100 多名真实人类 来观察这 5 个选项,并询问:“如果我们想要体现‘勇气’,这些选项应该如何排序?”
他们只有在 95% 的人类达成一致 时,才会保留用于评分的“规则”。这确保了这张图谱是基于常识,而非仅仅基于作者个人的观点。
5. 结果:AI “看起来”是什么样的
他们测试了 9 个著名的 AI 家族(如 GPT、Claude、Llama 等),并进行了多次测试以确保结果的稳定性。
- 好消息: 这些 AI 非常一致。如果你两次询问同一个 AI 同一个问题,它会给出非常相似的排序(一致性达 90%)。
- 性格差异:
- 所有的 AI 在实践智慧方面都表现出色(它们喜欢平衡、周全的答案)。
- 最大的差异出现在勇气、节制和正义方面。
- 示例: 一个 AI 可能非常“勇敢”(总是选择直接、有风险的真相),而另一个可能非常“节制”(总是选择安全、谨慎的路径)。两者都没有“坏掉”,它们只是拥有不同的画像。
6. 交互式网站
作者建立了一个网站,让你也可以参与这个游戏。你对困境进行排序,网站就会绘制出你的“美德五边形”。然后,它会将你的形状与 9 种不同 AI 的形状进行对比,看看哪个 AI 的性格与你最相似。
核心结论
这篇论文并不是在说 AI 拥有灵魂,或者它是否真正“善良”或“邪恶”。相反,它是在说:“AI 模型拥有不同的伦理风格,就像人类一样。”
VirtueMap 是一个衡量这些风格的工具。它让我们从询问“这个 AI 是否正确”转向询问“这个 AI 展示了什么样的伦理性格”。这有助于我们理解 为什么 AI 会做出那样的选择,而不仅仅是评判最终的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。