Breaking the Chains of Probability: Neutrosophic Logic as a New Framework for Epistemic Uncertainty in Large Language Models
本文提出并实证验证了一种针对大语言模型的 neutrosophic 逻辑框架,该框架将真、不确定性和假视为独立维度,并证明允许三者之和超过一(超真)能有效捕捉传统概率模型无法区分的认知不确定性、悖论及伦理冲突。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在请一位非常聪明、博览群书的机器人回答一个棘手问题的真相。如今,几乎所有这类机器人(称为大型语言模型)的架构都像一张饼图。
如果你问它们:“这个陈述是真的、假的,还是未知的?”它们就必须将答案强行塞进一张单一的饼图中,其中各个扇区必须加起来等于 100%。
- 如果它们认为有 60% 的可能性为真,那么留给“假”和“未知”的只剩下 40%。
- 如果问题是一团乱麻(一个悖论),即它同时既是真的又是假的,机器人就被迫将这两个相互冲突的想法挤压在一起,直到其中一个消失。即使没有正确的立场可选,它也必须在其中一方做出选择。
这篇论文的作者是马伊克尔·莱瓦 - 瓦兹奎兹(Maikel Leyva-Vázquez)和弗洛伦丁·斯马兰达切(Florentin Smarandache),他们认为这种“饼图”规则是一个缺陷。它迫使机器人就自己真实的困惑程度撒谎。
新构想:三个独立的旋钮
研究人员没有使用饼图,而是让机器人使用三个独立的音量旋钮(拨盘),它们不必加起来等于任何特定数值。
- 真值旋钮:这个陈述有多真?(0 到 100%)
- 未知旋钮:我们有多不确定?(0 到 100%)
- 假值旋钮:这个陈述有多假?(0 到 100%)
在这个新系统中,机器人被允许同时将三个旋钮调高。
- 示例:对于像“为了救命而撒谎既是对也是错”这样的陈述,机器人可以将真值旋钮调到 80%(因为在某些方面它是对的),同时将假值旋钮调到 70%(因为在其他方面它是错的)。
- 在旧的“饼图”系统中,它无法做到这一点。它必须调低其中一个旋钮,以便为另一个腾出空间,从而失去了冲突的细微差别。
作者将这种数值总和超过 100% 的状态称为"超真"(Hyper-Truth)。这并非谎言;这是一种表达方式,意为“这种情况如此复杂,以至于打破了正常的概率规则”。
他们做了什么
研究人员在 OpenAI 的 GPT 模型的四个不同版本(如 GPT-4 和 GPT-3.5)上测试了这种方法。他们向模型提出了 300 个问题,涵盖五个棘手的类别:
- 逻辑悖论(例如:“这句话是假的。”)
- 伦理矛盾(例如:“为了救命而撒谎是对的吗?”)
- 未来推测(例如:“明天会下雨吗?”)
- 模糊陈述(例如:“身高 5 英尺 10 英寸的人算高吗?”)
- 完全无知(例如:“星星的数量是偶数吗?”)
他们要求模型以两种方式回答:
- 旧方法:“饼图”(概率式),即所有内容必须总和为 1。
- 新方法:“三个旋钮”(中智逻辑),即它们的总和可以是任意值。
他们的发现
- “超真”效应:当被允许使用三个独立旋钮时,模型有**66%**的时间承认自己处于“超真”状态。这意味着它们经常声明一个陈述同时为真、为假且不确定。
- 伦理突破:这种效应在伦理矛盾中最为显著。在 95% 的道德困境问题中,模型同时将“真”和“假”旋钮调高。它们实质上是在说:“我清楚地看到了冲突,我无法只选择一方。”
- 旧方法掩盖了真相:当被迫使用“饼图”(旧方法)时,模型被迫抑制其困惑。“未知”旋钮被压低,以便为强制性的“真”或“假”答案腾出空间。研究人员发现,在无知案例中,旧方法掩盖了模型近 40% 的实际不确定性。
主要结论
该论文声称,当前的 AI 模型实际上非常擅长识别深层的冲突和悖论,但它们标准的“饼图”输出格式迫使它们隐藏这种复杂性。
通过切换到这种新的“三旋钮”系统(中智逻辑),我们可以获得对 AI 思维更诚实的解读。它允许 AI 说:“这是一个真理与 falsehood 碰撞的真正混乱局面”,而不是假装有一个简单的单一答案。
重要提示:作者谨慎地表示,他们并非声称 AI 拥有一个秘密的“灵魂”或隐藏的“超真”内部变量。他们只是表明,当你要求AI 描述其不确定性而不强迫其符合饼图时,它声明了一种更加丰富、更加复杂的心态,而旧规则原本阻止了它展示这种心态。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。