Hallucinations Undermine Trust; Metacognition is a Way Forward
该论文认为,提升生成式人工智能的可信度需要从单纯扩展事实知识转向增强元认知能力,具体而言,即通过教导模型表达“可信的不确定性”来区分已知事实与自信的谬误。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和日常类比对这篇论文的解读。
核心问题:那个“无所不知”的撒谎者
想象一个几乎读遍了图书馆所有书籍的学生。他极其聪明,能回答几乎所有问题。但有时,当他不知道答案时,他不会说“我不知道”,而是自信地编造一个听起来完美的故事。
在人工智能领域,这被称为幻觉。论文认为,即使是我们最聪明的人工智能模型,也像这个学生一样。它们非常擅长记忆事实(扩展知识),但极不擅长知道何时自己是在猜测。它们经常以百分之百的自信提供错误答案,这会让用户在不应信任时误信它们。
旧方法:“全有或全无”的陷阱
长期以来,研究人员试图通过教导人工智能做到完美来解决这个问题。他们设定了一条规则:“如果你不是百分之百确定,就保持沉默。”
论文将这种现象称为**“效用税”**。
- 类比:想象一位医生,因为太害怕犯错,除非对诊断绝对确定,否则拒绝治疗任何人。
- 结果:这位医生(或人工智能)变得非常安全(没有误诊),但也变得毫无用处,因为他们停止帮助那些真正需要帮助的人。为了消除所有错误,人工智能必须停止回答大多数问题,即使那些问题它本可以正确回答。
新想法:“忠实的不确定性”
作者们提出了一种不同的问题思考方式。我们不应该试图阻止人工智能犯错,而应该教导它诚实地表达自己有多确定。
他们称之为忠实的不确定性。
- 类比:想想天气预报员。
- 旧人工智能:“明天会下雨。”(即使他们只有 50% 的把握,也说得像事实一样)。
- 忠实的人工智能:“明天有 50% 的概率下雨,所以你最好带把伞以防万一。”
- 转变:论文认为,只有当错误伴随着虚假的自信被传达时,它才是危险的。如果人工智能说“我认为这是真的,但我不是百分之百确定”,它就不再是“幻觉”,而是一个假设。用户随后可以决定是信任它还是进行双重检查。
为什么这行得通(“元认知”部分)
论文引入了元认知的概念。这是一个 fancy 的词汇,意为“思考你自己的思考”。
- 问题:当前的人工智能就像一辆蒙着眼睛驾驶的汽车。它们只是继续向前开(生成文本),而不检查自己是否走在正确的道路上。
- 解决方案:元认知就像摘下眼罩,让司机查看后视镜。人工智能在开口说话之前,需要检查其内部的“置信度计”。
- 如果仪表显示“高置信度”,它就清晰地说话。
- 如果仪表显示“低置信度”,它就使用保留语(例如“我相信”、“似乎”、“我不确定”)。
论文声称,这对人工智能来说实际上比做到完美更容易学习。人工智能不需要知道宇宙的“真理”;它只需要知道它自己感觉有多确定。
未来:作为智能助手(智能体)的人工智能
论文还展望了人工智能使用工具(如搜索互联网)的未来。
- 陷阱:有些人认为,“如果人工智能可以随便谷歌搜索一切,为什么它还需要知道自己不知道什么?”
- 现实:如果没有“元认知”,人工智能就像一个连已知事物都要去谷歌搜索的人,或者宁愿相信一个可疑网站也不相信自己的记忆。
- 修正:具备“元认知”的人工智能知道何时停下来思考,何时使用工具。它充当控制层。它会说:“我不确定这个事实,所以我会去搜索它”,或者“我知道这个事实,所以我不需要搜索”。
论文建议总结
作者们告诉研究人员,停止试图强迫人工智能做到完美(这会让它变得无用),转而开始尝试让它变得诚实。
- 停止“沉默”策略:不要只是让的人工智能拒绝回答。让它回答,但要说“我不确定”。
- 衡量“诚实度”,而不仅仅是“准确性”:我们需要测试人工智能的置信度是否与其实际知识相匹配,而不仅仅是最终答案是否正确。
- 接受权衡:我们无法拥有一台既百分之百正确又百分之百有用的全天候人工智能。但我们可以拥有一台既乐于助人又能准确告诉我们何时可能出错的人工智能。
简而言之:论文建议我们停止将人工智能视为一个绝不能犯错的上帝,转而将其视为一个聪明但对未知保持诚实的乐于助人的人类。这比假装无所不知更能建立信任。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。