Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
本文提出了信念增强生成(BAG)框架,该框架利用大语言模型基于多个采样响应所推导出的自身信念状态,自主决定在模糊对话中是回答、澄清还是保持沉默,从而相较于标准提示方法提升准确性与策略忠实度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《澄清、回避还是回答?与信念增强生成进行对话的策略》的通俗解释,辅以生动的类比。
核心问题:“过度自信”的 AI
想象一下,你向一个大语言模型(LLM)问了一个棘手的问题,比如:“谁演唱了《Gimme Shelter》中的女声部分?”
如果你问的是标准 AI,它通常会直接选择一个答案,并满怀信心地给出,哪怕它其实是在猜测。它可能会说:“是梅丽·克莱顿(Merry Clayton)”,却意识不到如果你指的是现场巡演版本,答案实际上是“丽莎·费舍尔(Lisa Fischer)”。AI 并不知道自己不确定;它只是表现得像个万事通。
研究人员发现,这些模型很少会说“我不确定你指的是哪一个”或“我不知道答案”。它们只是盲目猜测。
解决方案:“信念增强生成”(BAG)
作者提出了一种新方法,称为信念增强生成(Belief-Augmented Generation, BAG)。你可以把它想象成让 AI 在开口说话前,先有一个“思考室”。
AI 不再只生成一个答案,而是被要求先为同一个问题生成10 个不同的可能答案。然后,它审视这份包含 10 个答案的列表(论文称之为"信念状态"),并自问:“这 10 个答案告诉了我关于我确信程度的什么信息?”
基于它在列表中看到的内容,AI 会选择以下三种策略之一:
- 直接回答:如果 10 个答案基本一致(例如,10 个都说“梅丽·克莱顿”),AI 就知道自己很有把握。它会直接给出答案。
- 类比:这就像陪审团,10 名陪审员对裁决意见完全一致。陪审团团长只需宣布结果。
- 澄清:如果 10 个答案分裂成两个截然不同的群体(例如,5 个说“梅丽·克莱顿”,5 个说“丽莎·费舍尔”),AI 就会意识到问题存在歧义。它不会猜测,而是向用户寻求澄清。
- 类比:这就像服务员听到顾客点了“特色菜”,但看到菜单上有两道不同的特色菜。服务员不会猜测,而是会问:“您指的是牛排还是鱼?”
- 回避(说“我不知道”):如果 10 个答案杂乱无章且相互矛盾(例如,一个说“梅丽·克莱顿”,另一个说“披头士乐队”,还有一个说“一个机器人”),AI 就会意识到自己缺乏事实依据。它会礼貌地拒绝回答。
- 类比:这就像侦探发现了 10 个不同的嫌疑人,却没有任何证据能将其中任何一人与罪行联系起来。侦探会承认“我暂时无法破案”,而不是随意逮捕一个人。
他们如何测试
研究人员在“歧义问题”数据集(即可能具有多种含义的问题)上测试了这种方法。他们比较了:
- 标准 AI:直接给出答案。
- 仅提示 AI:被要求“小心”,但看不到自己的猜测列表。
- BAG AI:能看到自己的 10 个猜测列表,并据此进行推理。
结果
- 更高的准确率:BAG 方法提高了六个不同 AI 模型的答案准确率。
- 更明智的选择:BAG AI 在知道何时提问和何时承认自己不知道方面表现要好得多。标准 AI 几乎从不寻求帮助或承认无知。
- 忠实度:BAG AI 的选择与其内部的“置信度”(即其 10 个猜测的多样性)的匹配程度,远优于其他方法。如果它感到困惑,它就会表现出困惑;如果它很确定,它就会表现出确定。
局限性
虽然该系统运作良好,但 AI 仍然难以完美区分:
- 真正的歧义:“我不知道你指的是电影还是书。”(需要澄清)。
- 幻觉:“我在编造事实,因为我不知道。”(需要回避)。
有时,AI 会认为一个问题存在歧义,而实际上它只是在胡编乱造,反之亦然。但总体而言,让 AI 在开口前有机会“审视自己的工作”,使其成为了一个更诚实、更有帮助的对话伙伴。
总结
这篇论文提出了一种方法,使 AI 模型不再过度自信。通过迫使它们先生成多个答案,然后分析差异,模型学会了在困惑时澄清,在无知时回避,只有在确定时才回答。这使它们在处理棘手、现实世界的问题时更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。