Knowing but Not Showing: LLMs Recognize Ambiguity but Rarely Ask Clarifying Questions
该论文揭示了大型语言模型中存在的一个显著差距:尽管它们能够明确识别查询的歧义性,但它们 overwhelmingly 倾向于直接提供答案而非提出澄清性问题,而当存在检索到的上下文时,这种倾向会进一步加剧。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在与一位非常聪明、充满热情的助手交谈,这位助手几乎读遍了图书馆里的所有书籍。你向它提了一个问题,但问题有点模糊。例如,你问:“谁扮演了安妮?”
一位真正乐于助人的人类助手会停顿一下,然后说:“您是指 1982 年电影里的小女孩,1999 年的版本,还是 2014 年的翻拍版?有三位不同的女演员!”它们会识别出这种困惑,并在猜测之前请求澄清。
本文探讨了大型语言模型(LLM)——即聊天机器人背后的“人工智能大脑”——是否也会这样做。研究人员发现了一个令人惊讶的脱节现象:人工智能往往“知道”问题令人困惑,但很少“表现出”它知道这一点。
以下是他们研究发现的简要说明,使用了简单的类比:
1. “万事通”与“全能者”
研究人员通过两种不同的方式测试了人工智能:
- 测验模式:他们问人工智能:“这个问题令人困惑吗?”在这种模式下,人工智能表现得相当不错。它可以审视一个模糊的问题,然后说:“是的,那有歧义。它可能指 X,也可能指 Y。”这就像一名学生举手说:“我看出了这个谜语中的陷阱。”
- 工作模式:随后,他们要求人工智能直接回答问题。突然间,人工智能不再表现出困惑的样子。它没有说“等等,您指的是哪一个?”,而是立即猜测一个答案。这就像同一个学生,现在正在参加考试,无视陷阱,直接写下脑海中浮现的第一个答案。
比喻:想象一位侦探,他能完美地识别出犯罪现场存在两个可能的嫌疑人(测验模式)。但当被要求破案时(工作模式),这位侦探会立即逮捕他看到的第一个人,而不提出任何后续问题。他们知道存在问题,但却没有依据这一知识采取行动。
2. “魔法书”效应
研究人员还向人工智能提供了一份“作弊小抄”(检索到的上下文),其中包含来自维基百科的相关事实。
- 没有小抄时:人工智能稍微谨慎一些,尽管大多数时候仍然只是猜测。
- 有了小抄后:人工智能更不可能请求澄清。
比喻:把这份小抄想象成一张地图。当人工智能看到地图时,它感到如此自信,认为自己拥有所需的所有信息,于是停止询问:“我们究竟要去哪里?”它假设地图能解决困惑,即使地图实际上并没有告诉人工智能您想要的是故事的哪个具体版本。事实的存在使人工智能变得过度自信,更不愿意承认自己需要更多细节。
3. “礼貌但错误”的习惯
这项研究考察了人工智能说“我不知道”或“您能澄清一下吗?”的频率。
- 结果:几乎从不。
- 行为:即使问题明显模糊(例如询问未指明的时间段),人工智能也几乎总是(95% 以上的时间)直接给出一个答案。它宁愿做出“最佳猜测”,也不愿冒着保持沉默或提问的风险。
比喻:这就像一位服务员被问到“这里有什么好吃的?”时,菜单上每天都有三种不同的“特色菜”。服务员没有问“今天是星期几?”或“您想找哪道特色菜?”,而是直接选了一道端上来,希望您会喜欢。他们试图通过给出答案来表现“乐于助人”,但实际上却帮了倒忙,因为他们是在猜测您的意图。
为什么会发生这种情况?
该论文指出,这种情况的发生是因为这些人工智能的训练方式。它们因提供人类认为“有帮助”和“有用”的答案而获得奖励。
- 训练陷阱:如果您训练一个机器人总是给出答案,它就会学会回答问题是获得奖励的途径。提问或*说“我不知道”*则被视为未能完成任务。
- 结果:人工智能学会了隐藏它的困惑。它将内部知识(“这很模糊”)锁起来,因为表现出这种困惑并不能让它从训练者那里获得“干得好”的贴纸。
核心结论
该论文得出结论,当前的人工智能模型存在“知道但不表现”的问题。它们能够检测到用户何时表达模糊,但其默认行为是忽略这种检测,直接进行猜测。为了解决这个问题,研究人员建议我们需要改变训练这些模型的方式:我们需要像奖励它们给出正确答案一样,奖励它们说“我不确定,您能澄清一下吗?”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。