Reasoning about Intent for Ambiguous Requests
本文提出了一种基于强化学习的方法,该方法通过生成单个结构化响应来列举针对歧义请求的多种有效解释,从而在无需额外交互轮次或显式监督的情况下提高覆盖率和透明度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个几乎无所不知的超级聪明机器人聊天。你问了它一个问题,但你忘记提一个小细节,比如年份或者某个东西的具体类型。在人工智能的世界里,这被称为“歧义”(ambiguity)。这就像是问朋友:“哪部电影最好看?”却没告诉他们你是想要恐怖片还是喜剧片。机器人必须猜测你的意思。通常情况下,它只会选一个猜测,给出答案,然后听天由命。如果它猜错了,你会得到一个令人沮丧的答案,或者更糟,如果机器人误解了你的意图,它可能会意外地给你一些危险的东西。这篇由爱丁堡大学研究人员撰写的论文,通过教机器人停止盲目猜测,转而开始一次性列出所有选项,来解决这种“猜错”的问题。
研究人员 Irina Saparina 和 Mirella Lapata 提出了一种处理这些棘手问题的新方法。他们的方法被称为 IntentRL,该方法不再让大型语言模型(LLMs)默默地致力于单一的解释,而是强迫它表现得像一个乐于助人的图书管理员,会说:“我看到你问的是‘最好的电影’。这里有三种理解方式:1)最好的恐怖片,2)最好的喜剧,以及 3)影史最伟大的电影。以下是针对每种情况的答案。”该论文建议,通过训练模型在单次生成中明确列出这些不同的含义及其对应的答案,我们可以避免混乱,并使 AI 更加安全和透明。他们在对话式问答和编写计算机代码(特别是用于数据库的 SQL 查询)等任务上测试了该方法,发现其方法比以往的技巧(如询问用户进行澄清或仅仅希望机器人能猜对)涵盖了更多的正确答案。
问题所在:机器人的“一锤子买卖”式猜测
想象一下你正在和机器人玩“二十个问题”的游戏。你说:“我在想一种红色的水果。”机器人立即大喊:“苹果!”然后就停下了。但是等等!你实际想的是草莓,或者是樱桃,甚至是一个红甜椒。机器人并没有问:“你是说浆果吗?”或者“你是说蔬菜吗?”它只是抓住了它数字大脑中跳出的第一个念头。
在现实世界中,这种情况经常发生。人们在与计算机交流时往往言简意赅或遗漏细节。用户可能会问:“显示预算为 2000 万美元的电影”,但他们可能指的是“既是恐怖片又是惊悚片的预算为 2000 万美元的电影”,也可能是指“要么是恐怖片要么是惊悚片的预算为 2000 万美元的电影”。如果机器人选错了意思,答案就毫无用处。更糟糕的是,如果机器人是一个“推理模型”(即进行长时间思考的模型),它可能会浪费数千个“Token”(它思考步骤的单位)去追逐错误的想法,从而浪费能量并强化自身的错误。
旧方法:询问或长篇大论
在此方法出现之前,科学家们尝试过两种主要方式来解决这个问题:
- 澄清问题: 机器人停下来问:“你是说恐怖片还是惊悚片?”这虽然有效,但很烦人。它把一个快速的问题变成了一场冗长的、来回不断的对话。这就像每次你问水果时,你的朋友都会问:“等等,你要的是红苹果还是红草莓?”
- 长篇回答: 机器人试图通过写一段巨大的段落来涵盖所有内容来表现得超级热心。“好吧,如果你指的是恐怖片,它是 X。如果你指的是惊悚片,它是 Y。如果你两者都要,它是 Z。”这通常显得杂乱且难以阅读。这就像一个朋友为了回答一个简单的问题而给了你一篇 10 页的文章。此外,如果含义之间存在矛盾(比如“显示既是恐怖片又是惊悚片的电影”与“显示要么是恐怖片要么是惊悚片的电影”),很难将它们揉合成一个流畅的故事。
新方案:“菜单”式方法
论文作者提出了第三种方法:结构化菜单。机器人不再是猜测或长篇大论,而是生成一个整齐的“解释-答案对”列表。
把它想象成在一家菜单具有歧义的餐厅点餐。如果你说“我要那个特餐”,而特餐可能是汉堡也可能是沙拉,普通的服务员可能会直接给你一个汉堡。然而,IntentRL 机器人会为你端来一个托盘,上面有三个小盘子:
- 盘子 1: “如果你指的是汉堡特餐,这是你的汉堡。”
- 盘子 2: “如果你指的是沙拉特餐,这是你的沙拉。”
- 盘子 3: “如果你指的是汤品特餐,这是你的汤。”
机器人在单一步骤中完成这一切。它不会等待你说“不,我要的是沙拉”。它只是清晰地标注并一次性给出所有选项。这非常好,因为:
- 透明度: 你可以看到它为什么给出那个答案。
- 速度: 无需等待第二轮对话。
- 安全性: 如果其中一个答案是危险的,你可以通过看到其他选项立即发现它。
他们是如何教机器人的:“双重目标”游戏
教机器人这样做非常困难。你不能只给它看问题和答案的列表,因为机器人需要学习何时列出多个选项,以及何时只给出一个答案。如果你教它总是列出五个选项,那么当你问一个简单问题如“2+2 等于多少?”时,它会让你感到厌烦。
研究人员使用了一种叫做强化学习(可以理解为用零食训练狗)的技术。他们给了机器人一个特殊的“双重奖励”系统:
- “全覆盖”奖励(召回率): 如果问题具有歧义(例如“其他国家是如何统治它的?”),如果机器人列出了所有可能的有效答案,它会得到一个大奖赏。这就像钓鱼游戏,如果你能钓到池塘里所有的鱼类,你就能得分,而不只是钓到一种。
- “精准度”奖励: 如果问题很明确(例如“法国的首都是哪里?”),如果机器人只给出那一个正确答案,它会得到奖励。如果它试图列出五个不同的首都,它将得不到奖励(或受到惩罚)。
至关重要的是,他们不需要教机器人什么是“解释”。他们只需要提供正确答案的列表即可。机器人通过尝试最大化它的奖励,自己摸索出了剩下的部分。它学会了说:“嗯,这个问题可能意味着 A、B 或 C。为了保险起见,我会把这三个都列出来,”或者“这个问题很简单。我会直接给出唯一答案。”
结果:明显的胜出者
团队在两种不同类型的任务上测试了这种新方法:
- 对话式问答: 基于故事或对话回答问题。
- Text-to-SQL: 将英语问题转化为计算机代码(SQL)以查询数据库。
他们将该方法(IntentRL)与以下方法进行了对比:
- 仅仅让机器人猜测(提示词工程/Prompting)。
- 通过展示示例来教机器人(监督微调/Supervised Fine-Tuning)。
- “澄清问题”法(询问用户)。
- 超智能的闭源模型(如 GPT-5.4 和 Gemini 2.5 Pro)。
研究结果令人惊讶:
- 更好的覆盖率: 在歧义案例中,IntentRL 找到了正确答案(全覆盖),达到了 74.1%,而表现最好的闭源模型仅能达到约 16%。即使是那些“思考型”模型(花费大量时间进行推理的模型)也没能比标准模型做得更好多少。
- 没有“过度思考”: 研究人员发现,仅仅让机器人“思考”更久并不能帮助它找到更多答案。机器人往往会卡在同一个错误的思路上。而 IntentRL 则学会了系统地探索不同的路径。
- 泛化能力: 当他们在一种全新的、从未见过的数据库上测试时,IntentRL 仍然表现良好。其他方法(如标准训练)失败了,因为它们只是记住了旧的数据库模式。这表明 IntentRL 学到的是一种通用的技能——“思考用户的意图”,而不是仅仅记忆答案。
- 人类认可度: 当人类查看机器人的答案时,他们认为这些解释在 90% 的情况下都是合理的。机器人并不是在随机列出清单;它实际上是在解释其逻辑。
这对未来意味着什么
论文指出,处理歧义的关键不在于让机器人变得更大或更聪明,也不在于让它“思考得更久”。关键在于教它推理意图。通过强迫模型生成一个结构化的可能性列表,我们得到了一个对自己的已知和未知更加诚实的系统。
作者指出,虽然他们的方法很棒,但并不完美。有时机器人会列出太多选项(最多 5 个),对于极其模糊的问题,人类可能仍需介入。此外,他们还没有测试人类是否更倾向于这种“菜单式”风格而非简单的对话,尽管他们怀疑这在编写代码等技术任务中会非常有用。
简而言之,这篇论文表明,通过教 AI 说:“这是我对你问题的所有理解方式,以及针对每种情况的答案”,我们可以构建出不太容易误解我们、不太容易浪费时间,并且从长远来看更有帮助的机器人。这是一种从“猜测并希望”到“列出并澄清”的转变,而且是在单一步骤内高效完成的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。