CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps
本文介绍了 CRiT-QA,这是一个旨在通过采用反事实链来消除对参数化知识的依赖,并利用干扰项陷阱来防止捷径利用,从而通过严苛评估大语言模型的多跳推理能力,进而揭示其与标准基准测试相比存在的显著性能差距的新型数据集。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一场高水平的“侦探”游戏,但你手里拿的不是放大镜,而是一个读过几乎所有书籍的超级聪明机器人朋友。你给机器人一个谜题去解决,比如:“是谁创立了发行电影《UHF》的那家公司?”
在过去,如果你给机器人一叠纸张(即“上下文”)来解决这个谜题,它通常会完全忽略这些纸张。它会闭上眼睛,从它在训练过程中学到的庞大事实记忆库中提取信息,然后大喊出答案:“Mike Medavoy!”它答对了,没错,但它是通过作弊——利用它自己的记忆——而不是通过阅读你给它的线索来完成任务的。这就像一个学生在历史考试中通过背诵答案来取得高分,而不是通过阅读你交给他们的教科书章节。
还有时候,机器人会尝试阅读,但它会采取一种偷懒的捷径。如果问题是“Mark Dismore 的出生地是在哪个县?”,而第一段提到了“Hancock 县”,机器人就会直接抓取那个词,因为它与问题中的“县”字匹配。它跳过了连接不同段落以寻找真实出生地的艰苦过程。这就像是通过猜测墙壁的颜色来解决迷宫,而不是真正走完路径。
重大揭晓
这篇论文的作者 JungMin Yun 及其同事决定构建一个更高级、更严苛版本的“侦探”游戏,称为 CRiT-QA。他们的主要发现是,当他们让最优秀的机器人参加这个新的、充满陷阱的游戏时,机器人的表现大幅下滑。即使是那些通常能拿 A+ 的顶尖模型,如 GPT-4o 和 Gemini-2.5-Pro,也突然陷入了挣扎。它们从“优等生”跌落到了勉强及格的水平,证明了它们之前的成功往往只是一种视觉错觉。
他们是如何戏弄机器人的
为了抓住机器人的把柄,研究人员使用了两个聪明的陷阱:
“如果……会怎样”陷阱(反事实): 想象机器人的记忆告诉它“天空是蓝色的”。但在新的游戏中,研究人员改写了故事,在这个特定的宇宙里,“天空实际上是绿色的”。如果机器人依赖其旧记忆,它会说“蓝色”并失败。要赢,它必须忽略自己的记忆,严格遵循提供的这个奇怪的新故事。研究人员发现,当他们用这些“如果……会怎样”的情景替换掉真实事实时,机器人变得困惑了。例如,一个名为 Qwen2.5-7B 的模型在面对这些虚假事实时,得分从普通测试中的 34.96 降至仅 24.77。
“假线索”陷阱(干扰项): 这就像是在雪地上留下许多假的脚印。研究人员添加了一些看起来极其像正确线索的额外段落。它们拥有正确的词汇类型(比如人名或地点),但却指向错误的答案。这就像是一张地图上有十条看起来都通往宝藏的路径,但只有一条是真的。习惯于走捷径的机器人迷失在了噪音中。当他们在这些“如果……会怎样”的故事中加入这些假线索时,分数进一步暴跌。Qwen2.5-7B 的得分骤降至 19.30。
步骤越多,难度越大
研究人员还注意到一个可怕的现象:线索链条越长,机器人的表现就越差。
- 2-hop 问题(两步解题)还可以;
- 3-hop 问题(三步解题)变得更难;
- 4-hop 问题(四步解题)简直是一场灾难。
例如,开源模型 LLaMA-3-8B 在 2 步问题上的准确率是 28.91,但在 4 步问题上崩溃到了 10.18。这就像机器人可以解决简单的谜题,但一旦谜题增加了几块碎片,它就完全忘记了如何玩游戏。研究人员通过在 2-hop、3-hop 和 4-hop 问题上进行测试来衡量这一点,结果显示随着推理深度的增加,性能呈现持续下降的趋势。
这意味着什么(以及不意味着什么)
论文并不是说机器人永远“坏掉了”。它表明我们之前对它们太宽容了。我们一直在给它们一些可以通过记忆或模式猜测来作弊的测试。这个新的 CRiT-QA 数据集就像一位严厉的老师,在说:“不要背诵,不要猜测。展示你的解题过程,且仅使用我给你的线索。”
作者非常确定这一点:他们测量了分数,运行了实验,并看到了数字的下降。他们不仅仅是在猜测机器人很弱,他们有数据证明这一点。然而,他们也承认,他们的新测试是基于一种特定类型的谜题(MuSiQue 数据集)构建的,因此我们还不知道这种情况是否会发生在世界上每一种类型的问题上。他们还指出,由于他们使用了另一个机器人来编写假线索,因此存在一种微小的可能性,即机器人可能会识别出“机器人笔迹”并将其作为一种新的捷径,这也是他们未来需要修复的地方。
底线
目前,我们的许多智能 AI 模型就像是背熟了剧本但并不理解剧情的演员。当剧本发生轻微变化或舞台上布满了假道具时,它们就会僵住。CRiT-QA 是一个新的舞台,迫使它们真正阅读剧本并思考,证明了尽管拥有强大的力量,但在真正像侦探一样推理方面,它们仍有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。