← 最新论文
💬 NLP

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

本文通过揭示主流评估未能控制任务位置,导致任务置于长上下文中间时因填充干扰而出现显著性能下降,暴露了长上下文推理基准测试中的关键缺陷,并提出了上下文旋转评估(CRE)框架以解决这一结构性盲点。

原作者: Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心概念:“中间座位”问题

想象一下,你让一位非常聪明的学生解一道数学题。你给 TA 一本厚重的教科书(即“上下文”),长达 64,000 页。

  • 旧方法: 如果你把数学题放在书的最后一页,这位学生几乎每次都能答对。
  • 新发现: 这篇论文发现,如果你把同一道数学题移到书的中间,这位学生突然就忘了怎么解题。他们的正确率可能从 96% 暴跌至仅 8%。

作者将这种现象称为**“位置失效”。他们认为,虽然我们有很好的测试来检查学生能否在书中找到特定事实(如“大海捞针”测试),但我们尚未测试他们能否在长文本的中间对问题进行推理**。

调查:审计现有测试

研究人员像侦探一样,审查了 11 种流行的用于评估 AI 模型的“长上下文”测试。

  • 发现: 这些测试都没有控制问题的放置位置。它们只是使用自然文档,问题恰好出现在开头、中间或结尾纯属偶然。
  • 厂商核查: 他们还查看了四家主要 AI 公司(DeepSeek、MiMo、Kimi、GLM)的官方“成绩单”(模型卡片)。
    • 结果: 这些公司在粗体大表中自豪地展示了他们在编码和智能体任务(如“你能写一个程序吗?”)上的得分。
    • 盲区: 他们几乎从不展示“位置控制推理”的得分。他们掩盖了这样一个事实:当问题位于长文档中间时,他们的模型可能会惨败。

实验:“上下文腐烂”测试

为了证明这并非偶然,作者构建了一个名为**CRE(上下文腐烂评估)**的新测试。这可以看作是对 AI 注意力跨度的一次压力测试。

他们选取了两类问题:

  1. 数学问题(GSM8K)
  2. 科学选择题(ARC-Challenge)

随后,他们创建了三种不同的“背景噪音”场景(填充内容),以观察什么会分散 AI 的注意力:

  • “作业帮手”(with_solutions): 背景文本包含其他带有完整答案的数学题。
  • “未回答问题”(questions_only_v2): 背景文本包含其他没有答案的数学题。
  • “随机噪音”(neutral_text): 背景文本仅是关于猫和历史的随机维基百科文章。

他们在三种不同的“书本长度”(8K、32K 和 64K 令牌)下测试了 9 种不同的 AI 模型。

惊人的结果

结果表明,有些模型极其脆弱,而另一些则很坚韧。

1. “中间座位”崩溃
对于某些模型(如MiMo-v2-Flash),将问题从书的末尾移到中间会导致性能大幅下降。

  • 在 64K 长度且带有“作业帮手”噪音的情况下,该模型下降了88 个百分点。它从天才(96% 准确率)变成了勉强及格(8% 准确率),仅仅因为问题移到了中间。
  • 原因? 论文发现,当模型在中间失败时,它往往从背景噪音中复制了错误的答案。这就像学生被主问题旁边的其他作业题搞糊涂了一样。

2. “免疫”模型
并非所有模型都失败了。当噪音是“作业帮手”时,DeepSeek-V3.2几乎免疫于这个问题。无论问题在末尾还是中间,它都能答对。然而,当噪音是“未回答问题”时,即使是这个强大的模型也开始挣扎。

3. “新”模型
作者测试了来自同一家公司的四款全新升级模型。

  • 好消息: 它们在处理中间的“作业帮手”噪音方面略有改善。
  • 坏消息: 它们在处理中间的“未回答问题”方面仍然表现糟糕。问题并未解决,只是改变了形态。

“魔术”诊断

为了证明这真的是关于位置的问题,而不仅仅是模型“笨”,研究人员做了一个小把戏。

  • 他们将数学题放在中间(模型通常会失败的地方)。
  • 然后,他们将完全相同的问题复制并粘贴到书的末尾
  • 结果: 突然之间,模型又答对了!

这证明模型知道如何解题。它只是无法在问题被埋在中间时找到它或集中注意力。这就像一个人如果谜题放在桌上就能解开,但如果你把它埋在文件堆下,他就会忘记自己拥有它。

结论

这篇论文得出结论:目前我们测试 AI 的方式是有缺陷的。

  • 差距: 我们只测试 AI 在长文档的“边缘”(即它们表现良好的地方)。我们忽略了它们经常失败的“中间”部分。
  • 风险: 如果一家公司声称“我们的 AI 在长文档上准确率达到 95%",但他们只测试了位于末尾的问题,那么这个数字是具有误导性的。对于重要信息被埋在中间的现实世界任务,该 AI 可能毫无用处。

简而言之: 仅仅因为 AI 能读长书,并不意味着它能找到书中间的答案。我们需要开始测试“中间”部分,以真正了解这些模型究竟有多聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →