Agentic Context Learning with Self-Discovered Specification
本文指出,大语言模型上下文学习的主要挑战不仅在于获取内容,还在于获取分布在上下文中的隐式、特定于任务的规范,并证明了一种被称为 PSCI 的简单干预措施——通过对抗性检查来提取并强制执行这些规范——在 CL-Bench 基准测试上显著优于现有基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚拿到了一本长达 40,000 页的全新、超级复杂的电子游戏说明书。这本手册里充满了背景故事、角色传记和世界历史。接着,你的朋友问了一个简单的问题:“如果我跳过一个关卡会发生什么?”
你可能会认为,最难的部分是在这本巨著中找到答案。你会想:“如果我搜索‘跳过关卡’,我就能找到规则!”但转折在于:这篇论文指出,对于现代 AI 模型而言,真正的难题不是寻找答案(内容),而是寻找告诉你在如何正确编写该答案的游戏规则(规范)。
“差一点就成功”之谜
研究人员在名为 CL-Bench 的基准测试上对此进行了测试,该测试包含 1,899 个棘手的任务,AI 需要从长文本中学习新规则。结果令人惊讶。即使是最聪明的 AI 模型(如 GPT-5.1)也只能完美完成约 22.55% 的任务。
但当他们深入观察错误时,发现了一些奇怪的现象。AI 通常并不是把事实弄错了,而是把格式弄错了。
- 事实: AI 知道缺失的 ID 是“404”。
- 规则: 手册规定,“如果你看到缺失的 ID,你必须准确写入标记
Sequence_Gap_Warning。” - 错误: AI 写了“404”,但忘记了添加标记。
这是一个“差一点就成功”(near-miss)的情况。AI 知道内容,但忽略了局部规范。事实上,论文发现,测试中所有规则的 55.4% 都涉及这些特定的行为(格式、顺序、精确短语),而只有 22.6% 是关于事实内容的。
为什么“搜索”不起作用
一个自然的猜测是:“也许 AI 只是找不到手册中的正确页面。”因此,研究人员尝试了 12 种不同的方法来帮助 AI 更好地搜索,比如对文本进行摘要处理或提取相关片段。
结果呢? 没有任何一种方法效果良好。这些侧重于搜索的最优方法得分仍然仅在 23% 左右。这表明,仅仅找到正确的页面并不是问题所在。问题在于,规则通常隐藏在背景之中——比如一段关于“事件语义”的段落中的一个脚注——除非 AI 明确寻找它们,否则它不会意识到自己需要遵循这些规则。
“私人合同”解决方案
为了证明这一点,研究人员设计了一个简单的技巧,称为 PSCI(私人规范-合同归纳法)。你可以这样理解:
在 AI 尝试回答问题之前,他们强制它进行一次“赛前会议”。
- 归纳(Induce): AI 阅读整本手册,并写下它发现的所有隐藏规则的“私人合同”(例如,“规则 1:始终使用标记
Sequence_Gap_Warning”)。 - 生成(Generate): AI 写出它的答案,但它必须遵循那份合同。
- 检查(Check): 一个“裁判”(另一个 AI 步骤)根据合同检查答案。你使用了标记吗?你遵循了顺序吗?
- 修复(Repair): 如果裁判说“不”,AI 会在向你展示之前修正答案。
结果? 这个简单的四步过程将 GPT-5.1 的得分从 22.55% 提升到了 28.14%。这是 5.59 个百分点 的飞跃,在这一领域是非常巨大的。它在其他模型上也奏效了,例如 Qwen3.5-27B(从 14.14% 跳升至 19.42%)和 Gemini 3 Pro(从 16.14% 跳升至 22.31%)。
这排除了哪些可能性
论文非常明确地指出了哪些方法不起作用:
- 仅仅增加搜索: 向问题投喂更多的搜索工具并没有帮助。
- 仅仅加强思考: 使用原始 CL-Bench 评估中的“GPT 5.1 (High)”设置仅能让模型的得分达到 23.7%,这仍然低于 PSCI 技巧实现的 28.14%。
- 通用的检查清单: 如果你只是要求 AI 在没有先从当前特定语境中提取规则的情况下“检查自己的工作”,那是没有帮助的。规则必须是针对当前任务特定的。
他们有多确定?
作者对他们的发现非常有信心,因为他们进行了严格的测试。他们不仅仅是在猜测;他们运行了 17 种不同的“消融实验”(通过拆解方法来观察其有效性)。
- 他们证明了如果打乱规则(给 AI 一个错误的合同),得分会跌回 19.80%,这证明了规则必须与特定任务相匹配。
- 他们证明了如果跳过“合同”步骤,直接在生成答案后再要求 AI 检查自己的工作,则会失败。合同必须在生成答案之前写好。
- 他们甚至让专家检查了 100 个 AI 的答案。人类与计算机判断的一致性高达 96%,证实了 AI 确实是在变得更好,而不仅仅是在瞎猜。
核心结论
论文表明,对于 AI 要想从长文本中学习新规则,它不能仅仅做一个能找到正确书籍的好图书管理员。它需要成为一个阅读细则、写下规则合同、并在开展任何工作之前签署该合同的好律师。
虽然 28.14% 的得分是目前为止最好的,但作者指出这还不是一个“已解决”的问题。仍然有很多改进空间,特别是在“执行”部分——即确保 AI 真正遵循它为自己制定的合同。但主要的启示是明确的:上下文学习不仅仅是关于寻找答案,更是关于先发现游戏的规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。