← 最新论文
💬 NLP

Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reasoning Models

本文介绍了结构化无知证书(Structured Ignorance Certificates, SICs),这是一种 JSON 格式的输出模式及相关的训练方法,该方法利用一种新颖的跨领域“未知-未知”(Unknown-Unknown)数据集和 GRPO 微调,使推理模型能够显式地识别并结构化其知识空白,而非幻觉出答案,从而实现高有效性和改进的检索增强生成。

原作者: Subramanyam Sahoo

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Subramanyam Sahoo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、非常爱聊天的机器人朋友。这个机器人几乎读遍了互联网上的所有内容。但问题在于:当你问它一个它不知道答案的问题时,它并不会说“我不知道”。相反,它会自信满满地编造一个听起来完美无瑕但完全错误的故事。这就像一个学生在做数学题时,如果不知道答案,就随便写个数字,希望能瞒过老师。

这篇论文讲的是如何教会这个机器人一种新的超能力:承认自己确实一窍不通的能力,并且能够准确解释为什么自己一窍不通。

以下是他们实现这一目标的详细过程,使用了简单的类比:

1. 问题所在:“未知的未知”(Unknown Unknowns)

把知识想象成一张地图。

  • 已知的未知(Known Unknowns): 你知道地图上有一个洞。你知道自己不知道去下一个城镇的路怎么走。机器人通常可以表达:“我不确定那个。”
  • 未知的未知(Unknown Unknowns): 这是最可怕的部分。这是一个你甚至不知道存在的地图上的洞。机器人甚至没有意识到信息缺失了,所以它会凭空捏造一条虚假的道路来填补这个空白。

研究人员专注于这些“未知的未知”——即混合了两个不同领域的问题(比如询问生物学如何影响经济学)。这些问题非常棘手,因为机器人从未见过这种特定的组合,所以它会试图伪造一个答案。

2. 解决方案:“结构化无知证明书”(Structured Ignorance Certificates, SICs)

研究人员并没有让机器人去瞎猜,而是给了它一本严格的规则手册。他们说:“如果你不知道答案,你必须填写一份名为‘结构化无知证明书’(SIC)的特定表格。”

这不仅仅是说“我不知道”。这是一个包含四个特定栏目的数字表单,机器人必须填写完毕:

  1. 缺失的部分: 是什么具体的知识缺口导致了这个问题?(例如:“我不知道空间法如何应用于物理学。”)
  2. 缺失的工具: 我需要哪些具体的概念才能解决这个问题?(例如:“我需要了解《外层空间条约》和轨道力学。”)
  3. 搜索查询词: 如果我有搜索引擎,我会输入哪些精确的关键词来寻找答案?
  4. 置信水平: 我对自己的“无知”有多大的把握?

通过强制机器人填写这份表单,它停止了幻觉(编造事实),开始表现得像一位专业的图书管理员,会说:“我无法回答这个问题,但我可以告诉你需要查阅哪些具体内容来找到答案。”

3. 他们是如何训练机器人的

为了教会机器人这种新行为,研究人员必须建立一个特殊的训练营。

  • 测试问题: 他们拿了一个聪明的机器人(Qwen3-14B),并让它发明了 7,347 个混合了两个不同学科的棘手问题(比如“病毒如何影响股市?”)。这些就是“未知的未知”问题。
  • 奖励机制: 他们使用了一种叫做 GRPO(组相对策略优化)的训练方法。想象一个游戏,机器人可以通过以下行为获得积分:
    • 正确填写表单(符合有效的 JSON 格式)。
    • 命名具体的、有用的概念(而不是笼统的概念)。
    • 编写一个确实能找到答案的搜索查询词。
    • 失去 分数(如果它试图编造答案)。

4. 结果

训练完成后,他们在新的、棘手的、机器人从未见过的题目上对其进行了测试。结果令人印象深刻:

  • 99.5% 的成功率: 机器人几乎总是遵循规则并正确填写表单,而不是编造答案。
  • 更好的搜索查询词: 机器人编写的“搜索查询词”比未经训练的机器人所猜测的要好得多。
  • “分歧”测试: 研究人员使用了一个巧妙的技巧来检查机器人是否真的在“思考”它的无知。他们用不同的方式询问同一个问题。如果机器人只是在瞎猜,它会给出不同的答案。如果它是在真正承认无知,它会一致地表示:“我不知道,这是我的表单。”经过训练的机器人通过了这项测试,证明它确实学会了这种行为。

总结

这篇论文表明,我们可以训练 AI 在不知道某些事情时停止自信地撒谎。AI 不再是靠猜测,而是学会了递给你一份“无知证明书”,清晰地解释它缺少什么以及如何找到真正的答案。它将一个“自信的骗子”变成了一个“诚实且乐于助人的向导”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →