Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
本文通过提出一个考虑预训练数据的鲁棒评估基准,并引入一种通过检索该预训练数据来增强模型诚实性的新方法,来解决大语言模型幻觉问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个才华横溢但过度自信的学生,名叫“LLM”,他在训练期间读了数十亿本书。这个学生非常擅长回答问题,但他有一个致命的缺陷:他不知道自己“不知道”。当被问及一个他从未见过的课题时,他不会说“我没听说过那个”,而是会自信满满地编造一个故事。在人工智能的世界里,这被称为幻觉(Hallucination)。
你分享的这篇论文认为,为了让 AI 变得值得信赖,我们需要教会它区分“我知道这个”和“我不知道这个”。以下是他们解决方案的拆解,使用了简单的类比。
问题所在:“黑盒”盲点
通常,当研究人员试图测试 AI 是否诚实时,他们会将 AI 视为一个黑盒。他们向 AI 提问并观察它的回答,但并不确切知道 AI 为了学习这些事实到底读了哪些书。
- 缺陷: 如果 AI 回答错误,研究人员会假设 AI “不知道”答案。但也许 AI 确实 在其训练书籍中读到了答案,只是忘记了或者搞混了。
- 结果: 之前的测试是不公平的,因为它们无法分辨 AI 是在撒谎(幻觉),还是仅仅因为“状态不佳”(遗忘)。
解决方案:“开卷”方法
作者使用了一个特殊的开源 AI 模型,叫做 Pythia。其核心优势在于?我们拥有这个 AI 所读过的整个图书馆。
- 类比: 想象给这个学生一份他所学习过的每一本书的具体清单。现在,当你问一个问题时,你实际上可以去检查图书馆,看看:“这个学生是否读过这个问题的答案?”
- 新的基准: 他们创建了一个新的测试(称为 TIP-TRIVIAQA),在这个测试中,我们明确知道哪些问题是 AI 应该 知道的(因为答案就在其训练书籍中),以及哪些是它 不应该 知道的(因为其书籍中完全没有相关内容)。这创造了一个公平的竞技场来衡量诚实度。
方法论:“图书管理员”系统 (RETAIN)
为了提高 AI 的诚实度,作者并没有仅仅告诉它要“诚实”。他们构建了一个名为 RETAIN 的三部分系统,其作用就像一个聪明的图书管理员:
检索器 (The Retriever - 搜索者):
当用户提出问题时,这个代理会立即进入 AI 的“图书馆”(其预训练数据)中寻找答案。这就像图书管理员从书架上取下书籍,以查看答案是否存在。可回答性分类器 (The Answerability Classifier - 守门员):
这个代理会检查图书管理员找到的书籍。它会问:“这本书真的包含答案吗?”- 如果是: 它将书籍传递给下一个代理。
- 如果否: 它会停止处理过程,并告诉 AI:“我们的图书馆里没有这个答案。请说‘我不知道’。”
响应器 (The Responder - 发言者):
这是实际与你交流的 AI。只有当守门员给出绿灯并提供一本相关的书供其阅读时,它才会说话。如果守门员说“不”,响应器只会简单地说:“我不知道。”
为什么这有效
研究发现,这种方法比以往的技巧要好得多。
- 旧方法: 仅仅告诉 AI“如果你不确定,就说‘我不知道’”效果并不好。AI 仍然会尝试进行猜测。
- RETAIN 方法: 通过先进行物理层面的资料检索,AI 有了一个“现实检查”。它可以意识到:“哦,我的书里没有这个答案,”因此它能诚实地承认自己不知道。
- 额外优势: 当答案确实在书籍中时,由于 AI 是在即时阅读源材料,而不是仅仅依赖记忆,因此它能给出更准确的答案。
结果
当他们测试这个新系统时:
- 当答案不在其训练数据中时,它能更好地表达“我不知道”。
- 当答案确实在数据中时,它能更好地给出正确答案。
- 它的表现优于他们测试的所有其他方法,证明了让 AI 能够访问其自身的“源代码”(即它读过的书)是使其诚实的关键。
简而言之: 论文表明,要阻止 AI 编造事实,你不应该仅仅告诉它要诚实。相反,你应该给它一个工具,让它先检查自己的图书馆。如果答案不在那里,它应该足够诚实,能够说出“我没读过那个”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。