← 最新论文
💬 NLP

Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings

本文介绍了 PEEK,这是一种计算高效的方法,它通过线性解码器对预训练嵌入模型进行适配,从而在大规模范围内准确预测大语言模型的的事实性知识,进而避免了传统前向传递探测技术的高昂成本。

原作者: Kartik Sharma, Yiqiao Jin, Rakshit Trivedi, Srijan Kumar

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Kartik Sharma, Yiqiao Jin, Rakshit Trivedi, Srijan Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座巨大的、极其聪明的图书馆(一个大语言模型,或称 LLM),它几乎读遍了互联网上的所有内容。你想确切地知道它记住了哪些事实,又遗忘了哪些事实。

问题所在:
目前,要检查图书馆是否知道某个特定的事实(例如“加里富纳人是危地马拉的一个族群”),你必须走到图书管理员面前,提出问题,然后等待回答。如果你想检查数百万个事实,这就像试图逐一阅读图书馆里的每一本书一样。这既缓慢又昂贵;而且,如果这座图书馆是一个“黑盒”(你无法看到它是如何思考的),你就无法在不直接询问它的情况下,窥视其内部的大脑来了解它的知识储备。

解决方案 (PEEK):
该论文的作者提出了一种名为 PEEK(用于估计知识的代理嵌入,Proxy Embeddings to Estimate Knowledge)的新工具。你可以将 PEEK 想象成一个高科技的“知识雷达”或一个“影子图书管理员”

与其询问那座巨大的图书馆每一个问题,PEEK 使用一个更小、更快的预训练“扫描仪”(嵌入模型)来猜测大图书馆知道什么。

以下是它的工作原理,分步骤进行:

  1. 训练阶段(教导扫描仪):
    首先,研究人员选取一小部分事实样本,并询问大图书馆:“你知道这个吗?”他们记录下图书馆的回答(是/否,或者其置信度如何)。然后,他们将这些事实的文本展示给一个更小、更快的扫描仪。他们调整扫描仪的设置(就像调频收音机一样),直到扫描仪的“猜测”与大图书馆的实际回答相匹配。
  • 类比: 想象你有一位主厨(LLM)和一位副厨(嵌入模型)。你品尝主厨的汤并告诉副厨:“这汤味道偏咸。”你不断调整副厨的调味,直到他们仅仅通过看食材清单,就能准确预测出主厨的汤到底有多咸。
  1. 预测阶段(雷达):
    一旦扫描仪经过调优,你就不再需要询问大图书馆了。你只需将一个新的事实输入到扫描仪中。扫描仪会立即预测:“大图书馆知道这个,”或者“大图书馆不知道这个。”
  • 类比: 现在,不再需要让主厨去品尝每一种新食材,副厨只需看一眼食材清单,就能立刻说出:“主厨知道怎么处理这个。”

他们的发现:

  • 速度与准确性: 这种“扫描仪”方法极其快速且准确。在测试中,它可以在不向大图书馆提问一个问题的情况下,以高达 90% 的准确率预测大图书馆掌握的知识。
  • 文本 vs. 地图: 他们尝试了两种类型的扫描仪:一种是读取句子的(如句子嵌入模型),另一种是读取连接图谱的(如图神经网络)。他们发现,句子扫描仪的效果更好。这表明,大图书馆组织其知识的方式更像是一组句子的集合,而不是一个僵化的连接图谱。
  • 无需窥视内部: 与其他需要观察图书馆内部“脑电波”(隐藏层)的方法不同,PEEK 只需要事实的文本。这意味着即使图书馆是一个你无法触及的“黑盒”,它依然有效。

为什么这很重要:
该论文指出,在我们让这些巨大的 AI 图书馆协助处理重要任务(如医疗或法律)之前,我们应该使用这种“扫描仪”来快速检查它们的知识差距。这是一种廉价且高效的方法,可以用来提醒我们:“嘿,这个 AI 不了解 X,所以在让它与患者交流之前,我们先把它修补好。”

简而言之:
PEEK 是一种构建快速、廉价代理的方法,该代理学习模仿一个巨大 AI 的知识库。一旦训练完成,这个代理就可以扫描数百万个事实,从而告知你那个巨大的 AI 知道什么,从而节省你直接询问巨大 AI 所需的时间和金钱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →