← 最新论文
💬 NLP

TELLME: Test-Enhanced Learning for Language Model Enrichment

本文介绍了 TELLME,一种将测试增强学习(Test-Enhanced Learning)与持续预训练相结合的新颖方法,旨在高效获取特定领域知识并提高大语言模型的长期记忆保持能力,同时克服传统方法在数据和计算方面的挑战。

原作者: Minjun Kim, Inho Won, Hyeonseok Lim, MinKyu Kim, Junghun Yuk, Wooyoung Go, Jongyoul Park, Jungyeul Park, KyungTae Lim

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Minjun Kim, Inho Won, Hyeonseok Lim, MinKyu Kim, Junghun Yuk, Wooyoung Go, Jongyoul Park, Jungyeul Park, KyungTae Lim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人成为某个特定领域(如金融或医学)的专家。你不能只是给它一堆教科书并指望它死记硬背;那样太慢也太昂贵了。这就是**大语言模型(LLM)的世界——它们是许多现代聊天机器人背后的 AI 大脑。通常,为了让这些机器人变得更精通某个新话题,科学家们会使用一种叫做持续预训练(Continual Pre-training, CPT)**的方法。你可以把 CPT 想象成向机器人喂食关于该主题的海量、源源不断的文章和新闻报道。机器人阅读这些内容,学习其中的模式,从而变得更加出色。

然而,这里有一个陷于:仅仅阅读一本书并不总是意味着你真正理解了它,或者能在下周还记得它。在人类心理学中,有一个著名的概念叫做测试增强学习(Test-Enhanced Learning, TEL)。这是一个反直觉的发现:在学习过程中进行测验,实际上比仅仅重读材料更能帮助大脑锁定信息。这就像是仅仅观看烹饪节目与在厨师询问你“如果过早加盐会发生什么?”时亲自动手尝试做菜之间的区别。我们今天探讨的这篇论文提出了一个简单但强大的问题:如果我们像教人类一样教 AI 呢? 如果我们在它学习的过程中,不只是喂给它更多的文本,而是让它参加测验呢?


论文介绍:TELLME —— 教 AI 参加测验

研究人员(来自韩国的一个团队)构建了一种他们称之为 TELLME(用于语言模型增强的测试增强学习)的新方法。他们的目标是解决传统的“只管多读”方法的缺陷。他们想看看,在训练过程中加入“测验”是否能帮助 AI 学得更快、记得更牢,并且真正理解学科的深层概念,而不仅仅是死记硬背单词。

“只管阅读”的问题所在

传统上,当科学家想要教 AI 关于金融的知识时,他们会喂给它数以千计的新闻文章。这就是持续预训练(CPT)方法。有时,他们会紧接着进行一个单独的阶段,称为指令微调(Instruction Tuning, IT),通过展示问题和答案来教 AI 如何聊天。

作者认为这个两步走的流程非常笨拙。这就像是通过阅读三小时教科书来准备历史考试,然后直到你读完之后,才被递给你一份练习题。当你开始做测试时,你可能已经忘记了刚才读到的细节。其他研究人员曾尝试将这两个步骤混合在一起,在喂给 AI 文本的同时也喂给它简单的问答。但作者注意到其中存在一个缺陷:这些问题通常太简单了,比如“这段话里提到的银行叫什么名字?”AI 可以直接从文本中复制答案,而不需要真正思考。这只是一种“阅读理解”的小技巧,而不是真正的学习。

TELLME 的解决方案:“深度挖掘”式测验

TELLME 通过引入一种基于 TEL 心理学原理的特定类型测验,改变了游戏规则。其运作方式如下:

  1. 设置: 给定 AI 一段文本(例如一篇关于银行的新闻文章)。
  2. 转折点: AI 不再是被问“这家银行做了什么?”,而是被要求生成或回答需要外部知识的问题。例如,如果文本提到了“高频交易”,测验可能会问:“高频交易如何影响市场波动性?”答案并没有写在文章里。AI 必须利用它已有的世界知识来建立联系。
  3. 训练循环: AI 阅读文本,然后立即尝试回答这些深层的、开放式的问题。至关重要的一点是,系统仅根据它所读的文本和它给出的答案进行“评分”,而不针对问题本身。这迫使 AI 专注于理解材料并调用其内部知识来解开谜题。

为了实现这一点,团队使用了一个强大的 AI(GPT-4o-mini)为两个困难领域——金融医学——创建了 100,000 对这样的特殊测验对。他们确保了问题的多样性和推理需求,而非简单的复制。

研究发现:学习更快,记忆更久

团队使用几种不同的 AI 模型(包括 Llama 和 SmolLM)将 TELLME 与传统方法进行了对比测试。结果非常令人振奋:

  • 更聪明,更高效: 在金融领域,与标准方法相比,TELLME 将 AI 的性能提升了高达 23.6%。它学习材料的效率更高。
  • 更好的长期记忆: 这是最令人兴奋的部分。研究人员测试了当他们开始教授医学知识时,AI 是否会“忘记”它学到的金融知识。
    • 传统方法(CPT)在学习医学后,金融领域的表现下降了 5.72%
    • TELLME 方法的下降幅度仅为 0.94%
    • 这表明,通过在训练期间进行“自我测试”,AI 构建了更强大、更持久的记忆,这些记忆不会在新的信息到来时被冲刷掉。
  • 成本效率: 由于 TELLME 学习得更快,它能在更少的步骤内达到相同的性能水平。作者指出,它的训练速度比标准方法快约 1.4 倍,节省了时间和计算能力。

为什么这很重要

论文指出,我们训练 AI 的方式一直过于被动。通过借鉴人类教育中的技巧——在学习的同时进行自我测试——我们可以构建出能够深度理解概念并记忆更久的 AI。

研究人员还检查了这是否适用于其他语言。他们在韩语上也进行了尝试,结果同样有效,提高了 AI 理解韩语句子的能力,即使它之前并未接受过韩语文本的训练。这暗示着“测验”方法可能是让 AI 变得更聪明的通用钥匙,无论使用何种语言。

然而,作者谨慎地指出,这是一种针对持续学习(在 AI 构建完成后教授其新事物)的特定改进。他们还指出,他们在测试中使用了最高达 700 亿参数的模型,但为了节省成本使用了一些简化手段,因此在规模巨大的全量模型上,结果可能会略有不同。

简而言之,TELLME 表明,如果你想要一个真正的专家级 AI,不要只是让它读更多。让它参加一场考试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →