Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory
本文介绍了 CoMem,一种通过缓存中间残差状态并重计算上层网络来利用 Transformer 层非均匀利用率的记忆机制,从而在实现具有恒定计算和内存成本的无限上下文记忆的同时,在长上下文基准测试中显著优于全上下文基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下有一个超级聪明的机器人,它能在瞬间读完整座图书馆的书籍。这个机器人是一种被称为“大语言模型”的人工智能。为了理解一个故事,机器人必须记住它目前为止读过的每一个词。把它的记忆想象成一块巨大的白板。在旧时代的机器人中,每当它们读到一个新词时,都要为它们见过的每一个词都写下一张全新的便条。如果故事变得非常长,白板就会用尽空间,或者机器人会因为忙于阅读自己的便条而变得极其缓慢。这就是科学家们试图解决的大问题:如何让这些机器人记住海量的信息,而不至于耗尽空间或时间。
这些机器人思考的秘密在于“层”,就像一座多层的建筑。底层擅长理解词汇的基本含义(比如知道“苹果”是一种水果)。而高层则是机器人在变得真正聪明的地方,利用这些基本含义来回答特定问题或预测接下来的发展。通常情况下,机器人每次想要回答问题时,都必须从底层开始,一直处理整个故事直到顶层。这篇文章提出了一个聪明的捷径:如果我们只让机器人读到中间层,保存下那个“半成品”的理解,然后只在真正需要答案时才在顶层完成剩下的工作,情况会怎样?
这正是研究人员开发出一种名为 CoMem(理解记忆)的新方法时所发现的。他们发现,与其试图一次性记住一份庞大文档的所有细节,不如让机器人更聪明地存储和检索信息。他们意识到,当文本处理到大脑的中部(即中间层)时,机器人的“理解”已经基本成型了。因此,CoMem 的工作方式就像一位图书管理员,他不会把整本书都放在桌子上。相反,图书管理员读完一章的前半部分,写下一个简短的摘要放在便利贴上,然后把这张便条贴在书架上。当你提问时,图书管理员并不会把整本书拿出来,他只是抓取几张相关的便条,然后在脑海中完成剩余章节的阅读,最后给你答案。
论文表明这种“深度分工”的效果非常好。通过只处理文本的前半部分并缓存(保存)那个中间结果,机器人节省了大量的空间。在测试中,使用名为 Qwen3-8B 的模型,CoMem 仅使用 18.26 GB 的内存就能处理 128k token 的上下文,而传统方法则需要 89.36 GB。这是一个巨大的差异!它还让机器人变得更快,在准备回答问题时实现了 7.83 倍的加速。
然而,研究人员谨慎地指出,这并非魔法。你不能仅仅在读到一半时就停止,并期望得到一个完美的答案。如果你停得太早,机器人会忘记细节;如果你停得太晚,你就会失去速度优势。团队发现了一个位于中间层(具体来说是 36 层中的第 12 层)的“甜点位”(最佳平衡点),在这里,机器人对含义的理解已经足够好,可以进行保存,但尚未针对特定问题进行专业化处理。他们还发现,仅仅保存便条是不够的;机器人仍然需要能够同时查看所有相关的便条,以便将这些点连接起来。
结果令人印象深刻,但也具有针对性。在一项名为 RULER 的测试中(该测试检查机器人能否在巨大的文本中找到“大海捞针”般的特定事实),CoMem 得分为 97.05,击败了标准方法的 78.80。在名为 LoCoMo 的长对话测试中,CoMem 得分为 38.27,而标准方法为 34.59。论文表明,这种方法是组织记忆的一种强有力的方式,但它并不是解决所有问题的完美方案。例如,机器人在处理某些类型的复杂问题时(如 BABILong 测试中的某些 “qa2” 任务)仍然表现得有些吃力,这表明虽然该方法在效率方面迈出了巨大的一步,但它并未让机器人变得无所不能。
简而言之,CoMem 表明,我们不需要强迫机器人每次提问时都重新阅读整个图书馆。通过分工协作——让底层承担理解的基础重任,让顶层负责具体的回答——我们可以构建出记忆力更强、思考更快、且更节能的机器人。这有点像是意识到你并不需要把整部百科全书都背在背包里;你只需要知道在需要时该抽取出哪些页面即可。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。