← 最新论文
💬 NLP

ARC-Encoder: learning compressed text representations for large language models

该论文介绍了 ARC-Encoder,一种可适配的编码器,它将文本压缩为连续表示以替换解码器大语言模型中的标记嵌入,在多种场景下实现了最先进的性能,同时显著提高了推理效率,并在无需修改架构的情况下实现了跨多个解码器模型的泛化。

原作者: Hippolyte Pilchen, Edouard Grave, Patrick Pérez

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Hippolyte Pilchen, Edouard Grave, Patrick Pérez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过阅读一本厚达千页的巨型百科全书来回答一个问题。你的大脑(或者在这种情况下,是一个被称为“大语言模型”的超级聪明计算机程序)必须同时将每一个词都保存在记忆中才能理解这个故事。问题在于,这些计算机在面对过长的故事时会感到不堪重负。它们会开始变慢、变得混乱,或者仅仅是撞上一堵“墙”,导致它们无法记住之后的任何内容。这有点像试图把一座图书馆装进你的背包里;最终,背带会断裂,或者你根本无法行走。

为了解决这个问题,科学家们一直试图教这些计算机在阅读书籍之前先进行“总结”。一些方法试图扔掉它们认为不重要的词(比如删除书中的页面),而另一些方法则试图将整本书转化为一个单一的、稠密的“魔法标记(magic token)”,其中包含了所有的意义。但问题在于,大多数这种魔法技巧都需要重新构建计算机的大脑才能理解新的总结。这就像教一只狗说法语,但你必须通过手术改变它的脑部结构来实现。这使得这只狗虽然精通法语,却在原本的技能上变得很差,而且你无法将这个大脑直接用到另一只狗身上。

这正是来自 Kyutai 研究人员的一项新研究所切入的点。他们提出了一个简单的问题:如果我们能建立一个独立的“翻译器”,将长篇书籍转化为一个简短的、压缩后的版本,而无需触碰计算机的大脑,情况会怎样?他们创造了一个名为 ARC-Encoder 的工具。你可以把它想象成一位超级高效的图书管理员,他读完了一本 1,000 页的书,然后递给你一份 125 页的“小抄”,这份小抄包含了所有重要的思想,但使用的是一种计算机已经懂得如何阅读的秘密代码。计算机不需要被改变,它只需要阅读这份小抄,而不是整本书。

研究人员发现,这种方法的效果出奇地好。通过使用一种被称为“池化(pooling)”的特定技术——这就像是每四个词取一次,并将它们融合为一个“超级词”——他们可以将文本缩减 4 倍或 8 倍。当他们在不同类型的计算机(称为“解码器”)上进行测试时,ARC-Encoder 能够帮助它们回答问题、翻译语言以及总结故事,其表现与阅读全文的效果不相上下,而且速度更快。更酷的是,他们发现一个单一的“翻译器”可以经过训练,同时与多个不同的计算机协同工作。这就像拥有一个通用的适配器,可以适配任何设备,而不是为每件小工具准备一个定制充电器。

这项研究表明,这种方法是一种灵活的方式,可以在不破坏原有能力的情况下,让 AI 变得更快、更聪明。虽然研究人员承认,它仍需练习才能完美处理极长的文档,但他们展示了通过压缩文本,我们可以节省大量的计算能力和内存。事实上,他们计算出,存储整个英文维基百科的这些压缩总结所占用的空间,大约与原始文本本身的空间相当,这意味着我们可以预先计算出这些总结,并在需要时即时使用。这是朝着让 AI 在不丢失原有个性且不感到疲劳的情况下,读完整座图书馆这一目标迈出的充满希望的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →