← 最新论文
💬 NLP

Tevatron-Elastic: A Unified Abstraction for Training Elastic Retrievers and Rerankers

该论文介绍了 Tevatron-Elastic,这是一个统一的框架,它通过在一个简单的抽象下结合层缩减、标记压缩和嵌入截断,使训练出的单个基于 Transformer 的模型检查点能够动态适配检索器和重排序器的各种尺寸,从而在无需为每种配置设置单独训练方案的情况下,提供灵活的部署权衡。

原作者: Yu Wang, Shengyao Zhuang, Xueguang Ma, Zongyu Wu, Jimmy Lin, Vivek Srikumar, Zhichao Xu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Wang, Shengyao Zhuang, Xueguang Ma, Zongyu Wu, Jimmy Lin, Vivek Srikumar, Zhichao Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

搜索引擎的困境:速度、规模与智慧

想象一下,你正试图在草堆中寻找一根特定的针,但这个草堆是整个互联网。这就是搜索引擎每天的工作。为了完成这项任务,计算机使用“检索器”(retrievers)和“重排序器”(rerankers)——这些是聪明的程序,它们首先抓取一大堆可能的“针”,然后从中选出最完美的那一根。这些程序是基于被称为“Transformer”的强大 AI 模型构建的。可以将 Transformer 想象成一个巨大的、超级聪明的脑子,它能阅读文本并理解其含义。

然而,问题在于,这些“脑子”非常沉重。它们占用大量的计算机硬盘空间(存储),并且需要很长时间来思考(计算)。有时,搜索引擎需要极快的速度,在瞬间回答问题,因此它需要一个更小的脑子。其他时候,它需要存储数十亿份文档,因此它需要一个能产生极其紧凑笔记的脑子。在过去,工程师必须为每一个特定的工作构建一个不同的脑子:一个为了速度,一个为了存储,一个为了最大程度的准确性。这就像是为了每一次旅行都必须买一辆不同的车——赛车用于赛道,面包车用于家庭,卡车用于搬运家具。这篇论文提出了一个疑问:为什么我们不能拥有一个能根据我们的需求进行变形的神奇载具呢?

形状变换的脑子:Tevatron-Elastic

这篇论文介绍了一个名为 Tevatron-Elastic 的新框架。作者意识到,这些 AI 脑子的“沉重”部分可以通过三种不同的方式进行压缩,他们构建了一个能同时实现这三种方式的单一工具。

将 AI 模型想象成一座多层塔楼。

  1. 深度(高度): 你可以决定在读到塔楼一半时停止。如果你只使用底部的 5 层而不是全部 28 层,这个脑子思考起来会更快,因为它要做的工作变少了。这就像是因为你已经理解了情节,所以跳过了书的最后几章。
  2. Token(人群): 在塔楼内部,脑子在观察一群词汇(token)。有时,它可以忽略掉一半的人群,只专注于最重要的那些人。这缩小了上层楼层需要处理的群体规模,从而节省了能量。
  3. 宽度(背包): 当脑子完成工作后,它会写下一份总结笔记。通常,这份笔记非常庞大。但你可以选择写一份更短的笔记,只保留最重要的细节。这会让笔记变得极小,从而节省大量的存储空间。

在这篇论文之前,如果你想要一个既快(浅层)又小(短笔记)的模型,你必须构建两个独立的模型,并寄希望于它们能协同工作。Tevatron-Elastic 通过将这三个选项视为单个旋钮上的简单设置,改变了游戏规则。你可以告诉系统:“训练我成为一个拥有 28 层高度和完整背包的塔楼”,或者“训练我成为一个 10 层高度且只有半个背包的塔楼”,甚至可以“训练我同时具备所有这些特征”。

一个检查点,无限尺寸

Tevatron-Elastic 的魔力在于它训练的是一个单一的模型,它可以瞬间变成上述任何一种版本。作者称之为“统一抽象”(unified abstraction)。他们并没有为每种新形状编写新代码,而是创建了一个“调度表”(schedule)——一个简单的列表,上面写着:“嘿,请学习同时在小型、中型和大型状态下都表现出色。”

训练完成后,你会得到一个“检查点”(checkpoint,即模型的保存文件)。当你部署它时,你可以命令它进行“剪枝”(prune)。如果你需要速度,就切掉顶层的楼层;如果你需要节省空间,就缩小背包。模型不需要重新训练,它只需切换模式即可。

研究人员在 20 个不同的检查点上进行了测试,使用了三种不同类型的 AI 脑子(称为骨干网络/backbones:BERT、ModernBERT 和 Qwen3)。他们发现:

  • 曲线是平滑的: 随着他们将模型变得更小或更浅,质量并没有崩溃;它只是像预期的那样平缓下降。一个在第 16 层停止的模型仍然非常聪明,只是比完整版稍逊一筹。
  • 它是高效的: 训练这个能胜任一切的“超级模型”所花费的成本仅比训练单个固定尺寸的模型高出一点点。为了获得如此多的灵活性,这是一个微小的代价。
  • 加速效果是真实的: 当他们实际运行这些模型时,那些层数较少的模型确实运行得更快。例如,一个在第 16 层停止的模型比完整版本快了 1.75 倍,同时保持了几乎相同的质量。一个在第 6 层停止的模型在阅读文档时快了 4.6 倍

它没做到的事情(以及为什么这没关系)

了解这篇论文没有声称什么非常重要。作者明确表示:他们并没有发明一种让 AI 比以前更聪明的新方法。如果你使用那个完整、未经裁剪的模型,它的表现与之前的模型一样出色。他们也没有证明你应该始终同时使用这三种技巧。有时,你只需要速度,有时你只需要存储。重点在于,你现在有了选择权,可以在不重建整个系统的情况下,针对你的特定情况选择完美的权衡方案。

他们还注意到,对于某些任务,如“重排序”(从列表中挑选出最好的结果),脑子的行为会有所不同。如果你把塔楼切得太短,质量最初会大幅下降,然后趋于平缓。但对于“检索”(在草堆中找针),质量的下降非常平滑。这有助于工程师了解在特定需求下,应该在哪里“切断”塔楼。

总结

Tevatron-Elastic 就像是搜索引擎的瑞士军刀。你不再需要携带各种不同模型的工具箱,而是可以携带一个能够根据手头工作进行收缩、拉伸和重塑形状的单一模型。无论你是在大型服务器集群上运行搜索引擎,还是在手机上的小型应用上运行,你现在都可以通过调节旋钮,精准控制所需的速度、规模与智慧之间的平衡,而这一切都源于一次灵活的训练过程。作者已经发布了他们的代码和所有训练好的模型,邀请他人在此基础上构建更加具有弹性的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →