← 最新论文
💻 computer science

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

本文介绍了 Eddy-VL 1.9B,这是一种专为边缘侧部署设计的压缩多模态嵌入模型,通过探针驱动的结构化剪枝和分层知识蒸馏,在减少 9.5% 参数量并降低 10% 延迟的同时,实现了其 2.13B 参数教师模型 91.7% 的性能。

原作者: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机能同时“看”和“读”的世界,它们理解一张“猫坐在垫子上”的照片,就像理解“猫在垫上”这些文字一样透彻。这就是**多模态人工智能(Multimodal AI)的领域——这是一个机器学习将图像、文本和视频连接成一种统一、共享语言的科学分支。为了实现这一点,这些 AI 模型充当着巨大的翻译官,将它们所看到的一切转化为一长串被称为嵌入(embedding)**的数字。可以将嵌入想象成一段内容的独特指纹;如果两个指纹非常相似,计算机就知道这两段内容是相关的。

然而,这其中有一个难点。最聪明的翻译官通常也是最沉重的。它们就像是庞大的云端超级计算机,需要持续的高速互联网连接才能工作。但如果你是在一个秘密地下室、警察证据室,或者是一个网络中断的偏远野外工作站呢?你需要一个既能理解复杂线索,又足够小巧,能够装进笔记本电脑或手持设备的翻译官。这就是**边缘部署(edge deployment)**的挑战:让强大的 AI 在无需云端连接的情况下,实现离线、快速且高效地运行。

于是有了 Eddy-VL 1.9B,这是一个专门为这些“物理隔离(air-gapped)”场景设计的全新模型,在这些场景中,隐私和速度高于一切。这个项目的研究人员从一个非常聪明但非常沉重的“老师”模型——Qwen3-VL-Embedding-2B 开始。这个老师就像一位拥有 28 层深度思考能力的博学教授,但它太臃肿了,无法背在背包里到处走。团队提出了一个简单的问题:我们能否在不让这位教授忘记如何教学的前提下,将他缩小?

他们并没有只是随机地切除部分功能,而是使用了一种巧妙的策略,称为结构化剪枝(structural pruning)。想象一下,老师的大脑是一座 28 层高的建筑。研究人员使用了一个特殊的“探针”来测量每一层在重复上方或下方楼层的工作量有多大。他们发现有四个特定的楼层在做大量冗余的工作——就像在一排复印机中,连续摆放了四台完全一样的机器,其实一台就够了。他们移除了这四层,将这座建筑从 28 层缩减到了 24 层。

但棘手的地方在于:当你从一栋建筑中移除楼层时,住在顶层的居民可能会迷路。为了解决这个问题,团队使用了分层蒸馏(layered distillation)。可以将这想象成一位大师级建筑师(原始的 28 层老师)在指导一位新的、规模较小的建筑师(24 层学生)。老师不仅仅是说“去建造它”,而是向学生展示在每一步该如何思考。他们使用了 CKA 技术(一种衡量两层思维相似度的技术),以确保学生的中间层思维方式与老师保持一致;同时,他们针对最终答案使用了特殊的“Matryoshka(俄罗斯套娃)”方法,确保学生可以根据需求给出不同尺寸的答案。

其成果便是 Eddy-VL 1.9B。这是一个拥有约 19.3 亿个参数的模型,重量仅为 3.85 GB——足以装入许多现代设备。在测试中,这个“缩小版”模型保留了原老师约 91.7% 的智能。虽然原老师在包含 78 项任务的大型测试(称为 MMEB-V2)中得分为 68.9,而 Eddy-VL 得分为 63.2,这听起来似乎有所下降,但请记住,该模型失去了整整四层思考能力!如果没有这种特殊的教学技巧,得分将会骤降至 56.8。蒸馏过程成功地找回了 6.4 分 的损失。

该模型还获得了速度上的提升。由于处理的层数更少,它的运行速度比原模型快了约 10%,处理每张图像仅需 136.4 毫秒,而原模型需要 150.0 毫秒。这看起来差距不大,但在现实世界的调查中,当你需要离线扫描成千上万张查封的照片时,这些额外的秒数累积起来就是数小时的时间节省。

研究人员也细心地指出该模型仍然面临挑战的地方。虽然它在理解词语与图像之间复杂关系方面几乎达到了老师的水准(在一项测试中得分为 86.1%,而老师为 86.4%),但在处理一种被称为 Winoground 的特定逻辑谜题时仍有些吃力,得分仅为 6.8(老师为 8.5)。这表明,虽然该模型非常擅长通用检索,但某些极其复杂的逻辑谜题仍然需要完整的、未经剪枝的大脑。

最终,Eddy-VL 1.9B 并不是解决所有问题的万灵药,但它是一个针对特定任务的强大工具。它证明了你可以将一个庞大的、依赖云端的 AI 压缩成一个轻量级的、支持离线运行的软件包,且不会丢失太多灵魂。对于调查人员、取证专家以及任何在网络成为奢侈品的环境下工作的人来说,这个模型提供了一种在网络边缘保持高智能水平并持续运作的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →