← 最新论文
🤖 machine learning

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation

本文认为,通过数据策展来诱导简洁性是提高视觉语言模型(VLM)推理效率的关键杠杆,证明了在简洁且正确的数据上进行训练可以显著降低获得正确答案的计算成本(正确代价),且不会牺牲准确性,甚至在输出长度固定时通常也能提升性能。

原作者: DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab, Bogdan Gaza, Ari Morcos

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab, Bogdan Gaza, Ari Morcos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的通俗易懂版解释。

核心理念:别再浪费话头了

想象一下,你正在雇佣两个人为你写报告。

  • A 先生为了解释一个简单的道理,写了一篇 10 页的论文。他用词华丽,讲着长篇大论,还反复重复。
  • B 先生只写了一个完美的句子,就把同样的观点表达清楚了。

大多数 AI 研究人员一直试图通过缩小“大脑”的大小(比如雇佣一名经验较浅的实习生)来让 AI 变得更“便宜”。但本文认为,真正的钱都浪费在了回答的长度上,而不是大脑的大小上。

作者称之为**“简洁是推理效率之魂”**。用大白话来说就是:获得正确答案最快、最省钱的方法,就是别让 AI 说太多废话。

问题所在:“长篇大论”的陷est

论文引用了著名作家布莱兹·帕斯卡尔的一句话,他曾说:“我之所以把这封信写得这么长,是因为我没有时间把它写短。”

现在的 AI 模型就像帕斯卡尔一样。它们的训练数据在奖励它们写出冗长、啰嗦的回答。

  • 成本: AI 生成的每一个字都会消耗金钱和时间(计算能力)。
  • 趋势: AI 的回答每年都在变得越来越长。有些模型现在甚至要写 1000 多个单词才能回答一个简单的数学问题。
  • 误区: 研究人员一直试图通过让 AI “思考得更快”(使用更好的芯片或软件技巧)来解决这个问题,但他们并没有从源头上阻止 AI 写出那封“长信”。

解决方案:训练 AI 变得言简意赅

DatologyAI 的团队尝试了一种不同的方法。他们不是在模型构建完成后再去强迫它变短,而是在整理训练数据时,就教导 AI 在开始之前就要保持简洁。

类比:
想象你在教一个学生解数学题。

  • 旧方法: 你给学生一本教科书,里面的每个解题过程都写成了一部 50 页的小说。学生由此学到,想要表现得“聪明”,就必须写 50 页。
  • Datology 的方法: 你给学生一本教科书,里面的解题步骤清晰且精炼。学生由此学到,聪明意味着高效。

他们对一个标准的训练集(MAmmoTH-VL)进行了清理,去掉了那些废话,只保留了正确且简洁的答案。然后,他们用这些“干净”的数据训练出了新的模型。

结果:更短、更便宜、更聪明

他们将这些新的“简洁型”模型与其他著名的“冗长型”模型(如 Qwen3.5)进行了对比。以下是他们的发现:

  1. 巨大的节省: 这些简洁型模型在回答正确时,所消耗的计算能力比最冗长的模型少了 35 倍
    • 类比: 如果冗长模型回答一个问题的成本是一箱汽油的价格,那么简洁型模型的成本仅仅是一瓶苏打水的价格。
  2. 质量无损: 这些简洁型模型的准确度与那些长篇大论的模型一样高(甚至可能更高)。
    • 类比: 那个简洁的学生和写了 50 页论文的学生拿到了同样的 A+ 成绩,但后者花了 50 分钟,而前者只用了 10 分钟。
  3. 长篇大论并无帮助: 他们发现,对于大多数任务,写更多的字并不会让 AI 变得更聪明。它只会让账单变得更高。
    • 例外情况: 只有在处理某些非常特定且复杂的任务(例如阅读一份杂乱的文档)时,“长篇思考”才会有所帮助,即便如此,随着模型规模的增大,这种优势也会逐渐缩小。

“顿悟时刻”

论文揭示了一个令人惊讶的事实:啰嗦往往是模型尚未真正掌握答案的表现。

当一个模型在胡言乱语时,它通常是在“幻觉”或者试图通过说出所有能想到的内容来“猜”出正确答案。而当一个模型能够言简意赅时,通常意味着它已经掌握了模式,可以直接给出答案。

总结

本文认为,我们看待 AI 效率的方式一直都错了。我们一直在试图缩小引擎,但我们其实应该去修复燃油消耗。

通过整理数据来教导 AI 模型保持简洁,作者创造出的模型具有以下特点:

  • 运行成本降低了 35 倍。
  • 回答同样准确。
  • 不会在不必要的闲聊上浪费时间。

这就像是一个司机为了去杂货店而绕道行驶了 50 英里的风景路线,与另一个知道捷径的司机之间的区别。两者都能到达目的地,但其中一个节省了大量的油费。这篇论文向我们展示了如何教 AI 走捷径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →