← 最新论文
🤖 machine learning

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

本文提出了 ART(基于艺术的强化训练),这是一种参数高效的微调方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型中,且无需修改其计算图,从而在实现与 LoRA 相当的准确度的同时,确保了与 vLLM 等高吞吐量引擎的兼容性。

原作者: Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢、训练有素的图书管理员(AI 模型),他知道如何阅读书籍并回答问题。然而,这位图书管理员是“冻结”状态的——你无法改变他的大脑,无法重写他的记忆,也无法向他的私人收藏中添加新书。通常情况下,为了教这位图书管理员一项新技能(比如解数学题或使用工具),你必须物理性地重构他的大脑,但这既缓慢又混乱,还会破坏图书馆的高速交付系统。

这篇论文介绍了一种名为 ART(基于艺术的强化训练) 的新方法。ART 不再试图重构图书管理员的大脑,而是通过在他开始阅读之前递给他一张特殊的、定制绘制的图片来教导他。

以下是其工作原理的拆解,采用简单的概念进行说明:

1. 问题所在:“重构”瓶颈

通常,为了让 AI 在特定任务上表现得更好,研究人员会使用一种叫做 LoRA 的技术。把 LoRA 想象成给图书管理员戴上一副定制的眼镜。这种方法效果很好,但存在以下问题:

  • 它需要将新的硬件(权重)物理连接到图书管理员身上。
  • 如果有许多位图书管理员同时工作,你必须不断地更换这些眼镜,这会减慢速度并导致交通拥堵。
  • 它会破坏图书馆标准的、高速的交付卡车(如 vLLM 等引擎所使用的“计算图”)。

2. 解决方案:“神奇图片”(ART)

作者们意识到,现代 AI 模型已经具备了“看”图片的能力。于是他们决定不再尝试改变图书管理员的大脑,而是转而优化递给他的那张图片

  • 过程: 他们从一张普通的图像开始(例如,一本关于数学问题的数学书,或者一个代表科学问题的脑部图像)。
  • 神奇之处: 他们运行一个计算机程序,对这张图片的像素进行数百万次的细微调整。这就像一位艺术家在原始照片上用肉眼看不见的、高频的图案进行反复涂抹。
  • 结果: 图书管理员看到的仍然是那本“数学书”,但画作中隐藏的图案就像是一本秘密的说明书。图书管理员的大脑保持 100% 冻结且未发生任何变化,但这张图片却能精准地告诉他如何解决问题。

3. 如何运作:两步舞步

训练过程在一个循环中进行,就像教练与运动员的关系:

  1. 测试(Pass A): AI 查看当前版本的图片,并尝试解决一个数学问题。如果它答对了,这张图片就会获得一个“做得好”的分数。
  2. 调整(Pass B): 计算机根据得分,稍微改变图片的像素,以便让 AI 在下次表现得更好。
  3. 重复: 这个过程不断重复,直到图片被完美调优,能够解锁 AI 处理该特定任务的潜力。

4. 令人惊讶的发现:“AI 的隐写术”

关于最终生成的图片长什么样,作者有一个非常酷的发现。

  • 它们看起来仍然像原始图像(数学书、大脑或工具)。
  • 但如果你仔细观察,它们覆盖着奇怪的高频“噪声”或图案,看起来就像旧电视机上的雪花点。
  • 类比: 想象你在明信片上用隐形墨水写了一封秘密信件,只有图书管理员能读懂。对于人类来说,它看起来只是一张带有些奇怪划痕的普通明信片;但对于 AI 来说,那些划痕就是包含解决问题所需所有指令的密集代码。
  • 证明: 作者发现,这些经过优化的图片文件体积变得大得多(例如,从一个 8KB 的小文件变成一个 98KB 的大文件)。这证明了即使图像看起来只是一张简单的图片,其中也封装了海量的“知识”。

5. 它真的有效吗?

研究人员在两种规模的 AI 模型(小型和中型)上,针对三类任务进行了测试:

  • 数学 (GSM8K): AI 在解决小学数学问题方面有了显著进步。
  • 工具使用 (ToolMind): AI 在调用特定计算机功能(如使用计算器或数据库)方面表现得更好。
  • 硬核科学 (GPQA): 该方法在处理非常困难、抽象的科学问题时效果并不理想。作者认为,对于这类困难任务,改变大脑(LoRA)可能仍然是更好的选择,因为“秘密图片”可能会分散 AI 的注意力。

结论:
对于数学和工具使用任务,ART 与标准的“重构大脑”方法(LoRA)一样出色,甚至有时表现更好。

为什么这很重要?

  • 速度: 因为你没有改变大脑,所以不需要加载新的硬件。你的图书馆可以继续使用其超高速的交付卡车。
  • 简单性: 你只需要发送一张图片和一个问题。无需复杂的工程设计即可使其运行。
  • 便携性: “训练后的部分”仅仅是一个单一的图片文件。你可以通过电子邮件发送它、保存它或打印它。它是一个可以在任何冻结版本的 AI 模型上运行的、可移植的“技能”。

简而言之,ART 证明了你不需要为了让汽车跑得更快而去重建发动机;有时候,你只需要在仪表盘上画出一个非常特定的、秘密的图案,告诉驾驶员该如何驾驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →