← 最新论文
🤖 machine learning

FRAME: Learning the Adaptation Domain with a Mixture of Fractional-Fourier Experts

本文介绍了 FRAME,一种采用具有可学习分数阶傅里叶阶数的混合专家模型进行参数高效微调的方法,该方法通过在空谱连续体上动态调整更新,从而实现了比现有 LoRA 和光谱基准模型更优越的性能并减少了干扰。

原作者: Tom Saliencro, Maya Lindqvist, Rohan Desai, Priya Nair, Daniel Whitmore

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Tom Saliencro, Maya Lindqvist, Rohan Desai, Priya Nair, Daniel Whitmore

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的、冻结的知识图书馆(大型语言模型),你想教它一项新技能,比如编写代码或解决数学问题。你不想重新编写整个图书馆,因为那太昂贵且太慢了。相反,你想添加一张小小的“便签”或“速查表”(这种技术被称为 PEFT 或参数高效微调),只教给模型它需要知道的内容。

长期以来,研究人员有两种编写这些速查表的主要方式:

  1. “空间”方式 (LoRA): 用原始文本的语言来写笔记(比如标准的英语)。
  2. “频谱”方式 (Fourier): 用频率和模式的语言来写笔记(比如音乐符或无线电波)。

问题在于,有时“空间”方式最好,而有时“频谱”方式最好。这取决于任务、模型的特定部分,甚至取决于正在处理的特定单词。但以往的方法强迫你在整个任务中只能二选一。

走进 FRAME:一个“可调焦距”的适配器

作者引入了一种新方法,称为 FRAME(分数傅里叶混合专家模型)。它是如何工作的,我们可以使用简单的类比:

1. “变焦镜头”类比

想象一下,“空间”方式就像是用肉眼观察一幅画(看到每一处笔触)。“频谱”方式则像是通过三棱镜观察这幅画,将其分解为纯粹的色彩(看到光的频率)。

作者意识到,在这两者之间存在着一整个镜头的光谱。你可以拥有一个稍微倾斜的,或者介于肉眼和三棱镜之间的镜头。这就是所谓的分数傅里叶变换

  • FRAME 为每一个“专家”(一个小型的辅助模块)都提供了一个可调的旋钮
  • 一个专家可能会把旋钮转到 0(肉眼观察)。
  • 另一个专家可能会转到 1(三棱镜观察)。
  • 第三个专家可能会转到 0.4(一种模糊的、中间状态的视图)。

模型会学习针对每一个任务和每一个单词,精确地将旋钮设定在什么位置。

2. “专业化团队”类比

把 FRAME 想象成一个正在执行项目的专家团队。

  • 在旧的方法中,团队中的每个人都被迫说同一种语言(例如,每个人都说英语)。
  • 在 FRAME 中,团队是一个混合专家系统 (Mixture of Experts)。当一个新单词进来时,“路由”(就像一个项目经理)会观察它并询问:“谁最适合处理这个?”
    • 如果这个词是一个简单的事实,路由可能会把它发送给“空间”专家。
    • 如果这个词是复杂的数学模式的一部分,路由可能会把它发送给“频谱”专家。
    • 如果它处于两者之间,它就会被发送给一个具有“中间设置”的专家。

因为每个专家都在通过不同的“镜头”观察数据,所以他们不会互相干扰。这就像是一个团队,其中一个人看大局,另一个人看细节,而第三个人看节奏。他们是解耦的 (decorrelated),这意味着他们不会重复做同样的工作,也不会让彼此感到困惑。

3. “神奇的捷径”

你可能会想:“哇,计算所有这些不同的镜头一定超级慢且昂贵。”
作者发现了一个聪明的数学捷径(使用一种叫做 chirp-FFT 的技术)。这就像拥有一个神奇的计算器,可以瞬间在这些不同的视图之间切换,而无需进行繁重的实际计算。

  • 结果: FRAME 几乎和旧方法一样快,但它更聪明。

他们发现了什么?

研究人员在两个大型 AI 模型(LLaMA 和 Qwen)以及四类任务上测试了该方法:

  • 常识(回答刁钻的问题)
  • 数学(解决问题)
  • 代码(编写软件)
  • 知识(事实检索)

结果显示:

  • 性能更好: FRAME 打败了之前所有的最佳方法,包括“空间”类方法和“频谱”类方法。
  • 更智能的专业化: 模型确实学会了针对不同任务设置不同的旋钮。例如,模型的早期层倾向于一种设置,而后期层则倾向于另一种。
  • 高效性: 它在实现这些结果的同时,比许多竞争对手使用了更少的活跃参数(即每个单词消耗的“计算能力”更少)。

核心结论

本文认为,“领域”(我们表示数据的方式)不应该是一个固定的规则。它应该是一个可学习的选择。FRAME 证明了,通过给 AI 模型一个旋钮,让它们可以调节如何“观察”数据——从原始文本到纯粹的模式——它们可以学得更快、犯错更少,并且比被迫固守于一种思维方式时能更好地处理复杂任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →