← 最新论文
🤖 machine learning

Delta-Based Neural Architecture Search: LLM Fine-Tuning via Code Diffs

本文介绍了基于差异的神经架构搜索,这是一种令牌高效的方法,其中经过微调的大语言模型生成紧凑的代码差异以优化基线模型,与跨多个数据集的传统全模型合成相比,该方法在显著缩短输出长度的同时实现了更高的有效性和准确率。

原作者: Santosh Premi Adhikari, Radu Timofte, Dmitry Ignatov

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Santosh Premi Adhikari, Radu Timofte, Dmitry Ignatov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试改进一台复杂的机器,比如汽车发动机。

旧方法(完整生成):
过去,当研究人员使用 AI 设计更优的神经网络(AI 的“大脑”)时,他们会要求 AI 每次都从零开始,为全新的发动机编写整本操作手册

  • 问题所在: 这就像要求一位作家为了修改一个逗号而重新打出一整本书。这不仅耗时巨大,消耗海量算力,还常常导致代码杂乱冗余。如果 AI 在中间犯了一个小错误,整个发动机就会失败。

新方法(基于 Delta 的搜索):
本文提出了一种更聪明的方法,称为Delta 代码生成。AI 不再被要求编写全新的手册,而是被要求编写一个微小的“补丁”或“差异”(diff)(即一份具体的修改清单),用于修复一个现有的、可正常运行的发动机。

  • 类比: 这就像在文字处理软件中使用“修订”功能。你不需要重写整份文档,只需高亮显示你想要修改的具体句子,然后说:“把这个词改成那个词。”
  • 结果: AI 只需编写约 30 到 50 行代码(补丁),而不是 200 多行(整本手册)。这节省了约75–85% 的计算机算力

他们如何测试

研究人员将此比作一场烹饪比赛,三位不同的 AI 厨师(均为"7B"类模型,即非常聪明但非超大规模的助手)参赛:

  1. DeepSeek-Coder(一位专精于编程的厨师)。
  2. Qwen2.5-Coder(另一位编程专家)。
  3. Mistral-7B(一位通用型厨师,并非专门针对代码训练)。

他们要求这些厨师改进六种不同菜肴(数据集,如 CIFAR-10、MNIST、CelebA 等,从简单数字到复杂人脸)的食谱(神经网络架构)。

结果

  • 效率: “补丁”方法极其高效。AI 厨师生成的指令更短、更简洁。
  • 性能: 令人惊讶的是,只编写补丁的厨师表现与编写完整手册的厨师一样好(甚至往往更好)。
    • 在标准测试(CIFAR-10)中,编写补丁的厨师达到了约85%的准确率,而旧的“完整手册”方法仅达到约64%
    • 即使是那位非编程专家的通用型厨师(Mistral),其表现也与编程专家不相上下。这证明,编写补丁的方法才是关键秘诀,而不仅仅取决于具体使用了哪个 AI 模型。
  • 可靠性: “补丁”方法可靠得多。约**75%的补丁完美生效,而旧方法仅约50%**的时间能成功。

为何这很重要

本文认为,这种"Delta"方法是一个游戏规则的改变者,因为:

  1. 成本更低: 它使用远少的计算机算力(token)就能获得更好的结果。
  2. 更灵活: 它适用于多种不同类型的问题(数据集),而无需为每个问题重新训练 AI。
  3. 更智能: 通过在现有且可运行的代码基础上构建,AI 无需每次都“重新发明轮子”;它只需专注于必要的改进。

简而言之,本文表明,微调现有方案往往比从零开始构建新方案更好、更快且更可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →