Structuring Open-Ended NAS: Semi-Automated Design Knowledge Structuring with LLMs for Efficient Neural Architecture Search
本文提出了一种半自动化框架,该框架利用大语言模型将设计知识结构化以构建用于创建多样化搜索空间的高级模板,并结合具有多类型变异和反馈回路的 FairNAD 算法,从而高效地发现高性能神经架构,使其在 CIFAR 和 ImageNet 基准测试中超越现有最先进方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试打造一台终极、最高效的机器人厨师。过去,工程师必须手动设计每一个齿轮、杠杆和电路。这种方法既缓慢又昂贵,而且受限于工程师已有的知识。
为了加速这一过程,科学家们发明了神经架构搜索(NAS)。你可以把它想象成一个为你建造其他机器人的机器人。然而,传统的 NAS 就像给这个机器人一个预先打包好的小工具箱。它只能混合搭配给定的工具(比如扳手或螺丝刀)。它无法发明新工具,也无法意识到锤子可能更适合这项特定工作。
随后,大型语言模型(LLMs) 出现了,这些“超级智能机器人”能够阅读数百万本书籍并编写代码。研究人员尝试利用这些 LLM 来设计机器人厨师。这令人兴奋,因为 LLM 可以想象出任何工具,而不仅仅是工具箱里的那些。但其中有个陷阱:LLM 常常感到困惑。它会从庞大的记忆中提取过于具体、过于怪异或完全错误的想法,导致搜索过程混乱且低效。
本文介绍了一种名为FairNAD的新方法来解决这一混乱局面。以下是其工作原理,使用简单的类比说明:
1. “结构化图书馆”(半自动化知识结构化)
与其让 LLM 从一堆杂乱无章的论文中随机抓取想法(就像在垃圾堆里挖掘),作者们建立了一个结构化图书馆。
- 问题:如果你问 LLM“给我一个设计想法”,它可能会建议“为二维照片使用三维激光扫描仪”,这毫无用处。或者,它可能在 70% 的情况下建议“使用某种特定类型的注意力机制”,而忽略了其他好主意。
- 解决方案:作者们创建了一个树状归档系统(属性树)。他们将设计想法整理成整齐的类别:
- 第一层:这是一个微小部件(操作)、一个模块(块),还是整个机器人(网络)?
- 第二层:它是什么?(例如:特征提取、归一化)。
- 第三层:具体细节(例如:分组卷积)。
- 类比:想象一位图书管理员,她不会随手递给你一本随机书籍。相反,她会问:“你需要一本关于引擎(操作)的书,还是关于底盘(块)的书?”然后找到你需要的特定V8 引擎(子类别)。这确保了 LLM 获得高质量、相关的想法,而不会陷入单一趋势(例如“一切必须是 Transformer”)。
2. “公平厨师”(FairNAD 框架)
一旦图书馆建立,作者们使用一种称为FairNAD的特殊搜索过程。你可以将其想象为一场烹饪比赛,目标是找到最佳食谱。
阶段 1:“公平想法”品尝(带有公平想法采样的变异)
- 问题:通常,搜索算法只挑选迄今为止看到的“最佳”想法,而忽略那些怪异或微小的想法。
- 解决:FairNAD 强制 LLM 平等地品尝图书馆中每个类别的想法。它确保“小型高效”的想法与“大型强大”的想法拥有同等的测试机会。这防止了搜索陷入僵局。
阶段 2:“帕累托”平衡行动(帕累托感知变异)
- 问题:有时机器人小巧快速但不够聪明;有时它是个天才但太重无法移动。标准搜索往往忽略那些“小但聪明”的机器人,因为它们尚未达到绝对最佳。
- 解决:FairNAD 关注“帕累托前沿”。想象一个图表,一个轴代表“速度”,另一个轴代表“智能”。FairNAD 专门寻找位于该图表边缘的机器人——那些在特定尺寸下最聪明的机器人。如果机器人太小,它会获得“升级”(更多层);如果太大,它会获得“调优”(更好的设置)。
阶段 3:“迭代抛光”(LLM 驱动的迭代变异)
- 问题:一旦找到好食谱,你就想将其完善。
- 解决:系统选取表现最佳的机器人,并让 LLM 反复微调它们,就像厨师不断品尝并调整调味直到完美为止。
“安全网”(反馈循环)
- 问题:LLM 有时会编写出崩溃的代码、占用过多内存,或制造出只有一条腿的机器人。
- 解决:在新设计被接受之前,它会经过三步检查:
- 它能运行吗?(执行检查)
- 它太大了吗?(预算检查——如果太重,LLM 会被要求缩小它)。
- 它真的是个机器人吗?(结构检查——确保它有多层,而不仅仅是旧设计的复制品)。
- 如果失败,LLM 会被要求立即修复。这保持了搜索的多样性,并防止系统浪费时间在破损的设计上。
结果
作者在标准图像识别任务(例如在照片中识别猫与狗)上测试了该系统。
- 结果:他们的方法找到了显著优于以往方法的机器人厨师(神经网络)。
- 得分:在一个数据集上,他们将准确率提高了0.84 分,在另一个数据集上提高了2.17 分,在第三个数据集上提高了2.35 分。在人工智能领域,这些是巨大的飞跃。
总结
简而言之,这篇论文指出:“不要仅仅让超级智能的 AI 随机猜测。给它一个结构化归档系统来组织其知识,并使用一个公平的多步骤过程来测试想法。这样,你得到的不仅仅是任何设计,而是符合你的尺寸和速度限制的最佳可能设计。”
该论文声称,与试图在一堆杂乱无章的未组织想法中进行操作相比,这种方法使新 AI 架构的搜索更快、更多样化,也更成功。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。