← 最新论文
🤖 machine learning

LEMUR 2: Unlocking Neural Network Diversity for AI

LEMUR 2 引入了一个大规模、可扩展的框架,该框架统一了生成、评估和部署流水线,以产生超过 14,000 种多样化的神经架构及全面的性能元数据,从而为跨多模态任务和异构硬件的可复现、数据驱动型 AI 设计以及大语言模型驱动的自动机器学习(AutoML)建立了新的基础。

原作者: Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Yashkumar Rajeshbhai Lukhi, Muhammad A. Hussain, Krunal Jesani
发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Yashkumar Rajeshbhai Lukhi, Muhammad A. Hussain, Krunal Jesani, Usha Shrestha, Yash Mittal, Roman Kochnev, Pritam Kadam, Mohsin Ikram, Harsh R. Moradiya, Alice Arslanian, Dmitry Ignatov, Radu Timofte

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图建造一栋完美的房子。多年来,建筑师们(AI 研究人员)一直在手工设计这些房子,一次只搬一块砖。他们有一些喜欢使用的标准蓝图,但他们并没有真正探索过:如果将不同时代的砖块混合搭配,或者尝试建造一栋在沙漠、热带雨林或雪山上都能同样运作的房子,会发生什么。

LEMUR 2 是一个改变游戏规则的庞大新项目。研究人员不再仅仅盯着几张心仪的蓝图,而是建立了一个巨大的自动化“建筑工厂”,源源不断地生产并测试超过 14,000 个独特的神经网络设计(即这些“房子”)。

以下是他们是如何实现的,使用了简单的类比:

1. 施工队(他们是如何制作模型的)

团队并没有只画一张蓝图然后进行复制。他们使用了六种不同的“施工队”来生成这些 14,000 个设计,以确保整个收藏具有极高的多样性:

  • 基因工程师(进化): 想象一群数字生物。计算机让它们在许多代中进行“繁殖”和“变异”,保留最强的设计并丢弃弱小的设计。这发现了大约 2,000 个全新的强力架构。
  • 代码突变器(AST 编辑): 这可以想象成一个机器人,它拿走现有的房屋蓝图,然后修改走廊的宽度或窗户的大小。它微调代码,观察房子是否依然稳固。
  • 分形构建者: 这些构建者使用一种数学模式,其中一个小设计不断重复自身,从而创造出复杂的、自相似的结构(就像蕨类植物的叶子或雪花一样)。
  • 拾荒者(NN-RAG): 这就像一个机器人,它在海量的公共代码库(比如一个巨大的在线五金店)中搜寻,寻找有用的预制部件(比如一个特定的门或窗户),并在将其加入工具箱之前检查它们是否可用。通过这种方式,它们找到了超过 900 个可重用的部件。
  • AI 建筑师(LLM 与强化学习): 他们要求一个超级聪明的 AI(大语言模型)从零开始编写新的蓝图。有时他们会给它一些优秀的房屋案例作为模仿(少样本学习/Few-Shot);有时他们会让 AI 尝试建造房子,失败后受到“责备”(负面奖励),然后不断尝试直到成功(强化学习/Reinforcement Learning)。
  • 数据混合器: 他们还测试了 6,000 种不同的“准备食材”(数据增强)的方法,以观察哪种食谱能让模型的“味道”最好。

2. 测试场(他们测试了什么)

在过去,大多数测试只关注模型识别照片中的猫或狗的能力。LEMUR 2 的范围要广泛得多。他们测试了这些 14,000 个模型在以下方面的表现:

  • 描述图片: 让 AI 根据照片写出一句话。
  • 绘制图片: 让 AI 根据文本描述创作出一幅图像。
  • 编写文本: 让 AI 预测故事中的下一个词。
  • 专家混合: 创建一个由不同小型模型组成的“团队”,通过投票来得出答案,而不是仅仅依赖于一个大模型。

3. 现实世界压力测试(部署)

这是该论文最大的创新点。通常情况下,研究人员会在实验室里的巨型超高速计算机上测试模型。而 LEMUR 2 问道:“这个模型真的能在真实的手机或虚拟现实(VR)头显中运行吗?”

  • NN-Lite(手机测试): 他们将数千个模型进行缩减,尝试让它们在安卓手机上运行。他们测量了手机使用这些模型时的“思考”速度。
  • NN-VR(VR 测试): 他们尝试在虚拟现实游戏引擎(Unity)中运行这些模型。他们检查模型是否足够快,能够跟上 90Hz 的 VR 头显(这意味着模型必须每秒思考 90 次,否则用户会产生晕眩感)。

4. 结果:一个庞大的库

最终的输出是一个包含以下内容的巨大数据库:

  • 14,000+ 个独特模型设计。
  • 750,000+ 条训练记录(就像每一次测试运行的日志簿)。
  • 来自手机和 VR 头显的真实世界速度数据。

为什么这很重要?

把之前的 AI 研究想象成拥有一个小乐高积木盒。你可以搭建一些酷炫的东西,但你会受到现有积木的限制。

LEMUR 2 倾倒出了一个装满不同乐高积木、不同建筑说明书,甚至包括如何建造一个能塞进微型背包(手机)或头盔(VR)里的乐高城堡的说明书的仓库。

通过拥有这个庞大且多样化的库,研究人员现在可以使用 AI 来设计更好的 AI。与其让一个人类去猜测哪张蓝图最好,不如利用这些数据来训练一个“大师级建筑师”(大语言模型),使其理解是什么让神经网络发挥作用,从而在未来创造出更聪明、更快、更高效的 AI。

简而言之: 他们建立了一个大规模的自动化工厂,来创建并测试数千个不同的 AI 大脑,不仅是为了看它们有多聪明,更是为了看它们是否能在我们每天使用的设备上实际运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →