← 最新论文
🤖 machine learning

ONNX-Net: Towards Universal Representations and Instant Performance Prediction for Neural Architectures

本文介绍了 ONNX-Net,这是一种基于 600k+ 样本的 ONNX-Bench 基准测试构建的统一、基于文本的神经架构表示,它使单个性能预测器能够即时且准确地评估不同搜索空间中的任意神经架构,而不受特定基于单元(cell-based)设计的限制。

原作者: Shiwen Qin, Alexander Auras, Shay B. Cohen, Elliot J. Crowley, Michael Moeller, Linus Ericsson, Jovita Lukasik

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiwen Qin, Alexander Auras, Shay B. Cohen, Elliot J. Crowley, Michael Moeller, Linus Ericsson, Jovita Lukasik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,最强大的工具通常是神经网络——这些系统在很大程度上模仿人类大脑,学习如何识别模式、翻译语言或驾驶汽车。几十年来,科学家们一直试图通过手动构建这些网络,像机械师调整发动机一样微调其结构。但随着这些系统变得越来越复杂,人类的直觉成为了瓶颈。这催生了一个被称为“神经架构搜索”的领域,即任务是让计算机设计它们自己的网络。其目标是让机器为特定工作找到最佳的可能结构。然而,这一过程遇到了障碍。为了知道一个设计是否优秀,计算机必须从头开始构建并训练它,这个过程在大型超级计算机上可能需要花费数天甚至数周的时间。这使得搜索过程极其缓慢且昂贵,限制了实验进行的规模。

现在,一个研究小组提出了一种突破这一瓶颈的方法,他们不是通过建造更快的计算机,而是通过改变描述设计的方式。他们引入了一个名为 ONNX-Net 的新系统,它充当了神经网络的通用翻译器。该系统并没有强迫每个新设计都进入一个僵化、预定义的框架,而是将网络的蓝图读作一段简单的句子。通过将复杂的工程图表转换为纯文本描述,研究人员训练了一个语言模型,仅通过阅读这些文本就能预测一个网络的表现。结果是一个能够瞬间猜测神经网络设计成功率的工具,而无需实际构建或训练它,从而节省了大量的精力和能源。

研究人员解决的核心问题是,以往加速这一过程的尝试过于局限。早期的算法仅在由小型、重复模块构成的网络(就像堆叠相同的乐高积木)中表现良好。但随着科学家开始设计更灵活、更复杂的网络,那些旧方法失效了,因为它们无法理解新的、不规则的形状。此外,用于训练这些预测工具的数据分散在不同的格式中,导致无法创建一个能够处理任何类型网络的单一、智能的预测器。为了解决这个问题,团队首先构建了一个庞大的统一库,名为 ONNX-Bench。他们收集了来自各种来源的近 65 万个不同的神经网络设计,并将它们全部转换成一种被称为 ONNX 的标准文件格式。这种格式就像是神经网络的一种通用语言,能够描述任何复杂或奇特的结构。

在拥有了这套海量的标准化设计后,研究人员面临着如何将这些信息输入计算机程序的挑战。他们意识到,描述网络最灵活的方式不是通过复杂的图表或矩阵,而是通过自然语言。他们开发了一种方法,将每个网络的技术细节——它执行的操作、各部分如何连接以及每个组件的具体设置——转化为可读的文本描述。想象一下,一个网络就是一套指令:“接收输入,通过一个滤波器,然后应用一个修正,最后输出结果。”研究人员编写了软件,为库中的每一个 65 万个网络生成了这些指令。

随后,他们利用这些文本训练了一个大型语言模型(一种熟悉人类语言的人工智能),使其充当性能预测器。该模型学习的目标不是写诗或回答问题,而是学习阅读描述神经网络的技术性“句子”,并预测其准确性。训练过程出奇地高效。该模型在仅使用以往方法所需数据的一小部分后,就学会了做出准确预测。事实上,它仅使用不到 1% 的训练数据就达到了与旧系统相同的性能水平。这表明,通过以清晰的文本格式描述网络,计算机可以比以前更快地掌握设计的核心特征。

这项新方法的真正考验在于,它是否能够推广到它从未见过的设计。研究人员通过在属于特定家族的网络上进行训练,然后要求模型预测完全不同家族的网络性能,对模型进行了测试。结果令人瞩目。该模型成功地以高准确度预测了这些未见过的设计,这种能力被称为“零样本迁移”(zero-shot transfer)。这意味着系统不需要针对新的网络类型进行重新训练或调整;它只需将从文本描述中学到的知识应用于理解新的结构即可。这是一个重大的飞跃,因为之前的工具往往被锁定在它们所训练的特定类型的网络中,无法适应新的、更复杂的设计。

研究人员还探讨了模型做出这些预测究竟需要哪些信息。他们将文本描述拆分为不同的部分,例如操作名称、流经其中的数据形状以及设计师设置的具体参数。他们发现,包含关于网络部件如何连接以及数据形状的信息是成功的关键因素。虽然模型仅凭基本结构也能表现良好,但加入这些具体细节后,它能做出更加精准的预测。这证实了基于文本的方法在捕捉神经网络设计的必要细节方面非常有效,而不会迷失在无关的代码变化之中。

尽管取得了这些成功,研究人员也谨慎地指出了他们工作的边界。该系统主要是在针对 CIFAR-10 数据集设计的图像识别任务网络上进行训练和测试的。虽然该方法在理论上可以处理任何能转换为其标准格式的网络,但目前的结果仅限于这一特定领域。团队承认,尽管他们的训练数据非常多样化,但仍来自于现有的基准测试,尚未涵盖所有可能的神经网络类型或任务。他们还指出,虽然他们的文本方法比以往基于图的方法更具灵活性,但在某些非常特定的受限场景下,那些旧方法仍可能表现得更好。

这一新基准和随附预测工具的发布,为更高效的人工智能探索开启了一扇大门。通过提供一种无需承担沉重训练成本即可瞬间评估设计的方法,研究人员现在可以在过去测试几个设计所需的时间内,测试数千个想法。这项工作表明,设计神经网络的未来可能不在于建造更快的硬件,而在于寻找更好地描述和理解设计本身的方法。研究人员希望,通过公开这些工具和数据,可以鼓励他人构建不再受限于特定类型网络、而是能够适应不断演进的人工智能格局的搜索方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →