← 最新论文
💻 computer science

OneDSE: Metric-Conditioned Inverse Modeling and Active Search for Sample-Efficient DSE

本文介绍了 OneDSE,这是一个用于 CPU 和硬件设计空间探索的高样本效率框架,它通过统一度量条件逆向设计(MIND)和代理辅助主动搜索循环(SAIL),能够以显著少于现有方法的评估次数来快速识别高质量设计。

原作者: Ritik Raj, Akshat Ramachandran, Danny Samuel, Jeff Nye, Shashank Nemawarkar, Tushar Krishna

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ritik Raj, Akshat Ramachandran, Danny Samuel, Jeff Nye, Shashank Nemawarkar, Tushar Krishna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算机是数字世界的引擎,驱动着从我们口袋里的智能手机到运行互联网的海量数据中心的一切。几十年来,这些机器通过缩小芯片内部微小的晶体管来变得更快、更高效,这一趋势被称为摩尔定律。然而,这种物理层面的缩小已经撞到了墙:我们无法再将组件做得更小,否则就会遇到物理极限和功耗问题。为了持续提升性能,工程师现在必须在设计本身进行创新,通过重新排列处理器的内部架构,以用相同的能量完成更多的工作。这个过程被称为设计空间探索(design space exploration),它涉及测试无数种设置组合——例如内存缓存的大小或数据路径的宽度——以找到完美的配置。问题在于,可能的组合数量极其庞大,大约有一万亿亿个,以至于即使使用最快的超级计算机,也不可能逐一进行测试。

多年来,解决这一问题的标准方法是猜测一个设计,运行详细的模拟以观察其表现,然后利用该结果来猜测下一个设计。这是一个前瞻性的过程:“如果我这样构建,会发生什么?”但这种方法速度极慢,且经常陷入局部陷阱,从而错过那些需要同时改变设计中多个部分的更好方案。来自佐治亚理工学院、密歇根大学和 Condor Computing 的一个研究小组提出了一种激进的策略转变。他们不再询问一个设计能实现什么,而是反过来问:“为了实现这些特定的性能目标,我需要构建什么样的设计?”通过将问题反转,他们创建了一个名为 OneDSE 的系统,该系统能以以往所需的一小部分计算量找到高质量的处理器设计。

这个新系统的核心在于对处理器如何与运行其上的软件进行交互有着深刻的理解。处理器的性能不仅取决于其自身的内部设置,还高度依赖于它被要求执行的具体任务。研究人员发现,如果你告诉系统处理器将要做什么样的类型的工作——通过向其输入软件执行指令的详细记录——系统就能以惊人的准确度预测出必要的硬件设计。他们在一个大型随机处理器设计及其性能结果的集合上,训练了一个复杂的计算机模型,即一种被称为 Transformer 的人工智能类型。该模型学会了如何将特定的性能目标(例如期望的速度和物理尺寸限制)直接映射回实现这些目标所需的特定硬件设置。

在测试中,这种逆向方法证明了其惊人的效率。当研究人员要求系统为五种不同的复杂工作负载寻找设计时,它仅通过运行极少数次的详细模拟(有时仅为 1 到 58 次)就确定了顶级的配置。相比之下,传统的基于进化算法的方法依赖于经过数千次尝试来缓慢改变设计,需要多出几十倍甚至数百倍的模拟次数才能找到质量相当的设计。例如,在某一个特定的工作负载上,新系统仅用了几分钟就找到了一个传统方法需要花费近千倍时间才能匹配的设计。该系统通过遍历一系列期望的性能目标,并立即生成相应的硬件蓝图,从而绕过了在浩瀚的可能性空间中盲目游走的需要。

然而,研究人员意识到,无论多么优秀的单次预测都可能并不完美。为了确保能够达到绝对最佳的设计,他们在预测模型之上构建了第二层结构,称为测量环路(measurement loop)。该系统使用初始预测作为起点,然后利用一套协调的工具对设计进行更大规模、更具战略性的调整。传统的搜索方法之所以失败,是因为它们试图通过一次只改变一个微小部分来改进设计。但在处理器设计中,一个更好的解决方案通常需要同时改变多个部分——比如在扩大数据摄入量的同时,也相应地扩大内存存储和处理队列。如果你只改变其中一部分,系统性能往往会下降,从而创造出一个让搜索陷入其中的“谷底”。新系统的协调工具允许它通过同时调整多个设置来跨越这些“谷底”,并由初始预测引导以保持正确的路径。

结合这种方法的结论是决定性的。仅使用 512 次详细模拟,该系统就达到了传统方法在运行 6,400 次模拟后所能达到的最佳设计的 98% 的水平。在某些情况下,它甚至超越了传统方法的最佳结果。至关重要的是,它发现的设计完全是全新的;该系统发现了传统方法从未考虑过的配置。研究人员还展示了这种方法并不局限于中央处理器。他们成功地将同样的技术应用于计算机内存控制器以及用于人工智能的专用芯片的设计,表明该方法足以应对不同类型的硬件挑战。

这项工作代表了工程师对待计算未来方式的重要进步。通过将传统的逆向设计过程进行反转,并以工作负载本身作为引导,研究人员已经证明,可以用远少的资源来应对现代芯片设计的巨大复杂性。该系统不仅节省了时间,还为寻找那些因搜索方法过慢或过于僵化而难以发现的最优设计开辟了新的可能性。随着对更快、更高效计算的需求不断增长,这类工具对于在无需等待物理定律改变的情况下解锁下一代技术创新将至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →