✨ 要点🔬 技术摘要
想象一下你是一位试图建造一座最高效城市的建筑师,但你布置的不是摩天大楼和公园,而是在微小的硅芯片上排列微小的电子元件。这就是芯片布局的世界,它是制造我们每天使用的计算机和手机的关键步骤。目标是排列这些组件,使电力能在它们之间尽可能快地传输,同时消耗最少的能量和空间。如果排列得一团糟,信号就会陷入交通拥堵,芯片会发热,电池也会很快耗尽。几十年来,工程师们一直使用一条简单的经验法则来组织这些芯片:他们试图最小化连接各部分的导线总长度。这就像是通过确保道路尽可能短来进行城市规划一样。但转折在于:仅仅因为道路短,并不意味着交通就能顺畅流动。有时,一条短路会导致死胡同或瓶颈,从而导致整个城市发生交通瘫痪。本文探讨了为什么这个旧的经验法则经常失效,并介绍了一种更智能的设计新方法。
研究人员 Ruogu Chen 和 Jie Han 发现,仅仅计算导线长度的旧方法实际上是预测芯片在现实世界中表现极差的指标。他们发现,优化短导线往往会导致设计的芯片比使用标准行业基准 Hier-RTLMP 以及其他先前的 AI 方法设计的芯片运行速度更慢、效率更低。为了解决这个问题,他们为芯片设计师建造了一个“水晶球”。这个水晶球是一个特殊的计算机程序,它可以在芯片完全建成之前,精准地预测其运行速度和功耗。与以往仅关注大型建筑(称为宏单元/macros)并基于早期草图进行猜测的方法不同,这个新工具观察的是整座城市,包括微小的房屋(标准单元/standard cells)以及道路上的交通模式。
他们新工具的秘诀在于名为 PPAPlace 的“秘密配方”,它通过学习芯片设计的“期末考试”结果来进行学习。它不是根据初步草图进行猜测,而是通过研究芯片经过完整的交通和功耗模拟后的结果来进行学习。这使得它能够理解导致减速的真正瓶颈。一旦工具训练完成,它不仅会给出一个分数,还会给出一张地图。它会准确地告诉设计师应该移动哪个微小组件,以及向哪个方向移动,以使芯片运行得更快。把它想象成一个不仅告诉你最短路线,而且能实时引导你的汽车绕过交通拥堵的 GPS。
团队在五种不同的芯片设计上测试了这种新方法,而这些设计是该工具从未见过的。结果令人印象深刻。与行业中使用的标准高科技基准方法 (Hier-RTLMP) 相比,他们的新工具提高了芯片的速度(以“最差负裕量/worst negative slack”衡量)22%,并提高了整体时序效率(以“总负裕量/total negative slack”衡量)51%。至关重要的是,它在没有增加芯片功耗或增加制造难度的情况下实现了这一点。他们证明了通过使用这种基于学习的智能引导,他们可以持续超越层次化基准方法和其他被评估的先前方法,甚至平均而言也超越了强大的算法方法 Re2MaP,这证明了观察全局并从最终结果中学习是建造更快、更高效芯片的关键。
技术摘要:PPAPlace
问题陈述
芯片布局(Chip placement)是物理设计中的关键步骤,决定了芯片的性能、功耗和面积(PPA)。虽然传统的解析布局器(analytical placers)和近年来的人工智能(AI)方法通常将半周长线长(HPWL)作为主要优化目标,但近期的基准测试(特别是 ChiPBench)揭示了 HPWL 与后布线时序指标(如最差负时序裕量 WNS 和总负时序裕量 TNS)之间几乎不存在相关性。因此,针对 HPWL 进行优化的 AI 布局器在后布线 PPA 方面,表现出比层次化基准方法更差的趋势。
现有的通过跨阶段预测器来弥补这一差距的尝试面临两个显著局限:
标签保真度(Label Fidelity): 它们依赖于布线前静态时序分析(STA)或其他布线前指标作为训练标签,而这些指标无法真实反映最终的后布线时序排名。
表示能力(Representation): 它们通常仅使用宏单元(macro)位置来表示布局状态,丢弃了决定时序的关键信息——标准单元密度和布线拥塞。
方法论
本文提出了 PPAPlace ,一种时序驱动的可微代理模型,能够直接从完整的混合尺寸布局状态(宏单元和标准单元)中预测后布线 PPA。该方法由三个核心部分组成:
1. 标签保真度分析
在设计预测器之前,作者对十个电路和四个设计阶段(CTS 前、CTS 后、全局布线后、详细布线后)进行了受控研究。
发现: 布线前时序标签(如 LaMPlace 等前作所使用的)与最终后布线排名的相关性较差。
结论: 全局布线后(Post-GRT) 标签在对最终时序的高保真度(Spearment ρ ≈ 0.86 \rho \approx 0.86 ρ ≈ 0.86 )与成本效益(每个样本 0.20 小时,而全流程详细布线后为 3.7 小时)之间达到了最佳平衡。
2. 双流可微预测器
PPAPlace 采用双流神经网络架构,在 Post-GRT 标签上进行训练,以预测 WNS、TNS、功耗和面积。
空间流(Spatial Stream): 一个卷积神经网络(CNN)处理布局的 64 × 64 64 \times 64 64 × 64 网格表示。该网格捕捉了单元密度、引脚密度、宏单元占用情况、类 RUDY 风格的拥塞代理以及网线包围盒密度。
图流(Graph Stream): 一个图注意力网络(GAT)处理将宏单元视为节点的网表。它编码了连通性、宏单元维度、宽高比以及网线跨度。
可微性(Differentiability): 整个流水线——从单元坐标到特征提取(使用高斯泼溅 Gaussian splatting 和 log-sum-exp 等可微近似方法),再到最终的 MLP 预测——是完全可微的。这使得预测的时序指标梯度可以端到端地回传至单元坐标。
3. 梯度引导部署
论文引入了两种利用预测器梯度的模式:
PPAPlace-CoOpt: 该代理模型作为协同目标注入 DREAMPlace 的解析优化循环中。在预热阶段之后,总损失函数包含预测的 WNS 和 TNS 梯度,从而引导宏单元和标准单元的全局拓扑结构。
PPAPlace-Refine: 一种后布局优化步骤,对任何已收敛的合法布局应用投影梯度下降。它通过调整宏单元位置来最小化代理时序目标,随后进行合法化和标准单元重优化。此模式不需要访问源布局器的内部机制。
核心贡献
标签保真度研究: 本文确立了全局布线后阶段是跨阶段 PPA 预测中最具成本效益的监督阶段,并证明了布线前标签往往具有误导性。
可微双流预测器: 一种结合了图注意力(网表连通性)和空间卷积(密度/拥塞)的新颖架构,可在完整的混合尺寸布局状态上运行。它实现了 0.31 的 Kendall's τ \tau τ WNS 排名,相比于仅基于宏单元的布线前基准(0.08)有了显著提升。
梯度引导优化: 两种部署策略(CoOpt 和 Refine)利用端到端时序梯度来提高布局质量,且无需在测试电路上重新训练。
实验结果
该方法在来自 ChiPBench 套件的五个留出电路(排除训练集)上进行了评估,并与层次化 RTLMP 基准以及其他先进方法(如 DREAMPlace、LaMPlace、Re2MaP 等)进行了对比。
性能增益: 使用结合了 CoOpt+Refine 的方法,PPAPlace 相比层次化基准,使平均 WNS 提升了 22% ,TNS 提升了 51% 。
对比: 其表现优于所有评估过的先前方法,包括 Re2MaP 的算法方法。
可布线性与功耗: 在实现时序改进的同时,保持了可布线性(零设计规则检查违规),并将功耗波动维持在 1–2% 以内。
泛化能力: 模型展示了强大的零样本泛化能力,能够处理具有不同宏单元数量甚至不同设计家族(例如未见过的 Ariane CPU)的电路。当应用于由不同工具(RTLMP)生成的布局时,它也显示出显著但略有下降的相关性,表明其在不同布局分布下的鲁棒性。
效率: 离线训练成本是可摊销的,且推理/优化时间增加的开销极小(低于标准 DREAMPlace 运行时间的 2.5 倍)。
重要意义
本文认为,优化布局需要超越线长代理和布线前指标。通过验证 Post-GRT 标签提供可靠信号,并构建一个能同时捕捉连通性和空间拥塞的可微代理模型,PPAPlace 证明了学习到的后布线时序目标可以有效地引导布局优化 。
这项工作为跨阶段学习中监督阶段的选择建立了原则性基础,并证明了可微代理可以集成到解析布局器中,或用作后处理优化手段,从而在无需在优化循环中进行昂贵的完整流程评估的情况下,实现最先进的 PPA 结果。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。