想象一下你正在尝试为旅行打包一个行李箱,但你有一个严格的规则:你必须安排好一切,使其完美契合、看起来整洁,并且到达目的地时易于拿取。在计算机芯片的世界里,这个“行李箱”就是硅晶圆(silicon die),而其中的“物品”则是数十亿个微小的电子元件。排列这些元件的过程被称为布局(placement)。如果你打包得不好,连接它们的导线就会变得太长,发生交通拥堵(称为拥塞/congestion),导致芯片运行过慢或功耗过高。
为了解决这个问题,工程师们使用被称为**解析布局器(analytical placers)**的智能计算机程序。这些程序试图通过最小化一个“评分”或“目标函数(objective function)”来找到最佳排列方式。你可以把这个评分想象成一个完美打包任务的“食谱”。传统上,这个食谱只关心导线有多短以及物品分布得多么均匀。然而,这里有一个陷阱:绘图板上的短导线并不总是意味着现实生活中的高速芯片。真正的考验在稍后阶段到来,即当导线被实际制造出来并对芯片进行速度测试时。如果食谱过于简单,最终产品可能会无法通过速度测试,迫使工程师推倒重来。多年来,专家们一直试图通过手动微调食谱或使用“黑盒”人工智能来修复这个问题,后者虽然效果好,但却无法理解或在出错时进行修复。
这正是名为 CoEvoP&R 的新方法大显身手的地方。这就像是给一位富有创造力且超级聪明的机器人厨师一本食谱,并要求它发明一种新的食谱,以保证得到一个完美的行李箱,而不仅仅是一个整洁的行李箱。该论文介绍了一个框架,它使用大语言模型(LLM)——即驱动先进聊天机器人的同类技术——来自动演化并改进这些布局食谱。与其让一个人类去猜测完美的公式应该是怎样的,不如让 LLM 扮演一个好奇的探索者。它提出一个新的“目标函数”(一个数学公式),在模拟芯片上进行测试,然后根据现实世界的布线和时序工具检查结果。如果新的公式让导线变短且芯片变快,LLটি就会从这次成功中学习。如果失败了,LLM 也会从错误中学习。
研究人员发现这种方法效果惊人地好。通过让 AI “演化”芯片打包的规则,他们能够显著提高最终芯片设计的质量。在一组标准测试设计中,与标准方法相比,新方法将连接元件的导线长度减少了 16.9%,并将交通拥堵(拥塞)减少了 36.7%。更令人印象深刻的是,它提升了芯片的速度,使最差情况下的时序延迟改善了 0.70 纳秒,并修复了总计 912 纳秒 的时序延迟。团队还在不同类型的芯片上测试了这些演化出的食谱,发现它们依然表现出色,在其他设计上减少了 5.4% 的导线长度和 23.2% 的拥塞。
这种方法的特别之处在于,AI 不仅仅是一个神秘的黑盒;它能以人类可读、可理解的方式写出实际的数学公式。它通过保留一份关于“什么有效”和“什么无效”的“记忆”来进行学习,并利用这段历史来指导下一次尝试。该论文表明,这种方法弥合了初始打包计划与最终现实世界芯片性能之间的差距,提供了一种无需人类专家手动微调每个变量即可自动发现更好设计规则的方法。这是迈向一种不仅能遵循指令,而且能发明更好方法来解决复杂物理问题的计算机的重要一步。
技术摘要:CoEvoP&R
问题陈述
现代分析型布局工具(如 DREAMPlace)依赖于可微目标函数来引导全局布局。这些目标通常结合了中间代理指标,例如半周长线长(HPWL)的平滑近似和单元密度惩罚项。然而,在布局阶段的这些代理指标与最终布线设计的质量(包括最差负时序裕量 WNS 和总负时量 TNS 等时序指标)之间存在显著的失配。
此前尝试弥合这一差距的方法分为两类,但均存在局限性:
- 人工设计的项: 如矩形均匀布线密度(RUDY)等方法引入了布线需求估计,但依赖于专家近似,这些近似通常需要针对不同的设计或工艺进行重新调优。
- 学习型黑盒代理: 如 LaMPlace、GOALPlace 和 RoutePlacer 等方法使用学习到的预测器或可微可布达性代理。虽然有效,但这些“黑盒”组件难以解释、调试,也难以集成到需要符号化、可微目标的现有分析布局流程中。
方法论
CoEvoP&R(通过布线反馈协同演化布局目标)通过引入一种基于大语言模型(LLM)的框架,自动演化出可读且可微的分析布局目标,从而解决了上述局限性。该系统是一个由三个主要阶段组成的闭环演化过程:
存档约束的提议(Archive-Conditioned Proposal):
在每一代中,系统会组装一个 LLM 提示词(Prompt)。该提示词包括:
- 一个限制性的目标接口,定义了允许的语法和组件。
- 基准上下文以及上一代的父代目标。
- 一个包含先前候选方案、其行为指标及失败教训的存档。
- 来自布局、时序代理和布线工具的测量反馈。
LLM 生成一个候选符号程序(类似于 Python 的脚本),用于定义初始化映射、调度变量的更新映射以及损失函数。
候选验证与嵌入(Candidate Validation and Embedding):
提议的符号程序不会立即执行。它们必须经过验证过程,以确保其在 DREAMPlace 框架内是可微、有界且可执行的。经过验证的候选方案会被嵌入到布局器中,取代原生的目标函数。系统确保生成的目标与基于梯度的优化保持兼容。
成本缩放评估与存档更新(Cost-Scaled Evaluation and Archive Update):
为了管理计算成本,CoEvoP&R 采用了分层评估策略:
- A 级(Tier A): 为所有验证过的候选方案运行分析布局器,记录 HPWL、溢出(overflow)和收敛轨迹。
- B 级(Tier B): 对选定的候选方案应用时序代理,以估计 WNS/TNS 的改进情况。
- C 级(Tier C): 为一小部分高潜力候选方案调度实际布线器,以测量布线后的线长、拥塞和时序。
系统使用 MAP-Elites 存档来存储成功的候选方案。每个候选方案根据其复杂度、机制族以及行为指标(HPWL、溢出、时序)被映射到一个特征单元中。存档通过对可用指标的帕累托支配(Pareto dominance)进行更新,以保留不同行为生态位中的多样性。负面记忆(Negative memory)则存储失败的候选方案及其失败原因,以防止 LLM 在未来的提示词中重复无效的机制。
核心贡献
论文声称了四项创新贡献:
- LLM 目标演化: 首个能够自动演化与实际布线和布线工具集成的分析布局目标函数的框架,超越了静态或人工设计的项。
- 自动化验证: 通过限制性接口确保 LLM 生成的目标在 DREAMPlace 等分析布局流程中是可微、有界且可执行的。
- 布线感知反馈: 搜索过程由下游布线和时序反馈引导,使目标能够适应实际布线质量,而非仅仅依赖布局阶段的代理指标。
- 存档引导迭代: 系统维护一个包含目标及其测量反馈(布局、布线、时序及失败数据)的存档,利用这些历史信息来约束未来的 LLM 提示词,并引导向多样化且高性能的解进行演化。
实验结果
该框架在 8 个 ChiPBench Nangate45 设计和 8 个 ICCAD 2015 Superblue 设计上进行了评估,使用了三个随机种子。
- ChiPBench Nangate45: 与原生 DREAMPlace 相比,CoEvoP&R 实现了 16.9% 的布线后线长减少和 36.7% 的拥塞减少。它还在时序方面实现了 0.70 ns 的 WNS 提升和 912 ns 的 TNS 提升。这些结果在拥塞和时序方面优于其他自动化搜索方法(如 EvoPlace、AutoDMP)和学习型代理(如 LaMPlace),同时保持了具有竞争力的线长表现。
- ICCAD 2015 Superblue: 与基准相比,该框架减少了 5.4% 的布线后线长和 23.2% 的拥塞。
- 泛化能力: 零样本迁移实验(CoEvoP&R-T)显示,在 Nangate45 上演化的目标在无需重新演化的情况下应用于 Superblue 和 ASAP7 设计,仍表现出正向收益,这表明演化出的目标捕捉到了通用的设计原则。
- 消融实验: 实验证实,存档约束迭代和成本缩放评估层级至关重要。移除存档或仅使用 A 级(仅布局)评估会显著降低性能。
意义
本文将 CoEvoP&R 定位为使可微布局与下游物理设计流程之间的接口变得可检测和自动化的重要一步。通过演化出可读的符号化目标而非黑盒模型,该方法提供了一种在不牺牲工业级 EDA 流所要求的可调试性和集成能力的前提下,优化功耗、性能和面积(PPA)指标的路径。作者认为,这种方法验证了 LLM 引导的程序演化作为优化复杂工程目标(其搜索空间受物理定律和工具要求约束)的一种可行方法。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。