Bridging the Last Mile of Circuit Design: PostEDA-Bench, a Hierarchical Benchmark for PPA Convergence and DRC Fixing
本文介绍了 PostEDA-Bench,这是一个包含 145 个机器可验证任务的分层基准,用于评估大语言模型智能体在电子设计自动化后端的布局布线规则检查修复及性能、功耗和面积收敛方面的表现,结果表明,尽管智能体在合成任务或单目标任务上表现尚可,但在复杂推理和多目标权衡方面却存在显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在用微小的、微观的乐高积木建造一座庞大且极其复杂的城市。这座城市就是一块计算机芯片。你拥有一支由专家建筑师(工程师)组成的团队,以及一套非常严格的建筑规范(设计规则)。
长期以来,计算机一直协助建筑师设计这座城市。但当设计完成后,往往会出现一个“最后一公里”的问题:计算机可能会遗漏墙壁上的几处微小裂缝,或者这座城市可能略大、略慢,或耗电过多。解决这些最终顽固的问题,通常需要人类专家凝视蓝图,找出问题确切所在,并进行微小而精确的调整。
本文介绍了一种新方法,用于测试AI 智能体(由大型语言模型驱动的智能计算机程序)能否接管这项“最后一公里”的工作。作者将他们的测试称为POSTEDA-BENCH。
以下是他们所做工作及发现结果的简要分解,使用了日常类比:
1. 两大难题:“代码警察”与“预算”
该基准测试在两个截然不同的挑战上评估 AI:
DRC(设计规则检查)—— 代码警察:
想象一位严格的建筑检查员,他穿过你的城市,指出违规行为:“这条小巷太窄了”,或者“这两栋建筑靠得太近了”。- 简单部分: 有时违规行为显而易见,比如一面明显太薄的墙。AI 擅长处理这种情况。
- 困难部分: 有时违规行为隐藏在混乱的街区中,或者修复一个问题会意外破坏邻居的墙壁。这需要“几何推理”——在三维空间中可视化形状如何契合。论文发现,AI 在此处表现挣扎,常常在复杂性中迷失方向。
PPA(功耗、性能、面积)—— 预算:
想象你需要重新设计这座城市,使其同时变得更快、更节能、占地更少。- 简单部分: 如果你只需要让城市变得更快,AI 通常能找到可以调节的旋钮来加速它。
- 困难部分: 如果你需要让它变得更快、更小,同时使用更少的能源,这就成了一场平衡游戏。加快速度可能会导致能耗增加。AI 往往变得贪婪,修复了一件事却破坏了另一件事,无法找到所有要素协同工作的完美“甜蜜点”。
2. 新测试:POSTEDA-BENCH
在这篇论文之前,芯片设计领域的 AI 测试就像在空旷笔直的公路上开车。它们并未测试 AI 能否应对拥挤的城市十字路口或突如其来的暴雨。
作者构建了POSTEDA-BENCH,这就像一场包含 145 种不同场景的驾驶考试:
- 合成场景: 干净、虚构的问题(就像笔直的公路)。
- 真实世界场景: 来自实际芯片设计的杂乱、遗留问题(就像布满坑洼的拥挤十字路口)。
- 工具: 他们使用了开源工具(就像免费、社区构建的地图)和商业工具(就像高端、付费的 GPS),以确保测试具有现实性。
3. AI 做对了什么(以及做错了什么)
研究人员使用不同的“策略”(例如给它们检查清单 vs. 让它们大声思考)测试了 8 种不同的 AI 模型(有些来自大型科技公司,有些是开源的)。
- 好消息: AI 在处理简单、孤立的任务方面出奇地好。如果你指出一个具体的规则违规并说“修复这个”,它通常能做到。它在优化单一目标(例如让芯片更快)方面也相当不错。
- 坏消息: 当事情变得混乱时,AI 就会崩溃。
- 视觉推理: 当 AI 必须查看芯片布局的图片以理解为什么规则被违反时,它的表现要好得多。这就像给 AI 戴上一副眼镜;没有眼镜,它就是在黑暗中猜测。
- 权衡陷阱: 当被要求平衡多个目标(速度 vs. 功耗 vs. 尺寸)时,AI 经常失败。它没有找到平衡点,而是修复了速度,却让功耗飙升。它缺乏“常识”,不知道何时停止按下一个按钮,因为那会破坏另一个按钮。
4. “视觉”带来的提升
最有趣的发现之一是,赋予 AI看见芯片布局(就像查看地图)的能力,对其有显著帮助。
- 类比: 想象试图仅通过阅读关于管道位置的文字描述来修复管道泄漏。这很难。但如果你能看见管道和泄漏点,就容易多了。当 AI 能够“看见”布局图像并与文本指令结合时,其表现要好得多。
5. 结论
论文总结道,虽然 AI 在遵循指令和修复简单错误方面越来越擅长,但它尚未准备好成为芯片设计最后、最困难阶段的“首席工程师”。
- 它能处理“简单”的修复。
- 它在处理需要可视化复杂形状的“混乱”现实世界问题时表现挣扎。
- 它在平衡多个相互竞争目标的“杂耍”方面表现挣扎。
作者构建这个测试平台,并非为了说"AI 无用”,而是为了确切展示它在哪里失败,以便研究人员能够构建更好的 AI,使其最终能够处理设计下一代计算机芯片的全部复杂性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。