NoTB: Oracle-Free Triage of LLM-Generated RTL via Cross-Model Formal Consensus
该论文介绍了 NoTB,这是一个无需先验模型的框架,它通过在多个由大语言模型生成的 RTL 设计之间进行序列等价性检查,以建立形式化共识信号,从而在不依赖测试平台或黄金参考的情况下,实现对功能正确性的高精度分诊。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机芯片设计领域,工程师传统上编写描述电流如何在电路中流动的代码。这种被称为寄存器传输级(RTL)的代码是硬件的物理蓝图。几十年来,创建这种代码一直是一个细致的人工驱动过程,每一行代码都要经过与信任参考标准的比对,以确保芯片能够正常工作。最近,人工智能开始为我们编写这些代码。大型语言模型——即那种可以写故事或回答问题的同类技术——现在正被要求根据简单的文本描述来生成这些复杂的硬件蓝图。虽然这些模型可以快速生成许多版本的设计,但一个关键问题仍然存在:工程师如何知道这些由 AI 生成的设计中,哪些才是真正有效的?在过去,答案是将 AI 的输出与完美的、由人类制作的参考标准进行对比,或者将其放入模拟测试中运行。然而,创建这些完美的参考标准既昂贵又耗时,而且测试本身有时会遗漏隐藏的错误。
哥伦比亚大学的一个研究小组推出了一种无需完美参考或预写测试即可筛选 AI 生成设计的新方法。他们将该系统称为 NoTB。NoTB 不依赖于单一的裁判来决定一个设计是否优秀,也不依赖于可能遗漏关键缺陷的模拟运行,而是要求多个不同的 AI 模型独立编写同一个设计。随后,它使用一种名为“序列等效性检查”的严谨数学工具,来观察这些不同的版本在每种可能的情况下是否表现得完全一致。其核心思想是,如果来自不同训练方式的多个不同 AI 模型都达成了完全相同的行为,那么它们极有可能找到了正确的解决方案。这种方法使工程师能够在将设计投入实际芯片制造之前,尽早识别出最值得信赖的设计,从而节省时间和资源。
研究人员在 78 个不同的硬件设计任务上测试了这种方法。他们使用四个不同的语言模型家族来为每个设计生成多个版本。对于每个任务,他们都对比了输出结果,以查看哪些在行为上是数学意义上完全一致的。他们发现,当来自四个不同 AI 家族的设计在行为上达成一致时,系统的正确率接近 95%。这种高置信度是以一种权衡为代价的:该系统仅对大约 27% 的任务做出预测。然而,通过将要求降低到仅需三个家族达成一致,该系统可以覆盖 33% 的任务,同时仍保持 87% 的准确率。这为设计师提供了一个灵活的工具:他们可以选择极其谨慎,只接受最确定的设计;或者也可以接受略高的风险,以获得更多可用于进一步测试的设计。
这项研究还揭示了为什么旧的 AI 设计检查方法是不可靠的。一种常见的方法是要求第二个 AI 模型充当裁判,并预测一个设计是否正确。研究人员发现,这种方法并不一致;同一个设计可能会因为执行判断的 AI 模型不同,而被一个裁判判定为正确,而另一个判定为错误。另一种方法是将设计运行在由 AI 创建的测试中。研究人员发现,结果的质量完全取决于该测试的质量。如果测试较弱,它可能会无法捕捉到错误,导致系统误认为一个有缺陷的设计是正确的。相比之下,新方法不依赖于测试或裁判。它依赖于这样一个事实:这些设计在所有可能的输入范围内都被证明是恒等的,因此这种一致性是设计本身的属性,而不是检查工具的属性。
为了使这一过程高效,该系统使用了一种智能过滤技术。它并没有比较每一个设计对,因为这会耗费大量时间,而是首先剔除完全重复的设计,然后将已经被证明是相同的设计进行分组。这显著减少了需要进行的比较次数。从生成设计到完成检查,整个过程平均每个任务耗时一到十六分钟,具体取决于生成的版本数量。运行该系统的成本也是可控的,因为它避免了为了让 AI 模型充当裁判而进行昂贵的重复调用。研究人员强调,这种方法并不是要取代最终验证。相反,它扮演着一种分诊系统(triage system)的角色,旨在对 AI 生成的设计堆进行分类,以便将最有希望的设计送入后续阶段,同时将那些不确定的设计留作更传统的、彻底的检查。
研究结果表明,所使用的 AI 模型的差异性是该系统成功的关键。研究人员测试了如果从组合中移除其中一个 AI 家族会发生什么。他们发现,即使缺少一个模型,系统依然保持稳健和准确,这证明了置信信号来自于群体的集体共识,而非依赖于任何单一模型。这使得该方法在实际应用中具有可行性,因为在实际应用中,获取特定 AI 模型的能力可能会有所不同。研究结论指出,通过将关注点从模拟测试转向对一致性的形式化数学证明,工程师可以构建一个更可靠的流程来使用人工智能进行硬件设计。这使得工业界能够在利用 AI 生成的速度的同时,保持复杂芯片所需的严格安全标准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。