← 最新论文
🤖 AI

RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

本文介绍了 RTL-BenchLS,这是一个包含超过 10,000 个经形式验证的 Verilog 设计以及三种新型自监督推理任务的大规模基准测试,旨在克服现有基准测试的扩展性限制,从而严格评估并指导用于硬件设计自动化的大语言模型(LLM)的发展。

原作者: Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名才华横溢但缺乏经验的学徒,仅通过自然语言指令来构建复杂的电子电路(称为 RTL 设计)。为了测试这名学徒是否真的在学习,你需要一个测试。

长期以来,用于评估这些 AI “学徒”(大语言模型或 LLM)的测试就像是幼儿园的涂色书。它们规模小、难度低,AI 很容易通过记忆模式来获得满分。这篇论文认为,我们需要一个真实的建筑工地来观察这些 AI 是否真的能胜任这项工作。

以下是 RTL-BenchLS 的故事——这是论文中引入的一个全新的、难度极高的测试。

1. 问题所在:“幼儿园”式的测试

现有的测试太简单了。它们具有以下特点:

  • 设计数量太少: 就像只有 50 个微型拼图,而不是成千上万个。
  • 过于简单: 就像要求 AI 建造一块单独的乐高积木,而不是一座完整的城堡。
  • 手段单一: 它们大多只是要求 AI 将一句话翻译成代码。一旦 AI 掌握了这种翻译技巧,测试就失去了意义,因为 AI 已经进入了“饱和”状态(在所有题目上都拿到了 100%)。

此外,人们曾认为制作一个更难的测试是不可能的。为什么?因为要制作一个更难的测试,通常需要人类专家为每一个谜题编写“答案解析”(testbench/测试平台)。并没有足够的专家去为 10,000 个复杂的电路编写解析。

2. 解决方案:一个自我检查的“魔镜”

研究人员构建了 RTL-BenchLS,这是一个包含超过 10,000 个经过验证的电路设计的庞大库。这些不是微小的积木;它们是复杂的结构,有些甚至拥有近 500 行代码。

为了在不雇佣数千名人类的情况下解决“答案解析”问题,他们发明了三种新型谜题,这些谜题就像一面魔镜。AI 必须通过证明自己理解了电路逻辑来完成任务,而不仅仅是靠猜测正确答案。

三种新型谜题:

谜题 1:“总结并重建”挑战(往返推理)

  • 设置: 你给 AI 一个复杂的电路图。
  • 任务: AI 必须首先写出一段关于该电路如何工作的总结(就像一份食谱),然后仅凭这份总结,从头开始重建完全相同的电路。
  • 陷阱: 如果总结漏掉哪怕一个微小的细节,重建的电路也会有所不同。系统会检查新电路是否与原始电路完全一致。
  • 类比: 这就像要求一位厨师品尝一道复杂的菜肴,写下食谱,然后根据那份笔记重新烹饪这道菜。如果味道变了,说明他失败了。

谜题 2:“缺失部分”挑战(掩码内容推理)

  • 设置: 你向 AI 展示一个电路,但用一个“空白”贴纸盖住了一段特定的代码块。
  • 任务: AI 必须观察周围的代码和对空白处的描述,从而推断出被贴纸覆盖的内容究竟是什么,并正确填补进去。
  • 类比: 想象一个拼图,其中一块碎片被遮住了。你必须观察缺口周围的图案,准确猜出缺失的部分长什么样,才能完成整幅图像。

谜题 3:“漏洞侦探”挑战(仓库级问题推理)

  • 设置: 你给 AI 一个完整的代码文件夹(一个项目)以及一条来自用户的投诉,内容是:“这个部分坏了!”
  • 任务: AI 必须在庞大的代码文件夹中找到损坏的部分,并对其进行修复,使其运行效果与人类专家所做的“黄金标准”修复完全一致。
  • 类比: 你递给一名技师一辆发出异响的汽车,并附上一张便条说“听起来有吱吱声”。技师必须在不破坏其他部件的前提下,找到引擎中那个精确的松动螺丝并将其修好。

3. 结果:AI 仍是一名“新手”

研究人员在这一全新的硬核基准测试上测试了 8 个最顶尖的 AI 模型。结果令人震惊:

  • 在旧的、简单的测试中: 最好的 AI 几乎能达到 88% 的正确率。
  • 在新的、困难的测试中:
    • 往返推理(总结并重建): 最好的 AI 仅有 ~23% 的正确率。
    • 缺失部分: 最好的 AI 仅有 ~28% 的正确率。
    • 漏洞侦探: 最好的 AI 仅有 ~12% 的正确率。

这意味着: 即便是最聪明的 AI,目前在真正理解复杂硬件逻辑方面也表现得很糟糕。它们擅长在简单任务中模仿模式,但当你要求它们通过复杂的逻辑进行推理时,它们会表现得非常吃力。

4. 为什么这很重要

这篇论文并不是说 AI 永远无法制造芯片。它是在说我们一直高估了它们的能力,因为我们的测试太容易了。

RTL-BenchLS 就像是将测试从幼儿园教室搬到了专业的工程公司。它向我们展示了 AI 在哪里失败(例如在处理复杂逻辑时感到困惑,或者在处理 Bug 报告时遗漏细节),并为工程师提供了一个衡量进步的真实工具。它留下了巨大的提升空间,证明了通往全自动硬件设计的旅程才刚刚开始。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →