← 最新论文
💻 computer science

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

本文介绍了 MultModLM,这是一个用于评估大语言模型根据 RTL 描述生成硬件原理图能力的、多模态基准及综合评估框架,研究揭示了尽管模型能够生成具有视觉可解释性的输出,但它们在功能正确性方面表现欠佳,且基于大语言模型的评估器在判断硬件设计的结构精确度方面是不可靠的。

原作者: Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

发布于 2026-06-29✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(即大语言模型,或称 LLM),她擅长编写关于机器的故事。现在,想象你要求这位图书管理员仅根据一段描述机器如何运作的文字,来绘制出一张该机器的蓝图。

这篇题为 MultModLM 的论文,本质上是为这些试图根据书面代码(称为 RTL)绘制机器蓝图(称为硬件原理图)的“图书管理员”所出的成绩单。

以下是作者所做的工作以及他们的发现,使用了简单的类比:

1. 问题所在:“缺失的环节”

通常情况下,当工程师设计计算机芯片时,他们会编写代码(RTL),然后使用昂贵的专业软件将代码转化为视觉图形(原理图)。这就像是拥有一份食谱,却需要一位专业厨师来画出菜肴的图片。

最近,AI 模型在编写代码方面已经变得非常出色,但还没有人测试过它们是否能根据这些代码绘制出机器图表。此前并没有一个“测试”来验证 AI 是否能做到这一点。作者创建了这个测试,称之为 MultModLM

2. 测试内容:99 个不同的谜题

研究人员收集了 99 个不同的“谜题”。这些是数字电路的书面描述,范围从简单的计数器到复杂的数值检查机。

  • 挑战: 他们将这些书面描述交给两个顶尖的 AI 模型(GPT 和 Gemini),并要求它们绘制电路图。
  • 转折点: 与只有一个正确答案的数学题不同,同一个机器可以有多种绘制方式。就像你可以把房子画成红屋顶或蓝屋顶,而它仍然是同一栋房子一样,AI 也可以用不同的方式绘制电路。这使得对答案进行评分变得非常棘手。

3. 评分系统:评审团

由于没有单一的“正确”图纸,作者无法直接使用计算机来检查图纸是否正确。相反,他们建立了一个多阶段评审团

  • 艺术家自我评审: AI 绘制图片,然后为自己的作品评分。
  • 竞争对手评审: 另一个 AI 模型查看图纸,并根据原始代码进行评分。
  • 盲审评审: 一个 AI 仅查看图纸(不看代码),以观察该图纸本身是否合理。
  • 人类专家: 真正的工程师查看图纸,以判断它们是否真正正确。

他们使用一份清单(评分标准)来评估诸如“导线是否连接正确?”、“是否显示了时钟信号?”以及“图纸是否易于阅读?”等事项。

4. 重大发现:AI 评审员完全不懂行

这是论文中最令人惊讶的部分。

  • 结果: 当研究人员将 AI 评审员给出的分数与人类专家给出的分数进行比较时,他们发现两者之间几乎没有任何一致性
  • 类比: 想象一下,你让一个机器人给一幅画打分。机器人因为它色彩丰富就给了它 10/10 分。而人类专家因为透视关系不对,只给了它 2/10 分。论文发现,当尝试对这些技术图纸进行评分时,AI 评审员实际上是在“瞎猜”或产生幻觉。它们与人类专家完全脱节。

5. 结论:AI 能画,但不能验证

论文得出了两个主要结论:

  1. AI 可以尝试绘制: 这些模型能够生成看起来像电路图的图像。它们并不完美,但具有视觉可解释性。
  2. AI 不能担任裁判: 你不能信任 AI 来告诉你一个硬件设计是否正确。“AI 作为评审员”的方法在编写文章或代码文本时效果很好,但在检查硬件图纸的结构精确度方面完全失效

简而言之: 作者构建了一个测试,旨在观察 AI 是否能将代码转化为机器图像。他们发现,虽然 AI 可以尝试绘制这些图像,但它非常不擅长对这些图像进行评分。如果你想知道一个硬件设计是否正确,你仍然需要人类专家,而不是另一个 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →