← 最新论文
🤖 AI

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

本文揭示了一种关键的“海市蜃楼”现象,即多模态模型绕过视觉电路图、仅依据文本标识符生成代码,并提出了VeriGround——一个经过匿名化和偏好对齐训练的40亿参数模型,旨在实现可靠且真正基于电路的Verilog代码生成。

原作者: Guang Yang, Xing Hu, Xiang Chen, Xin Xia

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Guang Yang, Xing Hu, Xiang Chen, Xin Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《从幻象到落地:迈向可靠的多模态电路到 Verilog 代码生成》的通俗化解释,并辅以生动的类比。

核心问题:“海市蜃楼”效应

想象你在参加一场考试,要求你根据一张城市照片画出该城市的地图。然而,考试说明中还附带了一份街道名称列表(例如“主街”和“橡树大道”)。

研究人员发现,许多人工智能(AI)模型正在作弊。它们并没有真正观察城市照片来推断道路走向,而是读取街道名称列表,背诵出它们早已记住的地图。

“海市蜃楼”现象:
作者将这种现象称为海市蜃楼。这就像在沙漠中看到并不存在的水一样。

  • 测试: 他们向 AI 展示真实的电路图(照片),并要求其编写代码(地图)。
  • 诡计: 随后,他们用一张纯白图片替换了真实的照片,但完全保留了街道名称列表(模块头)。
  • 结果: 令人惊讶的是,AI 在面对空白图片时的表现与之前一样好,有时甚至更好

这证明 AI 并没有真正“看见”电路。它完全忽略了图片,仅根据部件名称来猜测代码。如果名称是“求和”和“进位”,AI 就知道必须构建一个“半加器”,而无需查看图表中的任何连线。

为何这很重要:硅片陷阱

这为何重要?论文将其比作建造房屋。

  • 普通代码: 如果网页设计师犯了错,网站看起来会很难看。你可以轻松修复它。
  • 电路代码: 如果 AI 在电路图中犯错,那段代码会被烧录到物理芯片(硅片)上。一旦芯片制造完成,你就无法“撤销”(Ctrl+Z)这个错误。这就像浇筑地基时才发现门开在了错误的一侧。你必须拆掉整栋建筑。

如果 AI 基于文本线索而非视觉现实进行幻觉(编造),它可能会制造出在纸面上完美但在现实中失败的芯片。

解决方案:“失忆”测试与新 AI

为了解决这个问题,研究人员构建了两样东西:一项新测试和一个名为VeriGround的新 AI 模型。

1. 新测试:"C2VEVAL"(失忆测试)

他们创建了一个基准测试,对测试内容进行了“匿名化”处理。

  • 正常模式: AI 看到图表和名称(例如“时钟”、“复位”)。
  • 匿名模式: 他们将所有名称更改为通用占位符,如"Val_0"、"Val_1"和"Val_2"。
  • 目标: 如果 AI 真正理解了图片,它在使用通用名称时仍应能正常工作。如果它只是靠名称作弊,它应该会失败。

结果: 当他们移除名称后,大多数大型 AI 模型的性能急剧下降。这证实了“海市蜃楼”是真实存在的。模型真正观察图片的时间仅占约8–9%

2. 新 AI:"VeriGround"(诚实的学生)

研究人员训练了一个新的、更小的 AI(仅 40 亿参数,与 GPT-5 等巨头相比微不足道),以停止作弊。他们使用了三种特定的训练技巧:

  • 技巧 A:“蒙眼”训练(匿名化): 他们迫使 AI 从匿名数据中学习。由于无法依赖名称,它必须学会阅读图表中的实际线条和形状。
  • 技巧 B:“说不”训练(拒绝增强): 他们教导 AI,当图片空白或与说明不匹配时,要说“我做不到”。这阻止了 AI 在不确定时进行猜测。
  • 技巧 C:“第一印象”聚焦(D-ORPO): 这是一项技术调整。当 AI 决定回答或拒绝时,它会在响应的最初几个词中做出该决定。研究人员让 AI 格外关注这几个词,以确保它在生成回答还是拒绝回答之间做出正确选择,而不会被回答的长度所迷惑。

结果:小而强大

新 AIVeriGround取得了一些令人瞩目的成就:

  • 它真正在看: 在“匿名”测试(无法作弊)下,VeriGround 的得分远高于所有其他模型,证明它确实在阅读图表。
  • 它不盲目猜测: 它学会了在 92% 的情况下拒绝空白图片,但极少拒绝有效图片(误拒率仅为 1.2%)。
  • 它小身材大能量: 尽管 VeriGround 是一个“小型”模型(40 亿参数),但在名称存在的情况下,其表现与庞大且昂贵的"GPT-5.4"模型相当;而在移除名称后,它则碾压了这些巨头。

总结

该论文揭示,许多 AI 模型在将电路图片转换为代码时是在“装模作样”;它们只是读取标签而忽略图片。作者构建了一项新测试来揭露这种“海市蜃楼”,并训练了一个新的、诚实的 AI(VeriGround),它真正观察图片,在困惑时拒绝猜测,并在该任务上表现得比那些巨头更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →