← 最新论文
🤖 AI

Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation

Veri-Sure 是一个具备契约感知能力的多智能体框架,它通过设计契约对齐智能体意图、通过静态依赖切片执行精确的局部修复,并利用基于追踪的时序分析与形式化验证的混合流水线来验证输出,从而确保硅级 RTL 的正确性,且该框架是在新引入的工业级 VerilogEval-v2-EXT 基准测试上进行评估的。

原作者: Jiale Liu, Taiyu Zhou, Tianqi Jiang

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiale Liu, Taiyu Zhou, Tianqi Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图根据一套用纯英文编写的指令,制造一台复杂、高速的机器(比如一个未来的机器人)。你要求一个超级聪明的 AI 将这些指令转化为机器真正的蓝图(代码)。

问题在于,这个 AI 虽然擅长写句子,但它经常在蓝图中留下微小且隐形的错误,这些错误只有在机器全速运转时才会显现。在真实的芯片设计领域,这些错误代价极其高昂——一旦芯片制造完成,修复它们的成本可能高达数百万美元。

这篇论文介绍了一个名为 VERI-SURE 的全新“AI 专家团队”,旨在这些错误在芯片制造之前就将其修复。以下是它的工作原理,我们使用简单的类比来解释:

1. 问题所在:“传声筒游戏”与“盲点”

当你要求单个 AI 编写代码时,会出现两个问题:

  • 传声筒游戏(Telephone Game): 如果你要求 AI 修复一个漏洞(bug),它可能会误解你的原始目标。它为了修复一件事而修改了代码,却不小心破坏了最初的意图。
  • 盲点(Blind Spot): AI 通常通过运行模拟(试驾)来检查自己的工作。但就像一次试驾可能会错过在特定颠簸路面上才会发生的罕见引擎故障一样,模拟往往会错过那些只在现实世界中才会发生的棘手时序错误。

2. 解决方案:专业的施工团队

VERI-SURE 并没有让一个 AI 承担所有工作,而是建立了一个每个成员都有特定职责的施工队。他们首先会对一份**“设计合同”**达成一致。

  • 建筑师(合同制定者): 在任何人开始编写任何一行代码之前,这个智能体负责将你杂乱的英文指令转化为一份严格的数学“合同”。它定义了机器应该如何表现、按钮的功能以及运行速度。这确保了团队中的每个人都在阅读同一张地图。
  • 程序员(建造者): 这个智能体根据合同编写实际的蓝图(代码)。
  • 校验员(安全检查员): 这个智能体负责进行试驾(模拟)。如果机器失败了,它不会只说“它坏了”,它还会分析崩溃数据。

3. 妙招:“外科手术式修复” vs. “拆除重建”

当试驾失败时,旧的 AI 系统通常会陷入恐慌,尝试拆除整座建筑并从头开始。这样做风险很大,因为它们可能会忘记如何正确建造墙壁。

VERI-SURE 使用的是外科手术式修复

  • 侦探(追踪分析): 它观察“黑匣子”数据(波形),找到机器失效的具体时刻。
  • 外科医生(依赖切片): 它不是靠猜测,而是通过回溯线路来找到导致问题的确切那一小块代码。它隔离出那个微小的部分。
  • 补丁: AI 只重写那块微小的、损坏的代码。机器的其他部分保持原封不动。这防止了“传声筒游戏”中那种“修好一个东西却弄坏另一个”的情况。

4. 超级检查:“数学证明” vs. “试驾”

有时,仅仅靠试驾不足以证明一台机器是安全的。

  • 断言器(规则执行者): 这个智能体检查机器是否遵循时间规则(例如:“灯是否在按下按钮时准时亮起?”)。
  • 布尔证明器(数学巫师): 对于逻辑部分,这个智能体不只是运行测试;它使用数学证明来保证代码在任何输入下都绝不可能出错。这就像是用物理方程证明一座桥永远不会坍塌,而不是仅仅开车在上面开过一次。

5. 新的测试赛道:“更难的障碍赛”

为了证明他们的团队是最优秀的,作者构建了一个更难的障碍赛道,名为 VERILOGE EVAL-V2-EXT

  • 旧的测试就像是在停车场里驾驶(任务简单、短暂)。
  • 新的测试包括在暴风雨中驾驶、在迷宫中导航以及搬运重型货物(工业级的任务,如复杂的通信协议和内存控制)。

结果

当他们把他们的团队(VERI-SURE)放在这个新的、困难的障碍赛道上时:

  • 独立 AI(孤独的天才)大约完成了 76% 的任务。
  • 旧的 AI 团队(没有外科手术式修复或数学证明的团队)在处理最难的任务时表现挣扎。
  • VERI-SURE 实现了 93% 的成功率,即使是在最困难、最复杂的任务上也是如此。

简而言之: VERI-SURE 不仅仅是要求 AI “编写代码”。它创建了一个纪律严明的团队,他们达成计划共识,通过外科手术式修复仅针对损坏的部分进行修复,并利用数学来证明修复是完美的,从而确保最终的芯片完全按照预期工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →