VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space
VeriTrace 引入了一种具有“代理式时序探索”(Agentic Temporal Exploration)的多智能体系统,该系统赋予了检查器(Inspector)智能体对信号选择、时间窗口和迭代深度的完全控制权,以执行类人式的假设驱动调试,从而在 VerilogEval-V2 上实现了 100% 的 Pass@1,并超越了以往的最先进基准测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图通过仅凭一段文字描述来教一个机器人组装一台复杂的机器,比如一个发条玩具。你给机器人提供了指令,它尝试进行组装。但有时,这个玩具无法正常工作。在计算机科学领域,这被称为“硬件设计”,而这些指令是用一种特殊的语言编写的,叫做 Verilog。长期以来,被称为大型语言模型(LLM)的智能计算机程序已经非常擅长阅读这些指令并编写构建机器的代码。然而,当机器出现故障时,这些程序往往会陷入困境。它们能看到玩具坏了,但却无法弄清楚“为什么”,因为它们不被允许近距离观察内部的运动部件。它们就像是一个能听到引擎敲击声,却不被允许打开引擎盖或使用扳手去检查特定齿轮的修理工。这篇由马里兰大学研究人员撰写的论文,正是针对这一问题展开研究的:如何赋予这些 AI “修理工”像人类专家一样调查机器内部运作情况的自由。
研究人员 Yu-Tung Liu 和 Cunxi Yu 注意到,虽然 AI 可以编写初始代码,但在出错时却难以进行修复。以往帮助 AI 调试的方法是给它一个“波形图”——即一张展示机器信号随时间变化的视觉地图。但旧系统就像是给了侦探一张犯罪现场的照片,却禁止他们选择要检查哪些线索或关注哪个时间点。AI 被迫只能观察一个狭窄且预先选定的视角,这往往会错过真正的错误原因。作者将这种局限性称为“不完整的动作空间”。他们认为,要真正修复代码,AI 需要能够自主选择要检查哪些信号、何时观察它们以及持续调查多久,从而模拟人类工程师的思维方式。
为了解决这个问题,该团队创建了一个名为 VeriTrace 的新系统。你可以把 VeriTrace 想象成一个专门的 AI 协作团队。一名工人负责编写代码,另一名负责检查是否正常运行,而第三名被称为“检查员(Inspector)”的角色,则扮演着好奇侦探的角色。与之前的系统不同,这位“检查员”拥有完全的自由。它可以说:“我认为问题出在这个特定的齿轮上,但仅限于运行的第二秒内,”然后放大并精确检查那个位置。如果第一次猜测错了,检查员不会放弃;它会形成一个新的假设,选择一个新的时间窗口,然后再次观察。这个过程被称为“代理式时序探索(Agentic Temporal Exploration)”。它允许 AI 构建假设,根据证据进行测试,并逐步完善其理解,就像人类一样。
这种新方法的成果非常令人瞩目。在针对包含 156 个编码挑战的标准集 VerilogEval-V2 进行测试时,VeriTrace 取得了 100% Pass@1 的完美成绩。这意味着在其最终修正代码的第一次尝试中,它正确解决了所有问题。这是第一个在这一特定基准测试中达到如此完美水平的开源系统。即使与使用相同底层 AI 大脑(Claude Sonnet 4.0)的其他强大系统相比,VeriTrace 也表现得更出色,领先了 5.1%,这证明了赋予 AI 探索和调查的自由是填补准确性最后差距的关键。
有趣的是,研究人员发现这种自由不仅让 AI 变得更聪明,还让它变得更高效。通过在每一步中仅请求其所需的特定信息,而不是将其机器运行的全部历史记录都塞进内存,VeriTrace 将它需要处理的数据量减少了 18%。这表明,让 AI 提出正确的问题,不仅有助于找到答案,还能节省大量的计算能量。论文总结道,虽然 AI 模型本身功能强大,但真正的突破在于我们如何让它们使用工具。通过赋予它们自由探索时间和信号的代理权,我们可以将它们从僵化的代码生成器转变为真正的解决问题者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。