Directed Neuro-Symbolic Stochastic Execution for Verification of Distributed Parallel AI Programs
本文介绍了定向神经符号随机执行(Directed Neuro-Symbolic Stochastic Execution, DNSSE),这是一种结合了由大语言模型引导的调度预测、符号约束求解以及随机变异的混合测试框架,用于有效验证分布式并行 AI 程序,并实现了比现有基准显著更高的分支覆盖率和并发缺陷检测率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一片不断移动、拉伸并改变形状的海滩上,寻找一颗特定且唯一的沙粒。这正是工程师们在构建驱动现代人工智能的庞大、类脑计算机程序时所面临的日常现实。这些程序并非静止不动;它们运行在巨大的计算机集群上,成千上万个微小的工人(线程)同时在进行着彼此间的交流。问题在于,当有如此多的工人在同时行动时,他们执行任务的顺序就会变成一场混乱的抽奖。有时,如果两个工人试图在同一瞬间争夺同一块信息,整个系统可能会出现故障、冻结或丢失数据。这些被称为“并发缺陷”(concurrency bugs),由于它们只在极其特定且罕见的计时与输入组合下才会发生,因此极难被发现。
更糟糕的是,这些人工智能程序充满了根据处理数据而变化的复杂数学运算。传统的测试工具就像手电筒:它们一次只能照亮一条路径,但当路径分裂成数百万种可能性,或者当数学计算变得过于诡异而令它们无法计算时,它们就会显得力不从心。另一些工具则试图在黑暗中投掷飞镖,寄希望于通过随机机会撞见缺陷,但它们往往会错过那些数学逻辑与时间节点发生碰撞的隐秘角落。我们需要一种更聪明的方法来决定观察位置,这种方法既要具备计算器的精准,又要具备资深侦探的直觉,同时还要在不断变换墙壁的迷宫中穿行。
这正是名为定向神经符号随机执行(Directed Neuro-Symbolic Stochastic Execution, DNSSE)的新型方法大显身手的地方。可以将 DNSSE 想象成一个由三位侦探组成的超级智能团队,他们协同作战,在人工智能程序中搜寻这些隐形的缺陷。第一位侦探是符号引擎(Symbolic Engine),它是一位严谨的数学家,能够完美解决简单的线性逻辑谜题。第二位侦探是随机引擎(Stochastic Engine),它是一位勇敢的探险家,利用随机猜测和试错法来应对那些让数学家束手无策的非线性数学难题。第三位,也是最独特的一位,是 LLM 调度器(LLM Scheduler)——一个大型语言模型,扮演着资深向导的角色。这位向导阅读过数百万个代码故事,能够预测哪条路径最有可能通往灾难。
论文解释了这支团队如何结合这三种力量。DNSSE 并非只是盲目随机猜测或试图解决每一条路径(那将耗时无穷),而是由这位“向导”观察代码并发出指令:“嘿,这两个工人正准备对一个共享内存点产生争执;让我们现在就强制让他们发生冲突。”随后,数学家会检查这场冲突中的数值是否合理,而探险家则会尝试寻找能让这些数值成立的具体数据输入。如果向导判断失误,团队还有一个安全网:他们会退回到随机探索模式,以确保系统不会陷入停滞。
该方法的测试结果令人印象深刻。当研究人员在五个真实的、复杂的 AI 程序(涵盖从模型训练到数据服务)上测试 DNSSE 时,发现它远优于现有的最佳工具。虽然最强大的现有方法发现了 25 个缺陷,但 DNSSE 发现了 73 个,即 2.9 倍于前者。它还成功覆盖了 91.6% 的可能代码路径,相比之下,其他工具的平均覆盖率仅为 68.6%。该系统在没有陷入停滞的情况下,在短短几千秒内便完成了工作,而其他方法在 24 小时后仍处于超时状态。此外,“向导”(LLM)仅使用了约 14.3% 的总计算时间,这证明了少量的智能引导在驯服分布式 AI 系统这种混沌状态时,能发挥巨大的作用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。