← 最新论文
🤖 AI

Escaping the Quicksand: A Call to Arms

为了应对由 AI 驱动开发所加剧的技术债上升风险,本文主张进行一种务实的转变,即从纯粹基于自然语言的规范转向测试、可执行规范与形式化证明的灵活结合,并辅以新的语义基础设施,从而为人类和 AI 工程师建立更有效的反馈循环。

原作者: Peter Sewell, Jean Pichon-Pharabod

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Peter Sewell, Jean Pichon-Pharabod

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个世界,现代生活的无形机器——我们的银行、医院、电网和通信网络——正建立在一个缓慢下沉的地基之上。这就是当今计算产业所面临的现实。几十年来,构建软件的标准方式是写一段关于程序应该做什么的粗略描述,然后编写代码,最后通过运行各种输入来测试它是否会崩溃。这种被称为“测试与调试开发”的方法让技术得以繁荣,但也让系统充满了隐藏的缺陷。由于原始描述通常是模糊的且使用自然语言编写,因此无法被机器检查;而且由于测试只能覆盖程序可能表现出的数十亿种行为中的极小部分,许多错误便由此溜了过去。随着人工智能开始编写更多的代码,这一循环可能会加速恶化,创造出比以往更加复杂且脆弱的庞大新系统,这些系统构建在数十年前做出的设计选择所形成的“流沙”之上——而当时,网络攻击还很罕见,计算能力也十分匮ار。

两位研究人员,来自剑桥大学的 Peter Sewell 和来自奥胡斯大学的 Jean Pichon-Pharabod,认为该行业在七十五年来一直陷入了一个危险的循环。他们观察到,虽然我们在编写代码方面变得极其熟练,但我们却忽视了对代码究竟要实现什么的精确定义。目前的做法依赖于“散文式规范”——即描述系统行为的段落文字。虽然这些文字易于人类阅读,但它们本质上是模棱两可且不完整的。人类读者可能会以一种方式理解一个句子,而机器或另一个人则可能以另一种方式理解。由于这些描述无法直接被计算机测试,开发者被迫去猜测正确的行为应该是怎样的,通常只能退而求其次,使用简单的检查,比如“程序是否崩溃?”,而不是验证程序是否真的在做正确的事情。这种书面意图与实际代码之间的鸿沟造成了巨大的技术债,这是一种隐藏的成本,表现为可以被攻击者利用的安全漏洞和系统故障。

作者们建议,解决方案不在于放弃测试,而在于改变我们使用规范的方式。与其编写模糊的段落,不如提议创建“可执行规范”,即以计算机可以运行的形式编写规范。想象一下,一个规范就像是开发过程中的一个实时裁判。随着代码的编写或生成,这个可执行规范会与之并行运行,立即检查代码的行为是否符合预设规则。如果代码试图进行规范禁止的操作,系统会立即发出警报。这创造了一个更紧密的反馈循环,允许开发者在错误发生时即刻捕捉,而不是在数周之后。这种方法可以有多种应用方式:可以从代码开始并编写匹配它的规范,可以从规范开始并生成符合它的代码,或者将两者结合起来构建。其核心在于,规范不仅仅是一份用来阅读的文件,而是一个用来使用的工具。

然而,研究人员承认这并非一个可以简单切换的开关。为了大规模实现这一目标,计算界需要构建一层新的基础设施。目前,对于许多基础技术(如 C 语言、Rust 语言或在计算机芯片上运行的指令)的行为,尚不存在普遍接受的、机器可读的定义。虽然一些研究人员已成功为系统中的特定部分创建了这些定义,但仍缺乏一个能将它们全部连接起来的统一框架。作者指出,构建这种基础设施是一个规模与协作的挑战。它需要大学、政府和技术公司进行大规模、协调一致的努力,为整个计算技术栈(从硬件到云服务)创建、验证并维护这些精确的定义。

该论文还探讨了人工智能的角色。作者警告说,如果仅仅使用人工智能来编写更多代码,而不建立这些更好的反馈循环,只会让问题变得更加严重。AI 生成代码的速度比人类更快,但如果这些代码构建在不稳固的基础之上,且仅用旧的、无效的方法进行测试,那么它只会创造出带有更多隐藏错误的更大规模系统。相反,如果利用 AI 来辅助生成和检查这些可执行规范,它就能成为提高软件质量的强大工具。作者憧憬着这样一个未来:AI 帮助创建严谨的规范,而这些规范被用于验证无论是人类编写还是 AI 生成的代码是否正确。这将实现一种循序渐进的信心提升,从简单的测试开始,逐步过渡到对正确性的复杂数学证明,而无需每个开发者都成为数学家。

尽管前路清晰,作者却认为该行业一直受到“激励机制错位”的阻碍。技术公司追求快速发布产品以获取市场份额,而失败的风险却主要由社会和最终用户承担。构建预防此类失败所需的稳健基础设施既昂贵又耗时,而且没有任何一家公司愿意承担修复影响全社会的问题的全部成本。研究人员呼吁进行一次集体行动,类似于物理学或生物学领域的大规模项目,通过资助和协调来创建这种语义基础设施。他们认为,尽管成本显著,但这仅占当前人工智能投入的一小部分,且对于保障计算产业的未来至关重要。如果不进行这种转变,该行业将继续困于循环,在无法支撑其复杂性的基础之上构建日益复杂的系统,使社会处于持续的风险之中。

作者总结道,解决这一问题的工具和方法已经存在。研究人员已经成功演示了如何定义复杂系统的行为并以高置信度对其进行验证。缺失的是将这些方法引入日常实践并构建使其触手可及的共享基础设施的意志。这篇论文是对研究界、行业领导者和资助机构的行动号召。通过从模糊的描述转向精确的可执行规范,计算世界可以逃离技术债的“流沙”,构建一个不仅更具创新性,而且从根本上更安全、更可靠的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →