← 最新论文
💬 NLP

Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark

本文引入了一种形式化语义块模型和一个执行判定基准,用于独立于模型能力来评估规范质量,并通过一个从 Oracle 到 PostgreSQL 的迁移案例研究证明,尽管确定性是一个有效的形式化概念,但由于显著的实现差异性,它目前尚不能作为当代大语言模型的独立经验质量指标。

原作者: Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代软件世界中,越来越多的公司正试图利用人工智能来自动化创建计算机程序。他们不再雇佣工程师团队从零开始编写每一行代码,而是提供一段关于软件应如何运作的详细书面描述(即“规范”),并要求人工智能据此进行构建。这种被称为“规范驱动开发”的方法,将书面计划视为机器的主要指令手册。人们希望,如果计划足够清晰,人工智能就能每次都生成完美的软件。然而,一个关键问题仍然存在:一个更好的计划是否真的让 AI 变得更聪明,还是说 AI 系统已经根据其训练内容知道了答案?如果 AI 仅仅因为见过类似的计划而认同该计划,那么计划本身并没有发挥真正的作用。这种不确定性使得人们很难判断一份规范究竟是高质量的,还是仅仅是一份恰好与机器原本就要做的事情相匹配的文件。

一组研究人员为了解决这个测量问题,设定了一个特定的复杂任务进行测试:将一个庞大的数据库从一种系统迁移到另一种系统。他们创建了一个正式、结构化的规范,用于将数据从 Oracle 数据库迁移到 PostgreSQL 数据库,这一过程涉及翻译数千条关于数据存储和处理的规则。为了测试这份规范是否真的有所帮助,他们不仅要求 AI 编写代码并检查其外观是否正确,而是设计了一个严谨的实验,让同一组 AI 系统执行两次迁移任务:一次带有详细规范,另一次则没有。研究人员使用了一个实时的 Oracle 数据库和一个全新的 PostgreSQL 系统作为严格的裁判。他们将 AI 生成的代码针对原始数据进行运行,以观察结果是否完全一致,将软件的实际行为视为衡量成功的唯一标准。

这项研究涉及三个扮演独立实现者角色的不同 AI 系统,它们都在同样的 75 个特定迁移任务上进行工作。当研究人员比较结果时,他们发现软件的运行能力与 AI 系统之间的共识程度之间存在明显的差异。规范极大地提高了软件运行而不崩溃的能力。在没有规范的情况下,只有 72% 的生成代码能成功加载到新数据库中;而在拥有完整规范的情况下,这一数字跃升至 97.3%。计划充当了一个引导角色,帮助 AI 避免致命错误并生成真正可运行的代码。

然而,当研究人员观察规范是否让 AI 系统之间达成更多共识时,故事发生了转折。此前曾有一种希望,认为一份完美的计划会迫使所有 AI 系统做出完全相同的决策,从而产生统一的解决方案。数据表明情况并非如此。即使在没有规范的情况下,AI 系统之间的共识率也已达到 83%,这可能是因为它们在训练过程中学习到了相同的行业标准实践。当加入规范后,这一共识率几乎没有变动,仅上升到了 83.8%。计划并没有改变 AI 已经在做出的决策,它只是帮助 AI 在执行这些决策时不出错。

研究人员还发现,信息的呈现方式比信息的多少更为重要。在一个实验中,他们将单条规则放置在文档的不同部分。当这条规则被埋在某个章节末尾的一段文字中时,AI 遵循该规则的比例仅为 23%。当同样的规则被放在该章节顶部的结构化表格中时,合规率上升到了 42%。令人惊讶的是,在两个地方重复该规则反而使合规率下降到了 34%,这表明冗余可能会干扰系统,而非强化指令。这一发现表明,文档的结构比文本的容量更具影响力。

或许最显著的发现是,规范有时会让情况变得更糟。在其中一个特定案例中,规范中的一条规则指示 AI 使用某种特定类型的数据容器。AI 完美地遵循了这条规则,但结果生成的代码却是无效且无法运行的。在没有规范的情况下,AI 忽略了那条特定指令,而是自行使用了另一种有效的方法。这证明了遵循规则并不保证能得到正确的结果,且规范在修复旧错误的同时,也可能引入新的错误。研究还发现,AI 系统存在天然的一致性极限;当研究人员多次运行同一测试时,由于 AI 生成文本的随机性,结果会有约 14 个百分点的波动。这种变异性意味着,微小的改进无法被视为真实的进步。

最终,研究结论指出,规范是使软件可执行以及帮助人类发现指令缺失之处的强大工具,但它并不是一个能迫使不同 AI 系统想法趋同的魔杖。规范成功地将损坏程序的数量减少了近四分之一,证明了其在确保代码运行方面的价值。然而,它未能提高不同 AI 系统之间的共识度,也未能提高数据的准确性(在受控组和对照组中,正确结果始终维持在 42 个测试中的 19 个)。这项研究表明,对于当前这一代的 AI 而言,规范更像是一个防止灾难性失败的安全网,而不是一个能将 AI 已知知识提升到更高水平的引导器。规范的真正力量不在于强迫 AI 达成一致,而在于使构建软件的过程变得足够可靠,以便进行检查和验证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →