← 最新论文
💻 computer science

Correctness, confidence, and context: Framing software assurance in the AI age

本文认为,生成式人工智能依赖于概率预测而非形式化严谨性,且难以捕捉人类内隐语境的统计特性,使得有必要采用一种系统的工程方法来重构软件保障,即超越代码规范,通过开发具有成本效益且经过推理的多种技术组合,来确保系统的适用性。

原作者: Mary Shaw

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Mary Shaw

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的软件谜题:为什么“完美”并非目标

想象一下,你正在用逻辑和指令建造一座巨大的、隐形的城堡。这就是软件工程师每天都在做的事情。他们编写代码让计算机执行各种任务,从订披萨到驾驶飞机。长期以来,梦想是建造如此完美的城堡,以至于它们永远、绝对不会出错。工程师们想要通过数学手段证明每一块砖都摆放在了正确的位置。但问题在于:现实世界是混乱的。它充满了无法写进指令列表的潜规则、文化习惯和“常识”。

现在,一种新型的助手来到了:人工智能(AI)。这个 AI 极其擅长猜测下一步会发生什么,就像一个读过几乎所有书籍的超级快速猜谜者。但与那些想要“证明”正确性的传统工程师不同,这个 AI 是基于“概率”工作的。它会说:“我有 90% 的把握这是正确答案”,而不是说“我确凿地知道这是正确答案”。这产生了一个大问题:当我们需要系统安全可靠时,我们如何信任一个建立在“猜测”之上的系统?这就是玛丽·肖(Mary Shaw)正在解决的谜题。她想要改变我们对“正确性”的认知,从追求不可能实现的完美梦想,转向一种更务实的、工程师式的做法——确保事物对于其所需的工作而言是“足够好”的。


论文的核心思想:从“完美”转向“足够好”

在这场面向软件工程师的主题演讲中,玛丽·肖认为我们需要停止试图证明我们的软件是 100% 完美的,而应该开始关注它是否符合其用途(fit for its purpose)。她指出,旧有的思维方式——试图编写一套完美的规则集来证明程序的正确性——已经失效了,尤其是在我们开始使用 AI 的今天。

以下是她论点的逻辑拆解,分为简单易懂的部分:

1. 阴影问题:AI 看不到的东西

想象一下,你正试图向一位从未见过折叠纸杯的朋友描述一个复杂的物体。你只能向他展示该物体投射在墙上的影子。从正面看,影子是一个正方形;从侧面看,它是一个三角形;从顶部看,它是一个圆形。如果你只有这些影子,你可能会猜它是一个奇怪的方块,但你会错过它其实是一个可以盛水的杯子的事实。

肖表示,AI 模型就像那个观察影子的朋友。它们是在“数字阴影”——即网络上存在的文本、代码和数据——之上进行训练的。但现实世界充满了默会知识(tacit knowledge):那些我们知道但没有写下来的东西。这包括职场的“氛围”、不成文的文化规则,或是经验丰富的机械师在听到引擎发出异响时的直觉。因为这些知识没有被记录下来,AI 看不到它们。它看到的只是影子,而不是真实的物体。当 AI 尝试构建软件时,它可能会遗漏这些至关重要的、不可见的细节,从而导致人类专家一眼就能发现的错误。

2. 编程中的“货物崇拜”

肖讲述了一个关于岛民的故事:他们看到飞机在战争期间降落并带来食物。当战争结束、飞机不再到来时,当地人建造了竹制的控制塔并进行队列行进,希望能召唤飞机回来。他们模仿了活动的“影子”(行进、塔楼),却忽略了真正的诱因(军事物流和调度)。

她警告说,利用 AI 编写代码有时会变成一种“货物崇拜”。我们可能会要求 AI 编写看起来正确的代码(影子),却不理解代码为何必须是那样编写的深层原因。如果我们仅仅进行“氛围编程”(基于感觉或简单的提示词来编写代码),而不理解隐藏的规则,我们可能会构建出看起来很棒、但在现实问题发生时却会崩溃的系统。

3. 用“凭证”代替“规格说明”

传统上,工程师试图编写完美的“规格说明书(specification)”——一本庞大且僵化的规则手册,规定软件必须做什么。肖认为这是不可能实现的,因为世界在变,我们无法预测一切。

相反,她建议我们将软件视为一个正在应聘工作的人。我们不需要他的完整生平,我们只需要他的凭证(credentials)

  • 一名潜水员展示一张卡片,上面写着:“我可以潜水至 30 米。”
  • 一名飞行员展示执照,上面写着:“我可以驾驶这架飞机。”
  • 一个软件系统应该展示一份“凭证”,上面写着:“我有 90% 的信心处理 1,000 名用户,”或者“我已经过测试,在执行特定任务时是安全的。”

这些凭证并非完美的证明;它们是关于我们有多大把握、这种把握源自何处以及局限性在哪里的一种诚实的陈述。这是一种表达方式,即:“我们检查过了,这就是我们的确定程度。”

4. 工程师的选择:满意决策(Satisficing)

论文建议,我们不应追求完美,而应开始进行满意决策(satisficing)。这是一个高级词汇,意为“寻找一个足够好的解决方案”。

  • 如果你在开发一款游戏,你可能不需要 100% 的完美。如果游戏很有趣且成本较低,出现一些 Bug 是可以接受的。
  • 如果你在制造医疗设备,你需要高得多的置信水平。

肖认为,工程师应该像真正的工程师那样行动:他们应该观察成本、风险和用途,然后选择合适的工具组合来完成工作。有时,在问题发生后再去修复,比试图预防问题永远发生要更划策。目标不是消除所有错误(这是不可能的);目标是管理风险,使系统对于其特定工作而言是安全且有用的。

这对未来意味着什么

玛丽·肖并不是在说 AI 很糟糕。她是说我们不能把 AI 当作解决一切问题的魔杖。我们需要更聪明地使用它。我们需要接受 AI 是基于猜测(统计学)工作的,并且它看不见人类文化和经验的那些不可见的“影子”。

她的核心信息是对软件界的行动号召:让我们停止假装我们可以证明一切都是完美的。 相反,让我们成为诚实的工程师。让我们构建这样的系统:我们清楚地知道自己对什么有信心,对什么没有信心,以及为什么。通过这样做,我们可以利用 AI 来帮助我们构建更好的软件,而不至于陷入“认为我们已经解决了无法解决的问题”这一陷阱。

简而言之,论文指出,软件的未来不在于教科书意义上的“正确”,而在于符合用途、了解自身的局限,并做出明智且具成本效益的选择,以确保我们的数字世界安全运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →