← 最新论文
💻 computer science

Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization

本文通过一项受控实证研究表明,在 COBOL 到 Python 的现代化过程中,确定性编排在实现相当的翻译准确度的同时,显著提升了鲁棒性,降低了性能波动,并将运营成本降低了高达 3.5 倍,其表现优于由大语言模型控制的智能体工作流。

原作者: Naing Oo Lwin, Rajesh Kumar

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Naing Oo Lwin, Rajesh Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

几十年来,金融和政府部门一直依赖于一种被称为 COBOL 的复杂庞大计算机程序。这些系统运行着全球的银行交易和社会保障支付,然而构建这些系统的专家正在退休,且代码本身往往已有数十年历史,缺乏文档记录且难以更改。为了维持这些至关重要的服务运行,组织必须将这些古老的代码翻译成 Python 等现代语言,这一过程需要极高的精确度,因为哪怕是一个微小的错误都可能导致系统崩溃。最近,一种被称为大语言模型的全新人工智能技术脱颖而出,成为了完成这项任务的潜在工具。这些模型能够阅读代码并编写新代码,但它们通常通过像“自主智能体”一样运作:它们会自行决定采取哪些步骤、何时重试任务以及如何随着进程修复错误。这向工程师提出了一个关键问题:是让人工智能全程驾驶、实时决定每一步动作更好,还是让过程遵循一条严格的、预定义的轨道、由计算机执行一套固定的规则更为有效?

巴克内尔大学(Bucknell University)与 Astrio 的一个研究小组致力于回答这个问题,他们通过进行一项受控实验,观察这两种不同的方法在处理将 COBOL 代码转换为 Python 这一艰巨任务时的表现。他们构建了一个名为 ATLAS 的系统来充当翻译器,但他们设计实验时,唯一的变量是“谁在驾驶座上”。在其中一个版本中,人工智能拥有完全的控制权,被允许选择自己的路径、选择自己的工具,并决定何时停止或重新开始。在另一个版本中,使用了相同的 AI 来编写代码,但一套僵化且不变的规则严格规定了具体要采取哪些步骤、按什么顺序执行,以及如果出错时尝试多少次。通过在两种场景中保持系统的“大脑”——即语言模型——完全一致,研究人员可以隔离出控制方法本身的影响,剔除所有其他变量,从而观察哪种策略真正更有效。

这项研究的结果揭示了灵活性与可靠性之间明显的权衡。当人工智能被允许控制整个过程时,它经常能够成功生成一个可运行的程序,通常能产生一个不会崩溃的结果。然而,这种成功伴随着隐藏的代价:结果是不一致的。由于模型在自行决定如何进行,同样的初始代码在不同的尝试中可能会导致截然不同的结果,有时能产生完美的翻译,有时则会以不可预测的方式失败。此外,这种“智能体式”的方法成本极高。模型经常会在冗长的推理路径中徘徊,不断向自己提问并尝试多种并非必要的策略,消耗了大量的计算资源。在某些情况下,这种灵活的方法所使用的 Token(模型处理信息的最小单位)数量是固定路径方法的三倍以上,才达到了类似的结果。

相比之下,遵循固定、确定性路径的系统产生的结果则更加稳定且可预测。虽然其翻译代码的整体能力与灵活版本不相上下,但这个僵化的系统极少出现最坏的情况。它不会迷失在不必要的思考循环中,也不会在每次运行之间改变其行为。最重要的是,它的运行成本显著降低。通过遵循严格的步骤计划,并仅将人工智能用于编写代码而非规划旅程,该系统将翻译成本降低了三到三点五倍。研究人员发现,对于像现代化遗留软件这样步骤明确且结果可以根据严格规则进行校验的任务,让人工智能去“开车”不仅更昂ей,而且比由人类设计的“地图”引导路径的方式更不可靠。

这项研究表明,未来在复杂的工程任务中使用人工智能,其核心可能并不在于给予机器决策如何工作的完全自由。相反,最有效的方法似乎是将这些强大的模型嵌入到一个结构化的框架中,使参与规则固定且路径清晰。人工智能仍然是那位能够理解复杂指令并生成新代码的专家级作者,但工作的编排——包括规划、时机把控和安全检查——仍需处于严格的、确定性的控制之下。这确保了过程不仅能够产生高质量的结果,而且对于维持现代世界运转的大规模、关键性系统而言,依然保持着稳健、可预测且经济可行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →