← 最新论文
💻 computer science

Bridging Natural Language and Formal Specification--Automated Translation of Software Requirements to LTL via Hierarchical Semantics Decomposition Using LLMs

本文介绍了 Req2LTL,这是一个利用大语言模型进行层次化语义分解,并结合确定性基于规则的合成技术,从而将自然语言软件需求自动转换为语法有效且语义准确的线性时序逻辑(LTL)规范的模块化框架,并在真实的航空航天数据集上实现了卓越的性能。

原作者: Zhi Ma, Cheng Wen, Zhexin Su, Xiao Liang, Cong Tian, Shengchao Qin, Mengfei Yang

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhi Ma, Cheng Wen, Zhexin Su, Xiao Liang, Cong Tian, Shengchao Qin, Mengfei Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图给一个非常严谨、按字面意思理解指令的机器人下达指令。你使用的是自然的、流畅的英语(例如“如果灯变红了,请等到它变黄后再出发”)。但你的机器人只能理解一种名为 LTL 的僵化、数学化的代码。如果你在指令中犯了哪怕一个微小的错误,机器人就可能导致系统崩溃。

目前,人类必须充当翻译员,将这些指令手动改写为机器人的代码。这既缓慢、枯燥,又容易产生人为错误。

这篇论文介绍了一个名为 REQ2LTL 的新工具,它可以自动完成这种翻译。你可以把它想象成一个“智能翻译器”,它不仅仅是在猜测代码,而是将问题分解成易于处理的层级。

以下是它的工作原理,我们使用了一些创意类比:

1. 问题所在:“黑盒”翻译器

作者尝试直接使用强大的 AI 模型(如 GPT-4o)来进行翻译。他们发现,虽然 AI 非常擅长理解单个词汇,但往往会在“宏观逻辑”上迷失方向。

  • 类比: 想象要求一名学生写一份复杂的法律合同。如果你只是说“写这份合同”,学生可能会把词汇写对,但会搞错事件的顺序(例如,在“签署文件”之前就说“支付款项”)。
  • 结果: AI 生成的代码看起来可能是正确的,但隐藏着逻辑陷阱,比如漏掉了“等待”指令,或者混淆了“直到(until)”与“并且(and)”。

2. 解决方案:“洋葱”策略

为了解决这个问题,团队创建了一个名为 OnionL 的中间步骤。

  • 类比: 把一段自然语言需求想象成一个洋葱。它有很多层:外皮(主要目标)、中间层(条件和时序)以及核心(具体的细节事实)。
  • 创新之处: 系统并不是试图一次性剥开整个洋葱,而是逐层剥开。
    1. 第一层(范围): 它询问 AI:“这件事情是始终发生?最终发生?还是仅在特定模式激活时发生?”它以此构建逻辑树的外壳。
    2. 第二层(细节): 然后,它深入到每一层,将复杂的句子分解为更小的、原子化的事实(例如“温度 > 50”或“灯是红色的”)。
    3. 结果: AI 不需要一次性猜测整个结构。它只需要组织好这些层级,这对于它来说更容易正确完成。

3. 安全网:“基于规则的厨师”

一旦 AI 剥开了洋葱并将层级组织成一个结构化的树状图(即 OnionL),系统就会将其传递给第二个部分:一个确定性的基于规则的引擎

  • 类比: 把 AI 想象成一位正在切菜的创意厨师。而基于规则的引擎则是严格的质量控制检查员。它不负责烹饪,它只负责检查:“你是否正好切了两根胡萝卜?刀是否锋利?碗是否干净?”
  • 益处: 因为这个部分遵循严格且不可更改的规则,它保证了最终生成的代码在语法上是完美无缺的(结构 100% 正确)。如果 AI 在处理层级时出了错,检查员会在最终代码生成前将其拦截。

4. 人类安全阀

有时,指令本身可能过于模糊(例如,“尽快执行此操作”)。AI 可能会做出错误的猜测。

  • 类比: 系统提供了一张洋葱层的可视化地图。如果专家看到 AI 将“等待”指令放错了位置,他们只需点击地图上的对应位置进行修正即可。这就像是在编辑流程图,而不是重新编写一整段代码。

他们发现了什么?

团队在现实世界的航空航天需求(关于航天器导航与控制的指令)上进行了测试。

  • 得分: 他们的全新系统 REQ2LTL 实现了 88.4% 的语义准确度,并达到了 100% 的代码结构正确率。
  • 对比: 之前的方法(仅让 AI 直接进行翻译)只能达到约 44% 到 65% 的正确率。
  • 为什么这很重要: 在像太空旅行这样对安全性要求极高的领域,100% 的结构保证至关重要。通过使用“洋葱”法来让 AI 保持专注,并利用基于规则的引擎来确保安全,该系统成功地弥合了混乱的人类语言与完美的机器逻辑之间的鸿沟。

简而言之,这篇论文声称,通过将复杂的指令分解为“洋葱”式的层级,并在最后使用严格的规则检查器,我们可以实现复杂机器完美安全代码的自动化生成,而这在以前是单靠 AI 难以完成的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →