← 最新论文
🤖 AI

Neuro-Symbolic Agents for Hallucination-Free Requirements Reuse

本文介绍了一种神经符号多智能体系统,该系统将大语言模型作为启发式方法与确定性符号验证器相结合,在 OOMRAM 框架内实现无幻觉且结构有效的需求复用,达成了 100% 的覆盖率和近零约束违规。

原作者: Ahmed Ibrahim

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Ibrahim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图建造一座定制房屋,但你必须从一本庞大且预先批准的蓝图目录中进行选择。这本目录被称为OOMRAM。它就像一张巨大而严格的流程图,上面写着:“如果你想要一个厨房,你就必须也拥有一个水槽”,以及“你可以选择一扇红色的门或一扇蓝色的门,但绝不能两者兼得。”

问题在于,使用这本目录的原始方式就像是一个只懂确切代码的机器人。如果你说:“我想要一个带大花园的舒适家园”,除非你知道“舒适家园”的确切代码,否则这个机器人无法帮助你。

这时,大语言模型(LLMs) 登场了。它们就像超级聪明、健谈的建筑师,能完美理解你的自然语言。你可以告诉它们:“我想要一个舒适的家”,它们就会提出建议。但有一个陷阱:这些健谈的建筑师容易产生幻觉。它们可能会发明一本目录中不存在的“飞行楼梯”,或者试图在同一座房屋上同时安装红门和蓝门,从而违反规则。

本文介绍了一个新的工作团队——神经符号多智能体系统——来解决这个问题。不妨将其想象为一个拥有四个特定角色的施工队:

  1. 导航员:一位向导,查看目录并说:“好的,接下来我们需要决定屋顶。”
  2. 解释器(大语言模型):那位健谈的建筑师。它倾听你关于“舒适家园”的想法,并从目录中建议具体的部件(例如:“让我们选个石板屋顶”)。
  3. 验证器(严格的检查员):这是最重要的部分。验证器不是人工智能;它是一个僵化的、基于数学的规则检查器。它会查看解释器的建议,并根据目录的严格规则进行检查。
    • 场景:如果解释器建议“红门 AND 蓝门”,验证器会立即敲响法槌:“停!这违反了规则。你只能选择其中一个。”
    • 随后,验证器将建议退回给解释器,让其重新尝试。
  4. 记录员:一旦检查员满意,这个人就会写下最终获批的部件清单。

实际运作方式:
该系统在一个循环中运行。解释器进行猜测,验证器进行检查;如果存在错误,它们就会反复沟通,直到完全遵守规则。由于验证器是一个严格的计算机程序(而非猜测型 AI),它保证最终的房屋计划在逻辑上是合理的,并遵循目录中的每一条规则。

结果:
研究人员在两种类型的“目录”上测试了该系统:一种是用于数字记录保存系统,另一种是用于智能家居。

  • 无违规规则:该系统实现了100% 的结构有效性。它生成的每一个需求都遵循了规则。它几乎完全消除了“幻觉”(即虚构的部件或非法组合)。
  • "F1 分数”的困惑:在标准的人工智能测试中,衡量的是人工智能的答案与单个“完美”人类答案的接近程度。该系统在那方面的得分“中等”。为什么?因为对于“舒适家园”而言,并不存在唯一正确的答案。有数百种有效的组合。该系统找到了一个有效的组合,只是没有恰好匹配人类测试者可能挑选的那个。论文认为,找到任何有效且遵守规则的解决方案,比匹配单个人类的猜测更为重要。
  • 速度:每个项目耗时几分钟,这足以满足实际应用的需求。

核心结论:
本文证明,你可以兼得两者之长:既拥有理解人类语言的健谈 AI 的灵活性,又拥有防止错误的僵化规则检查器的安全性。通过将“创造性”AI 与“严格”规则检查器分离,他们创建了一个系统,能够将模糊的想法自动转化为结构完美、无错误的技术要求,而无需凭空捏造。

简而言之:他们组建了一个团队,其中富有创造力的梦想家始终受到一位严格会计师的监督,确保最终计划既富有想象力,又在逻辑上无懈可击。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →