Model-Driven Requirements Configuration with Three-Valued Uncertainty Scoring
本文提出了一种神经符号多智能体架构,该架构将大语言模型与确定性符号验证器以及三值不确定性评分框架相结合,旨在消除大语言模型生成的需求中的结构不一致性,同时为需求工程中更安全的部署提供形式化的决策不确定性量化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图制造一个定制机器人,但你不是在画蓝图,而是在和一个非常爱聊天、超级聪明、却又喜欢胡编乱造的机器人朋友交流。你说:“我想要一个能做饭和打扫卫生的机器人,”你的朋友兴奋地开始列举零件。但因为它太急于表现,它可能会不小心建议一个并不匹配的零件,或者建议两个放在一起会爆炸的零件,甚至发明一个根本不存在的零件。这就是棘手的需求工程(Requirements Engineering)世界:即弄清楚一个软件或机器到底需要做什么的过程。长期以来,专家们一直使用严格的数学“规则手册”(称为形式化模型)来确保每个部件都完美契合,但这些规则手册对人类来说很难阅读。最近,我们开始使用大语言模型(LLM)——也就是那种能写诗、能回答问题的 AI——来帮助我们用通俗易懂的英语来描述我们的需求。问题在于:这些 AI 朋友虽然擅长聊天,却不擅长遵循规则手册中的严格规则,经常创造出看起来很美、但在实际建造时会崩溃的设计。
这篇论文介绍了一个聪明的组合方案来解决这个问题。作者创建了一个系统,其中这个爱聊天的 AI(LLM)充当创意头脑风暴者,根据你的自然语言描述提出建议,而一个严格、不容置疑的“规则检查员”(符号验证器)则在一旁严密把守。把这想象成一个创意厨师和一名卫生检查员在厨房里协作。厨师建议各种疯狂且美味的食谱,但检查员会立即检查食材是否安全以及步骤是否符合法律。如果厨师建议把毒药和蛋糕混在一起,检查员会立即阻止。论文表明,这种组合成功修复了 AI 犯下的几乎所有错误,将混乱、不可能实现的构想变成了坚实、可建造的计划。他们还引入了一种新的衡量 AI 置信度的方法,区分了哪些是 AI 必须 选择的东西,哪些是它可以 自由 选择的东西,以及哪些是它 搞错 了的东西。
创意厨师与严格检查员的故事
在软件的世界里,在你编写第一行代码之前,你必须决定程序究竟要做什么。这被称为需求工程。想象一下你正在设计一个“智能家居”。你需要决定:它是否有备用电池?它是使用 Wi-Fi 还是蓝牙?你可以通过语音控制灯光吗?如果你选错了这些选项,整个房子可能就无法运作。
传统上,专家们使用一种名为 OOMRAM(面向对象的需求建模与管理方法)的刚性系统。把 OOMRAM 想象成一个巨大的、复杂的流程图或选择树。它有严格的规则:“如果你选择了‘智能家居’,你必须 选择一个电源。如果你选择了‘Wi-Fi’,你不能 同时选择‘蓝牙’。”这就像电子游戏的角色创建器,如果游戏规定武器和盾牌不能同时装备,你就不能同时使用它们。问题在于,这些流程图很难由人类驾驭。你不能直接说“我想要一个感觉温馨且安全的房子”,并指望流程图能理解你。你必须知道每一个选项的确切名称。
**大语言模型(LLM)**登场了。这是能够理解你的句子——“我想要一个温馨且带有语音控制功能的房子”——并猜测你可能指的是哪些选项的 AI。它就像一个说话非常自然、反应极快的创意助手。但问题在于:这个 AI 有点爱做白日梦。它可能会发明一个不存在的“量子电池”,或者它可能会忘记你不能同时拥有 Wi-Fi 和蓝牙,从而导致一个逻辑上有缺陷的设计。
神经符号组合(The Neuro-Symbolic Team-Up)
论文作者构建了一个系统来解决这个问题。他们创建了一个由四个“智能体”(小型的计算机程序)组成的团队,它们协同工作:
- 导航员(The Navigator): 这个智能体观察巨大的流程图(OOMRAM 格点),并决定下一步该看哪里。它就像一个导游,指引着迷宫中的下一扇门。
- 解释器(The Interpreter/AI): 这就是 LLM。它倾听你的“项目愿景”(你对想要的东西的描述),并建议在流程图上按下哪些按钮。它尝试猜测哪些选项符合你的描述。
- 验证器(The Validator/Inspector): 这是严格遵守规则的部分。它不使用 AI,而是使用硬性的数学逻辑。它根据流程图的规则检查 AI 提出的每一个建议。AI 是否选了两个不能共存的东西?它是否漏掉了某个强制性部分?如果答案是“是”,验证器就会说:“不对,重试,”并将 AI 送回以修正错误。
- 记录员(The Scribe): 一旦所有内容都通过审核,这个智能体会写下最终完美的需求列表。
神奇之处在于 AI 和检查员通过一个循环进行对话。AI 提出建议,检查员进行检查,如果出现错误,AI 会再次尝试。这个过程不断重复,直到设计趋于完美。
三值评分卡:真、或、假
这篇论文最酷的部分之一是他们如何衡量 AI 的工作成果。通常,我们只是简单地说一个答案是“对”或“错”。但作者意识到这太简单了。有时,AI 选了一个被允许但并非严格要求的选项。为了处理这种情况,他们发明了一个三值评分卡(Three-Valued Scorecard):
- 真(Truth, T): AI 选择了那些必须被选择的东西。例如,如果愿景中包含“智能家居”,系统必须选择一个电源。如果 AI 选择了它,这就是一个“真”。
- 不确定性(Indeterminacy, I): AI 选择了被允许的东西,但愿景并没有强制要求它。也许愿景只是说了“智能家居”,而 AI 在“Wi-Fi”和“蓝牙”之间选择了“Wi-Fi”。两者都是有效的,但愿景并未说明选哪一个。这就是“不确定性”。它是一个“自由选择”。
- 假(Falsity, F): AI 选择了违反规则的东西。比如在规则规定不能同时使用的情况下,同时选择了“Wi-Fi”和“蓝牙”。这就是“假”。
通过使用这个评分卡,研究人员可以清楚地看到 AI 是在盲目猜测还是在遵循指令。
研究发现
团队使用 37 个不同的项目愿景,涵盖了 11 种不同类型的应用,如记录系统、智能家居和汽车娱乐系统。在大多数测试中,他们使用了一个“轻量级”AI 模型(Llama 3.1 8B)。
结果如下:
- 修复率: 如果没有严格的检查员,AI 会犯下巨大的错误。但在有了检查员之后,系统修复了几乎所有的错误。在 37 个案例中的 35 个(94.6%)中,最终结果的结构错误为 零。
- 残留问题: 在剩下的 2 个案例中,AI 陷入了循环,无法在测试停止前修复特定类型的错误。这导致在超过 1,500 个决策中,仅剩下了 6 个微小的错误(0.39%)。
- “也许”区域: 研究人员发现,AI 做出的所有决策中,大约有 24.7% 属于“不确定性”。这意味着 AI 正在行使它在有效选项之间进行选择的自由,这实际上是一件好事!这表明系统能够区分“必须做”和“可以选”。
- 更强的 AI: 当他们使用更聪明、更先进的“前沿”AI 模型(NVIDIA Nemotron 3 Ultra)进行测试时,它实现了 100% 的愿景完美达成,零错误。
为什么这很重要
论文指出,仅仅让 AI 编写需求是危险的,因为它可能会发明一些无法运行的东西。但通过引入一个严格的、基于数学的“检查员”来监督规则,你就可以让 AI 发挥创意,而不必担心它破坏逻辑定律。
作者还证明了这个系统非常高效。由于“检查员”占用的总时间不到 0.4%,这意味着它不会拖慢进度。他们还证明了该系统具有良好的扩展性:随着选项列表的增加,AI 与系统交互的次数呈线性增长,而不是呈爆发式的曲线增长。
简而言之,这篇论文证明了你可以“鱼与熊掌兼得”:你可以利用 AI 灵活的自然语言来描述你的需求,同时利用严格且不可撼动的规则手册来确保你得到的东西确实是可构建且正确的。它将“爱做白日梦”的 AI 变成了一名可靠的工程师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。