← 最新论文
🤖 AI

U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning

本文提出了 U-Define 系统,该系统通过将用户约束分类为严格的“硬性”规则或灵活的“软性”偏好,从而增强用户对基于大语言模型的规划的控制能力,并采用互补的形式化模型检测与大语言模型作为裁判的验证方法,以提升可靠性、可用性和用户满意度。

原作者: Christine P Lee, Xinyu Jessica Wang, Aws Albarghouthi, David Porfirio, Bilge Mutlu

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Christine P Lee, Xinyu Jessica Wang, Aws Albarghouthi, David Porfirio, Bilge Mutlu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在规划一次完美的家庭度假。你有一份必须发生的事项清单(例如“我们必须控制在预算内”或“孩子们在泳池里必须穿救生衣”),以及一份你非常希望发生的事项清单(例如“我们很想要一个安静的海滩”或“如果能参观博物馆就太好了”)。

过去,当人们要求人工智能(大语言模型)规划这次旅行时,AI 只是靠猜测。它可能会因为忙于发挥创意而忘记救生衣,或者建议一家价格过高的酒店。AI 就像一位才华横溢但有点心不在焉的旅行代理,虽然口齿流利,却并不总是能听进严格的规则。

问题所在:
当前的 AI 工具要么过于死板(迫使你使用复杂的代码来设定规则),要么过于松散(完全忽略你的规则)。用户被迫手动检查 AI 的工作,这既令人疲惫又容易出错。

解决方案:U-Define
研究人员构建了一个名为U-Define的新系统。把它想象成一位“带有双重检查系统的智能旅行代理”。U-Define 不再只是让 AI 去“规划一次旅行”,而是让你明确告诉 AI,哪些规则是硬性的,哪些是软性的。

以下是它的工作原理,使用简单的类比来说明:

1. 两类规则

U-Define 要求你将指令归类到两个“桶”中:

  • “硬性”桶(砖墙): 这些是不可协商的规则。如果 AI 违反了一条,整个计划就毫无用处。
    • 示例: “我们必须吃素食。”
    • 神奇之处: U-Define 会将你的英文句子瞬间翻译成一种严格的数学“代码”(称为 LTL/PRISM),计算机可以完美地检查它。这就像把你的规则变成了一个永不眨眼的监控摄像头。如果计划中包含牛排,摄像头会立即尖叫“错误!”
  • “软性”桶(愿望清单): 这些是偏好。如果 AI 未能满足它们,计划仍然可以接受,只是不够完美。
    • 示例: “我们更希望节奏轻松一些。”
    • 神奇之处: 对于这些规则,U-Define 会使用第二个 AI(一位“裁判”)来阅读计划,给出 1 到 5 星的评分,并评论它在多大程度上符合你的氛围。

2. 工作流程:你如何与之互动

想象你正坐在电脑前使用 U-Define:

  1. 你发言: 你输入“规划一次去威尼斯的旅行”。你添加你的硬性规则(救生衣、素食)和软性规则(轻松节奏、适合孩子)。
  2. 翻译器: 系统秘密地将你的“硬性”规则转化为那种严格的数学代码。它会向你展示翻译结果,以确保它正确理解了你的意思。
  3. 生成器: 主 AI 生成三个不同的旅行计划。
  4. 双重检查:
    • 数学计算机检查硬性规则。它会说:“计划 A 失败,因为它没有包含救生衣。计划 B 通过了所有硬性规则。”
    • 裁判 AI检查软性规则。它会说:“计划 B 得了 4 星,因为它很轻松,但计划 C 得了 5 星,因为它有更多的有趣活动。”
  5. 结果: 你看到排名后的计划。你确切地知道,排名靠前的计划不会违反你的“必须项”,并且你可以看到哪一个最符合你的“想要项”。

3. 研究人员的发现

该团队用普通人(如规划度假的父母)和专家(如建筑经理或拨款协调员)测试了该系统。

  • 普通人非常喜欢它: 他们感到更加自信。他们不必再扮演“侦探”去发现错误。他们喜欢能够将“必须做”与“最好做”区分开来。这感觉就像 AI 终于理解了规则和建议之间的区别。
  • “硬性”规则非常强大: 当系统保证遵守硬性规则时,人们对 AI 的信任度大大提高。他们愿意接受软性规则上的一些小失误,但如果硬性规则被违反,他们会非常不满。
  • “软性”规则具有灵活性: 人们利用软性规则微调计划,直到感觉恰到好处。然而,他们注意到 AI 对软性规则的“星级评分”并不总是完美,所以他们仍然需要亲自查看计划。
  • 专家需要更多帮助: 专家(从事非常复杂的工作)喜欢这个系统,但发现很难输入他们所有的众多规则。他们希望系统能记住他们通常的规则,或从电子表格中导入这些规则,这样他们就不必每次都从头开始输入所有内容。

核心结论

该论文总结道,为了让 AI 在规划中真正有用,它必须让来决定什么是严格规则,什么是灵活偏好。

  • 硬性约束 = 房子的地基(必须坚固)。
  • 软性约束 = 油漆和装饰(可根据口味更改)。

通过为用户提供一种清晰区分这两者的方法,并使用不同的“工具”来检查它们(用数学检查硬性内容,用第二个 AI 检查软性内容),U-Define 使 AI 规划更加可靠,同时不失其创造力。它将 AI 从一个靠猜测的“黑盒”转变为一个尊重你界限的“协作伙伴”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →