MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents
本文介绍了 MANTRA,这是一个框架,它通过从自然语言程序手册中生成符号化世界模型和经 SMT 验证的轨迹级检查,自动合成并形式化验证可扩展的、可机器检查的工具使用大语言模型代理合规性基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明、乐于助人的机器人助手(AI 智能体),它能使用工具为你做事,比如预订航班、订购硬件或管理患者记录。然而,这个机器人工作在一个严格的办公环境中,必须遵循一本用通俗英语写成的、长达 50 页的规则手册。
问题在于:这本手册是写给人类看的,但机器人使用的是“工具调用”(数字命令)。检查机器人是否遵守了规则,就像试图仅通过查看学生的草稿纸来批改作文,却不知道他们是否真正遵循了老师的指示。
解决方案:MANTRA
本文的作者创建了一个名为 MANTRA(Manual-to-Test-Translation,手册到测试翻译)的系统。你可以将 MANTRA 想象成一位自动化、极度严格的质检员,它为这些机器人助手构建“试驾”测试。
以下是其工作原理,使用一个简单的类比:
1. 食谱与厨师
- 规则手册(手册): 想象一份复杂的舒芙蕾食谱,上面写着:“如果鸡蛋新鲜,就将其搅打;如果不新鲜,就购买更多。在 20 分钟之前切勿打开烤箱门。”
- 机器人(智能体): 这就是试图制作舒芙蕾的厨师。
- 问题: 你如何知道厨师是否遵循了食谱?他们是否先检查了鸡蛋?他们是否过早地窥视了烤箱?
2. 构建测试(“世界模型”)
与其仅仅让人类阅读食谱然后观察厨师(这既缓慢又容易出错),MANTRA 采取了一种巧妙的方法。它利用食谱和厨师拥有的工具列表(搅拌器、烤箱、计时器),自动构建一个厨房的数字模拟。
- 世界模型: 这是规则的数字孪生。它知道:“如果鸡蛋不新鲜,搅拌器工具还不能使用。”
- 检查项: MANTRA 还会生成一份具体检查事项的列表,例如:“厨师是否在搅打前检查了鸡蛋?”
3. “数学侦探”(SMT 求解器)
这是神奇的部分。由于食谱和检查项都是由 AI 编写的(AI 有时会犯错或产生幻觉),MANTRA 不会盲目信任它们。它使用一个数学逻辑引擎(称为 SMT 求解器)来充当“数学侦探”。
- 交叉验证: 侦探会问:“是否存在某种方式,让厨师遵循了‘检查项’列表,却违反了‘世界模型’的规则?”
- 修复循环: 如果侦探发现了一个漏洞(例如,检查项说“搅打鸡蛋”,但世界模型说“必须先确保鸡蛋新鲜”),它会自动修复测试。它会不断重复此过程,直到测试在数学上完美无缺。
- 人工备份: 只有当数学侦探陷入困境时,人类才会介入以修复最终细节。
4. 结果:完美的考试
最终产物是一个基准测试套件。这是一套包含 285 道不同“考题”的集合,涵盖 6 个不同领域(如航空预订、医院安全和硬件订购)。
- 确定性评分: 与其他需要人类或另一个 AI 猜测机器人是否表现良好的测试不同,MANTRA 的测试就像标准化答题卡扫描。机器人要么遵循了所需的精确工具调用序列,要么没有。这里没有猜测。
- 发现故障: 当作者在 6 个不同的 AI 模型上测试这些考试时,他们发现大多数机器人失败是因为跳过了“阅读”步骤。例如,它们会在“检查”商品是否有库存之前就尝试“写入”订单。MANTRA 的详细测试捕捉到了这些具体错误,清晰地展示了机器人究竟在哪里失败了。
总结
MANTRA 是一个框架,它将杂乱无章、由人类编写的规则手册转化为干净、经过数学验证的 AI 智能体测试。它利用“生成、交叉验证和修复”的循环,确保测试的公平性和准确性,使我们能够可靠地判断 AI 智能体是否真正遵守了规则,还是仅仅在凭感觉行事。
核心要点: 正如你不会在没有经过严格、数学验证的碰撞测试的情况下信任自动驾驶汽车一样,如果没有像 MANTRA 这样的系统来验证其是否遵循手册,你也不应信任使用工具的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。