CIVeX: Causal Intervention Verification for Language Agents
本文介绍了 CIVeX,这是一种因果干预验证器,通过将拟议的操作映射到结构因果查询以确保可识别的因果效应,从而保障语言智能体的工具使用可靠性,进而在标准验证防护措施失效的混杂工作流中防止错误执行。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一艘宇宙飞船的船长。你的飞船由一个高级 AI 助手控制,它可以按下按钮来改变航向、打开舱门或启动推进器。这个 AI 非常聪明,但它有一个危险的盲点:它只关注历史。
如果 AI 发现每次飞船向左转时温度就会下降,它可能会得出结论:“向左转能让飞船降温!”于是,它按下“左转”按钮试图降温。
但如果温度下降的真正原因是飞船同时进入了一片阴暗的星云呢?AI 并不知道星云的存在。它只是看到了某种模式。如果 AI 在没有星云的情况下向左转,飞船实际上可能会变得更热。在数据世界中,这被称为混淆:一个隐藏的因素诱使你误以为两件事之间存在关联,而实际上它们并无关联。
本文介绍了一种名为CIVeX(因果干预验证)的新安全机制,旨在阻止 AI 做出这些危险的猜测。
问题:“有效”并不等于“安全”
目前,当 AI 想要按下某个按钮时,它会执行以下检查清单:
- 语法检查:命令是否书写正确?
- 权限检查:AI 是否被允许执行此操作?
- 预测检查:AI 是否认为这会奏效?
本文认为,通过这些检查就像司机拥有有效的驾照、车况良好的汽车和可靠的 GPS 导航一样。但这并不意味着司机知道转动方向盘实际上会导致汽车转向,尤其是当存在不可见的力量(如强风或湿滑路面)干扰结果时。
解决方案:“因果证书”
CIVeX 扮演着一位严格的安全检查员的角色,除非 AI 能用数学证明该行动确实会导致预期结果,否则它拒绝让 AI 按下按钮。
CIVeX 不再仅仅询问“这以前发生过吗?”,而是问:“如果我们强制发生这件事,它是否会导致预期结果?”
为了获得行动许可,AI 必须出示一份因果证书。你可以将这份证书视为一份“安全护照”,它必须包含四项具体内容:
- 地图(因果图):一张展示行动、结果和隐藏因素之间如何关联的图示。
- 证明(可识别性):一个数学论证,表明即使存在隐藏因素,我们也能计算出实际效果。
- 安全边际(下置信界):一项保证,即使在最坏的情况下,该行动也不会造成伤害。
- 来源(数据溯源):证明数据来源的证据,以防有人伪造数据。
四种裁决
当 AI 提出一项行动时,CIVeX 会审查证书并给出以下四种答复之一:
- 执行:“地图清晰,数学推导成立,且安全边际充足。可以执行。”
- 拒绝:“数学分析表明这很可能对我们有害,或者安全边际过低。不要执行。”
- 实验:“由于存在隐藏因素,我们尚无法确定。但如果你能运行一个小型、安全的测试(如随机对照试验)来证明其有效性,我们将允许你尝试。”
- ** abstain( abstain)**:“我们完全不知道会发生什么,猜测的风险太大。什么也不做。”
表现如何(竞赛结果)
作者们在"Causal-ToolBench"(一个包含 1,890 种不同场景的模拟环境)中测试了 CIVeX 与其他方法的性能。
- “总是猜测”的 AI:在隐藏因素误导 AI 的棘手情境中,该方法有 45% 的时间会犯错,并经常造成伤害。
- “从不行动”的 AI:这种方法很安全但毫无用处。即使在安全的情况下,它也拒绝行动,从而错失了收益。
- “大语言模型”AI:即使被给予“逐步思考”的智能提示,该 AI 仍然会犯错。它擅长推理,但无法保证安全。在棘手场景中,它仍有约 1% 到 10% 的概率按下“危险按钮”。
- CIVeX:在测试中它零犯错。它从未按下会导致伤害的按钮。关键在于,它并非仅仅通过“什么都不做”来“求稳”;它成功识别出何时可以安全行动,以及何时需要先进行测试。
局限性(注意事项)
本文非常诚实地指出了 CIVeX不能做什么:
- 它需要一张好地图:CIVeX 假设提供给它的“地图”(因果图)是正确的。如果地图错误,安全保证就会失效。本文建议,在现实世界中,需要由人类或其他系统对这些地图进行签署确认,以确保其准确性。
- 它是守门员,而非驾驶员:CIVeX 不决定做什么;它只决定 AI 是否被允许做它想做的事。
- 它不是魔法:它依赖于拥有能够进行“安全测试”(实验)的数据,以便在情况不明时采取行动。
核心结论
本文总结道,为了让 AI 智能体安全地改变世界(例如删除文件、交易股票或修复代码),我们需要停止询问“这个行动是否有效?”,转而询问“这个行动是否经过因果证明?”
CIVeX 是首个提出以下观点的系统:“除非你能用一份数学证书证明,按下这个按钮确实会导致你想要的良性结果,而不会引发你担心的恶性后果,否则我不会让你按下按钮。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。