AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems
本文提出了一种面向企业人工智能系统的全面且可实际部署的保障策略,该策略通过构建结构化的故障分类体系、修订的五层保障金字塔以及整合评估驱动的工程实践,将关注点从传统的正确性验证转向持续的风险降低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一支才华横溢但稍显不可预测的顾问团队来运营你的业务。这些顾问聪明到可以写诗、解决数学问题并起草法律合同。但关键在于:他们没有固定的规则手册。他们从庞大的图书馆中学习,每次回答问题时,都是基于以往阅读的内容来猜测最可能的答案。有时他们猜对了。有时他们自信满满地猜,却完全错了。
这篇由 Thoughtworks 专家撰写的论文认为,我们不能用测试传统计算机软件的方式来测试这些"AI 顾问”。
以下是他们策略的分解,用简单的术语和类比进行解释。
1. 旧方式 vs. 新方式
旧方式(传统软件):
想象一台自动售货机。你按下"A1",一包薯片就出来了。如果你再次按下"A1",你会得到完全相同的一包薯片。如果没出来,机器就坏了。测试这个很简单:你只需检查每次是否都吐出了正确的东西。
新方式(AI 系统):
现在想象一位人类旅行代理。你问:“规划一次去巴黎的旅行。”
- 运行 1: 他们建议一家靠近埃菲尔铁塔的酒店。
- 运行 2: 他们建议一家靠近卢浮宫的酒店。
- 运行 3: 他们因为分心,不小心预订了去伦敦的旅行。
你不能仅仅因为“运行 2"与“运行 1"不同,就说“运行 2"是错的。两者都是有效的。但你可以说“运行 3"是一场灾难。
论文的观点: 我们不能像测试自动售货机那样,通过检查“通过/失败”来测试 AI。我们必须测试风险降低。我们不是试图证明 AI 是完美的;我们试图证明它不会做出危险或愚蠢的事情。
2. "AI 故障分类法”(AI 崩溃的五种方式)
作者指出,AI 不像旧软件那样直接“崩溃”。它通过五种特定且隐蔽的方式失败。把这些想象成旅行代理搞砸你行程的五种方式:
- 自信的骗子(基础失效): 代理给你一份完美的行程表,但这家酒店根本不存在。他们编造了它,因为他们听起来很自信。
- 错误的路径(推理失效): 代理把你带到了正确的酒店,但他们走了一条疯狂且昂贵的路线,或者忘记了你的“无楼梯”规则。
- 诡计多端者(安全失效): 有人诱骗代理泄露你的信用卡号或违反规则。
- 团队内讧(协调失效): 你有三个代理在合作(一个订机票,一个订酒店,一个发邮件)。他们互相交谈,但误解了信息。机票预订在周二,但酒店预订在周三。
- 情绪波动(随机性失效): 代理在 10 次中有 9 次表现完美,但在第 10 次,他们只是决定变得奇怪。你无法预测这种情况何时发生。
3. "AI 保障金字塔”(如何测试)
论文提出的不是一份平面的测试清单,而是一个金字塔。这是一座有 5 层的建筑。你希望在较低的楼层抓住错误,因为那里成本低且容易。如果你等到顶层,错误已经毁掉了整个行程。
- 第 0 层(基础): 检查管道。计算机代码是否真的连接到了数据库?提示(给 AI 的指令)是否以正确的格式编写?这是 100% 确定的。
- 第 1 层(组件): 测试各个代理。“机票代理”是否知道如何搜索航班?“安全代理”是否知道如何屏蔽不良词汇?
- 第 2 层(单个代理): 测试单个代理执行多步骤任务。“为我预订一张机票。”他们选对航班了吗?选对日期了吗?记得你的名字了吗?
- 第 3 层(团队): 测试代理之间如何交流。“机票代理”是否告诉“酒店代理”正确的日期?他们是否传递了正确的信息?
- 第 4 层(业务结果): 最终测试。客户是否真的获得了一次令他们满意的假期?公司是否遵守了法律?这是测试成本最高的一层,因为它需要人类来检查结果。
黄金法则: 在第 0 层或第 1 层抓住错误。如果你只在第 4 层测试,你就是在等待客户投诉之前,才知道出了问题。
4. RAG:“图书馆”问题
许多公司使用一种称为RAG(检索增强生成)的系统。
- 类比: 想象 AI 是一个正在参加考试的学生。
- 没有 RAG: 学生只依赖记忆。他们可能会记错(产生幻觉)。
- 有 RAG: 学生在回答问题之前,被允许打开一本特定的教科书(公司的数据)。
- 测试挑战: 你必须分别测试两件事:
- 学生是否在教科书中找到了正确的页面?(检索)
- 学生是否阅读了该页面并基于它正确地回答了问题?(生成)
- 如果答案是错的,你需要知道:他们是看了错误的页面,还是看了正确的页面却误解了它?
5. “静默漂移”(模型的变化)
在传统软件中,如果你更新了一个库,你确切知道发生了什么变化。
在 AI 中,“老师”(AI 模型提供商)可能会在学期中途悄悄更换教科书。
- 风险: 昨天,AI 遵循你的规则“始终预订直飞航班”。今天,在静默更新后,它开始预订有中转的航班。
- 解决方案: 你需要持续评估。你不能只在发布前测试一次。你必须每天运行测试套件,就像每日健康检查一样,以确保 AI 没有“漂移”并开始表现糟糕。
6. 重大转变:从 QA 到“评估工程”
论文总结认为,我们需要一个新的职位。
- 旧 QA: “代码能运行吗?按钮能用吗?”
- 新评估工程: "AI 的行为是否安全?它是否一致?它是否产生了幻觉?”
这不仅仅是编写更多的测试。它是关于构建一个平台,其中:
- 我们拥有“黄金数据集”(问题和答案的完美示例)用于测试。
- 我们拥有“裁判”(其他 AI 或人类)来评分答案。
- 我们将提示(指令)视为代码,每次 AI 模型发生变化时,都必须对其进行版本控制和测试。
总结
论文说:停止试图让 AI 完美。开始试图让它安全。
不要把 AI 当作自动售货机。把它当作一群才华横溢但不可预测的实习生。你需要一套严格的检查系统(金字塔)、一种识破他们谎言的方法(分类法),以及一种日常惯例,以确保他们没有忘记培训(持续监控)。如果你这样做,你就可以放心地将业务托付给他们。如果你不这样做,你就是在盲目飞行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。