← 最新论文
🤖 AI

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

本文介绍了 Kaleidoscope,这是一个实用且迭代的工作流,它整合了基于人格的角色化测试生成、情境化的评分标准以及引入人工干预的可靠性门控,旨在实现对现实世界 AI 应用的可扩展且符合策略一致性的评估。

原作者: Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一个机器人厨师。你可以教会它以惊人的速度切菜和翻煎饼,但你如何知道它是否真的为你的特定家庭做出了“好”餐点?也许你的家人讨厌辛辣食物,或者你有一个严禁使用塑料容器的严格规定。一本通用的食谱可能会说:“这道菜是9/10分,”但如果你的家人对香菜过敏,这并无帮助。这就是目前人工智能领域面临的大问题。我们拥有能够写故事、解数学题并像人类一样聊天的超级智能AI模型,但测试它们却是一场噩梦。科学家们使用的标准测试就像通用的驾驶考试;它们检查汽车是否能在红灯前停下,但并不能告诉你这辆车是否安全地行驶在你特定社区那冰雪覆盖、蜿蜒曲折的道路上。

为了解决这个问题,我们需要一种基于我们的特定规则、我们的特定用户以及我们的特定风险来测试AI的方法。这就是“功能性评估”(functional evaluation)的概念引入之处。它不在于询问“这个AI聪明吗?”,而在于询问“这个AI是否完成了我们需要的工作,且没有违反我们的规则?”挑战在于,手动进行这项工作既慢又枯燥,而让计算机给计算机评分则存在风险,因为计算机可能会产生偏见或变得偷懒。所以,大问题在于:我们如何构建一个既快速、公平,又能真正理解现实世界语境的测试系统?

于是,KALEIDOSCOPE 项目应运而生。这是一个由来自新加坡政府科技局(GovTech Singapore)及各大学的团队设计的全新工作流,旨在解决这个难题。请将 KALEIDOSCOPE 视为不仅仅是一个单一的测试,而是一个用于检查AI的高科技多镜头相机系统。它不是拍下一张模糊的AI表现照片,而是从不同的角度捕捉数百张照片,将其与自定义的规则手册进行比对,并且只有当相机确定对焦准确时,才允许最终得分生效。

以下是其神奇之处的运作方式。首先,系统会构建一个角色阵容,即“人格化身”(personas)。想象一下你在测试一个客服机器人。与其只问它一些泛泛的问题,KALEлоSCOPE 会创造出一个“愤怒的顾客”、“困惑的游客”和一个“精通技术的青少年”。它会生成这些特定角色在现实中会提出的问题,涵盖从正常情况到奇怪的极端场景的所有内容。这确保了测试感觉像是真实的生活,而不是机器人的梦境。

接下来,系统需要一本规则手册。在过去,团队只会凭直觉猜测什么是“好”答案。KALEIDOSCOPE 让用户可以编写自己的评分标准(rubrics)——即针对其独特情况的具体评分准则。对于一个金融机器人,规则可能是“必须对数字做到100%准确”;对于一个聊天机器人,规则可能是“必须听起来友好”。随后,系统会获取AI的回答并开始进行评分。

但最巧妙的部分在于:系统并不会仅仅信任计算机去给计算机评分。它使用了一个“可靠性门槛”(reliability gate)。想象一下一个由三个不同AI裁判组成的评审团。在被允许给出最终得分之前,他们必须在一些练习题上证明自己能与人类专家达成一致。如果这些AI裁判无法至少有50%的时间(这是团队设定的特定阈值)匹配人类的逻辑,系统就会按下刹车。它会发出警告:“等等,这些裁判还不具备可靠性,”并将结果标记出来,等待更多的人类审查。这防止了AI自信地给出一个错误的评分。只有当裁判们通过了这项测试,他们才会共同投票给出一个自动化的最终得分。

该团队在为期三周的试点运行中尝试了这一方法,涉及四个不同的真实应用团队:一个金融机器人、一个人力资源助手、一个采购机器人和一个员工助手。他们发现该系统运行良好。事实上,83%的使用者表示,它帮助他们更高效地评估了他们的应用。他们也从中吸取了一些宝贵的教训。例如,他们意识到,如果你没有给AI提供足够的关于它正在测试的应用的背景信息,它生成的测试用例会变得古怪且不切实际。因此,他们增加了一个功能,即如果用户的描述过于简短,系统可以搜索网络以了解更多关于应用的上下文信息。

结果表明,这种“人类在环”(human-in-the-loop)的方法是一种让AI测试变得实用的可行方案。团队发现,使用单个AI裁判来对所有内容进行评分往往会导致结果不一致,但使用一个必须先与人类达成一致的“陪审团”式裁判团,会让评分更加可靠。他们还发现,将答案拆解成细小的断言(例如,逐句检查事实)比仅给出一个模糊的整体评分效果更好。

然而,论文谨慎地指出,这并不是一个完美的解决方案。试点规模较小,仅涉及几个团队和有限数量的测试用例(108个标注对)。作者建议,虽然这一工作流是向前迈出的重要一步,但它并不是一个能解决所有AI安全问题的魔杖。它仍然需要人类投入精力来设定规则并审查结果,并且它最擅长的是检查AI是否对问题给出了正确的答案,而不是检查复杂的、长期的行为,比如AI代理规划为期数日的旅行。

简而言之,KALEIDOSCOPE 是一个帮助团队停止猜测、开始掌握实情的工具包。它在混乱的现实人类需求与僵化的AI逻辑之间架起了一座桥梁,确保当AI说“我准备好了”时,它确实已经准备好了。通过结合智能测试生成、自定义规则手册以及严格的“信任并验证”评分系统,它为任何试图在现实世界中部署AI而不至于陷入混乱的人提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →