← 最新论文
🤖 AI

CIRCLE: A Framework for Evaluating AI from a Real-World Lens

本文提出了 CIRCLE 框架,这是一个基于六阶段生命周期的评估体系,旨在通过将利益相关者的定性洞察转化为可量化的指标,弥合模型性能指标与现实部署效果之间的差距,从而支持基于实际下游影响而非理论能力的 AI 治理。

原作者: Reva Schwartz, Carina Westling, Morgan Briggs, Marzieh Fadaee, Isar Nejadgholi, Matthew Holmes, Fariza Rashid, Maya Carlyle, Afaf Taïk, Kyra Wilson, Peter Douglas, Theodora Skeadas, Gabriella Waters
发布于 2026-03-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Reva Schwartz, Carina Westling, Morgan Briggs, Marzieh Fadaee, Isar Nejadgholi, Matthew Holmes, Fariza Rashid, Maya Carlyle, Afaf Taïk, Kyra Wilson, Peter Douglas, Theodora Skeadas, Gabriella Waters, Rumman Chowdhury, Thiago Lacerda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 CIRCLE 的新框架,它的核心目的是解决人工智能(AI)在“实验室里”表现完美,但到了“现实生活中”却可能翻车的问题。

为了让你更容易理解,我们可以把开发 AI 想象成造一辆新车,而 CIRCLE 就是一套全新的试驾和长期跟踪方案

🚗 核心问题:为什么现在的测试不够用?

目前的 AI 测试(就像现在的汽车测试)主要是在封闭的赛道上进行的:

  • 传统测试(Benchmark):就像在完美的赛道上,由专业赛车手驾驶新车,测试它的最高时速和油耗。这能告诉你车理论上有多快。
  • 现实问题:但普通用户开车时,会遇到暴雨、坑洼路面、新手司机、甚至有人突然冲出来。如果只测赛道数据,我们根本不知道这辆车在真实生活中是否安全、是否好用,或者会不会让司机变懒(过度依赖)。

CIRCLE 框架就是要填补这个“赛道”和“真实路况”之间的鸿沟。它不再只关心车跑得多快,而是关心车在真实世界里到底发生了什么


🔄 CIRCLE 的六个阶段(就像一次完整的“生活化”试驾)

CIRCLE 把评估过程分成了六个步骤,形成一个闭环:

1. 情境化 (Contextualize) —— “问问大家怕什么”

  • 做什么:在测试开始前,先问那些不用写代码的人(比如老师、医生、普通司机):“你们最担心什么?”
  • 比喻:就像在造车前,先问家长:“你们怕孩子坐这车时乱按按钮吗?”问老师:“你们怕学生完全依赖 AI 写作业吗?”
  • 产出:一份“情境简报”,列出了大家真正关心的风险点(比如“过度依赖”)。

2. 识别 (Identify) —— “把担心变成考题”

  • 做什么:把上面那些模糊的担心,变成可以测量的具体指标。
  • 比喻:把“怕学生过度依赖”这个担心,变成具体的考题:“如果老师不检查,学生直接提交 AI 生成的答案,算不算过度依赖?”
  • 产出:一份“评估设计计划”,告诉测试人员具体要测什么。

3. 表征 (Represent) —— “上路实测”

  • 做什么:让真实的人在真实的环境中使用 AI,而不是在电脑里模拟。
  • 比喻:把车开进真实的早高峰、学校、医院去跑。让真正的老师用 AI 备课,让真正的学生用 AI 学习。
  • 产出:真实的测试数据(包括意外情况)。

4. 比较 (Compare) —— “看数据,找规律”

  • 做什么:把真实世界的表现和之前的预期对比,看看发生了什么。
  • 比喻:分析数据发现:“哦,原来在下午 3 点,老师因为太累,直接照搬了 AI 生成的教案,这就是‘过度依赖’的具体表现。”
  • 产出:一份“发现综合报告”,把现象和之前的担心对应起来。

5. 学习 (Learn) —— “翻译给决策者听”

  • 做什么:把复杂的测试数据,翻译成大家都能听懂的建议。
  • 比喻:不要只给校长看一堆代码报错,而是说:“校长,如果我们不干预,学生可能会丧失独立思考能力。建议增加‘人工检查’环节。”
  • 产出:一份“利益相关者简报”,指导大家下一步该怎么做。

6. 延伸 (Extend) —— “长期跟踪”

  • 做什么:AI 上线后,还要持续盯着它,看时间久了会不会变坏。
  • 比喻:就像买车后还要做年检,或者观察这辆车开了三年后,是不是让司机变懒了,或者是不是导致了新的交通问题。
  • 产出:一个“持续监控计划”,确保 AI 长期安全。

💡 为什么这个框架很厉害?(三大转变)

  1. 把“噪音”变成“信号”

    • 以前:觉得用户操作不标准、环境太乱是“噪音”,要排除掉。
    • 现在:觉得这些混乱和差异才是最重要的“信号”,因为真实世界就是乱的。
  2. 从“看机器”到“看人”

    • 以前:只看 AI 输出对不对。
    • 现在:看 AI 怎么改变人的行为。比如,AI 会不会让人变笨?会不会改变工作流程?
  3. 从“单点测试”到“系统知识”

    • 以前:每个地方自己测,结果没法比较。
    • 现在:用统一的方法(CIRCLE),让不同学校、不同公司的测试结果可以放在一起看,形成真正的“系统知识”。

🌟 总结

CIRCLE 就像是一个负责任的 AI 管家。它不满足于 AI 在实验室里拿满分,而是坚持要把 AI 放到真实的生活场景中,看着它和人类一起工作,记录它带来的长期影响(比如是否让人变懒、是否改变了工作流程),并把这些发现反馈给决策者,确保 AI 真正为人类服务,而不是制造新的麻烦。

这就好比:我们不仅要造出一辆跑得快的车,更要确保它能让乘客安全、舒适地到达目的地,而不会让司机在途中睡着。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →