← 最新论文
💻 computer science

Toward AI-Resilient Assessment in Computer Science Courses in an AI-Native World

本文提出了一个用于计算机科学领域 AI 韧性评估的正式框架,该框架根据学生在声明的 AI 基准之上所实现的“帕累托盈余”(即可衡量的性能提升)进行评分,同时允许不受限制地使用 AI,并要求通过补充协议来验证真实技能。

原作者: Anshumali Shrivastava

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Anshumali Shrivastava

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:为什么要改变游戏规则?

想象一下,你是一位正在给学生出数学考试的老师。在过去,你会要求学生手动进行长除法。而今天,每个学生的口袋里都揣着一个超级计算器,可以瞬间完成这些计算。

如果你仍然要求他们手动做长除法,你测试的就不再是他们的数学能力,而是在测试谁更擅长藏起计算器。如果你试图禁止使用计算器,你就是在打一场注定失败的仗,因为技术实在太强大了。

作者的想法: 我们不应该禁止计算器(或者在这里指 AI),而应该改变测试的内容。新的测试不应该问:“你会做数学题吗?”而应该问:“你能否利用计算器去解决一个计算器本身无法独立解决的问题?”

这篇论文提出了一种在“AI 原生”时代衡量计算机科学专业学生水平的新方法。其目标是停止纠结于“作弊”,转而开始衡量“技能”。


核心概念:“前沿”与“盈余”

要理解作者的解决方案,请想象一款带有高分排行榜的电子游戏。

1. AI 基准线(“黄金标准”排行榜)

在学生开始之前,老师使用目前最强大的 AI 来完成这项作业。AI 会尝试成千上万次,不断调整其代码,直到找到它能生成的最佳解。

  • 隐喻: 这创建了一个“黄金标准”排行榜。假设 AI 可以建造一个容量为 90% 的数字仓库,每秒处理 100 次项目,且运行成本为 10 美元。
  • 规则: 任何仅仅复制 AI 答案的学生只能得到一个“B”(或基准成绩)。他们没有学到任何新东西,只是达到了机器的水平。

2. 帕累托前沿(Pareto Frontier,即“地图边缘”)

在计算机科学中,你经常需要进行权衡。你可以让系统更快,但可能会增加成本;你可以让它更便宜,但可能会变慢。

  • 隐喻: 想象一张地图,其中的“前沿”是已探索世界的边缘。AI 已经探索到了它所能到达的最远处。它找到了速度、成本和准确性之间最好的平衡点。
  • 目标: 学生的任务是找到那个位于该边缘之外的点。

3. 帕累托盈余(Pareto Surplus,即“新领地”)

这是最重要的部分。只有当学生的解决方案做到了 AI 做不到的事情时,他们才能获得额外加分(更高的成绩)。

  • 隐喻: 如果 AI 找到了一条 10 英里的路径,而学生找到了一条 9 英里的路径,那么学生就发现了“盈余”。他们扩展了地图。
  • 关键点: 如果学生的方案与 AI 的方案一样好,他们只能得到基准成绩。如果比 AI 的差,则不及格。如果做得更好(以一种突破了 AI 当前极限的方式),他们就能获得“盈余”等级。

为什么这是“抗 AI”的?
因为无论学生是否使用 AI 来编写代码都无所谓。如果 AI 本就能写出那段代码,学生就只能得到基准成绩。要获得“A”,学生必须运用人类的判断力,引导 AI 进入一个 AI 无法独立发现的解决方案中。


系统如何运作(“黑盒”老师)

论文建议了一种非常具体的教学方式,以确保公平性:

  1. 隐藏考试: 老师创建一个“黑盒”评估器。学生看不到最终的测试数据,他们只能看到一个摘要(例如:“你的系统运行速度慢了 5%”)。
  2. 预算限制: 老师会对官方反馈循环中允许使用的“AI 辅助”程度设定上限。这可以防止学生通过购买更昂贵的 AI 订阅来暴力破解答案。
  3. “红队”检查: 在课程开始前,老师会尝试“破坏”测试。他们会问:“一个低级的 AI 能直接猜出答案吗?”如果答案是肯定的,老师就会修改测试,直到答案是否定的。

具体案例:“布隆过滤器”竞赛

论文给出了一个真实的例子,展示了这在理斯大学(Rice University)的 COMP 480/580 课程中是如何运作的。

  • 任务: 构建一个“布隆过滤器”(Bloom Filter)。你可以把它想象成一个极其高效的数字夜店保安。它负责检查某个名字是否在宾客名单上。它允许犯一点小错(比如把不在名单上的人误认为在),但绝不能把名单上的人误认为不在。
  • 挑战: 老师提供了两个版本的俱乐部:
    • 小型俱乐部(MB 规模): 一个针对咖啡馆的小型保安。
    • 大型俱乐部(GB 规模): 一个针对体育场的大型保安。
  • AI 基准线: 老师运行 AI 来为这两个规模的俱乐部构建最好的保安。
  • 学生的任务: 学生必须利用他们对计算机系统(内存如何工作、数据如何组织)的知识,构建一个比 AI 版本更快或更便宜的保安。
    • 也许 AI 构建了一个速度很快但占用过多内存的保安。
    • 也许学生发现了一种组织数据的方法,使其能够放入计算机的“缓存”(就像放进兜里一样),从而使速度提升 10 倍。
  • 评分: 如果学生的保安比 AI 的更好,他们获得“盈余”等级。如果他们只是复制 AI,则只能获得基准等级。

为什么这意义重大

  1. 它终结了“复制粘贴”的军备竞赛: 老师不需要把所有时间都花在抓学生使用 AI 上。由于评分系统会自动忽略 AI 生成的代码(除非它真的比 AI 的最佳尝试还要好),因此这种行为会被自动过滤。
  2. 它奖励人类的判断力: 该系统重视人类提出“为什么 AI 在这里变慢了?”以及“我该如何修复它?”的能力。这才是未来真正有价值的技能。
  3. 它是公平的: 它拉平了竞争环境。无论一名学生拥有每月 20 美元的 AI 订阅,还是另一名学生使用的是免费版,都不重要。因为“盈余”是相对于一个固定的、冻结的 AI 基准线来衡量的。如果免费 AI 无法击败基准线,那么昂贵的 AI 也无法获得额外加分。

总结

作者认为,我们不应该再问“你是否使用了 AI?”,而应该问“你是否利用 AI 走到了 AI 无法独自到达的高度?”

如果一名学生可以利用 AI 工具并将其推向实现某种新功能,那么这就是未来优秀计算机科学家的定义。这篇论文提供了一个数学化且具有实践意义的蓝图,用以精准衡量这种技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →