Convergent assessment cannot be policed: a residual-entropy bound on authorship attribution and its consequences for integrity in quantitative disciplines
本文认为,对于像多项选择题这类收敛性评估形式而言,作者身份归属在结构上是不可能的,因为正确答案包含零剩余熵,这使得目前基于论文检测的 AI 诚信政策在定量学科中显得不合理,并使得针对特定模态的控制措施成为必要。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜题的侦探,谜题是:“这是谁写的?”在学校和大学的世界里,这是学术诚信的终极问题。多年来,侦探们使用的主要工具是一种专门为长篇叙述——即文章——设计的特殊“指纹扫描仪”。这些扫描仪寻找一个人写作时微小且独特的习惯,比如他们如何使用逗号或构建句子结构。但转折在于:AI聊天机器人写这类故事的能力正变得如此之强,以至于这些扫描仪正面临挣扎。学校正试图通过将这种“文章扫描器”的逻辑应用于学生做的其他所有事情(如数学题、多项选择题和编程任务)来修复这个问题。
为了理解为什么这可能是一个死胡同,我们需要看两个简单的概念。首先,把“信息”想象成一条消息中独特细节的数量。一篇长文章就像一个杂乱、独特的指纹;它拥有大量能告诉你创作者身份的微小细节。而一个数学答案,比如数字“42”,就像一颗完美的、光滑的大理石。如果两个人正确地解决了同一个问题,他们都会产生完全相同的“42”。这里没有杂乱感,没有独特的指纹,也没有可以检查的额外细节。其次,把“作者归属判定”视为利用这些独特细节来证明是谁完成了工作的行为。如果最初就没有独特细节,那么再精巧的技术也无法凭空创造出它们。本文提出了一个大胆的问题:当我们试图用指纹扫描仪去扫描一颗光滑的大理石时,会发生什么?
论文的核心发现:“光滑大理石”问题
这篇名为《趋同性评估无法被监管》(Convergent assessment cannot be policed)的研究论文指出,学校正在犯一个根本性的错误。他们试图用基于文章的规则来监管数学、科学和多项选择测试,但作者认为这是不可能的。这并不是因为AI检测器不好,也不是因为工具需要改进;而是因为这类工作本身的类型并不包含足以识别作者的信息。
作者引入了一个概念,叫做**“残余熵”(residual entropy)。想象你在烤曲奇饼。如果你要求一名学生“写一个关于曲奇的故事”,他可能会写一首诗、一个恐怖故事或一个食谱。实现方式有成千上万种,而且每个版本都有创作者风格的独特“指纹”。这是高熵。但如果你要求一名学生“解出X的值”且答案是“5”,那么写出这个答案的正确方式只有一种。无论是一个天才、一个挣扎的学生,还是一台超智能机器人写下了它,结果都是完全相同的“5”。作者称之为“零残余熵”**。一旦答案正确,就没有任何剩余的变化可以进行分析了。
论文从数学上证明,你无法提取超出实际存在的信息。如果答案仅仅是一个字母或一个数字,那么就没有可以寻找的“信号”。在这些格式上使用AI检测器,就像试图在一块完美光滑、空白的玻璃上寻找指纹。无论你的显微镜有多强大,你都找不到指纹,因为玻璃本身就没有指纹。
三个风险区域
作者使用了来自13个学科、19项研究的数据,绘制出了不同学校任务所处的不同区域或机制。他们发现了三个截然不同的“区域”:
- 暴露区(危险区): 这包括多项选择题、短数值答案和标准问题集。在这个区域,AI表现得极其出色(在多项选择题上的得分通常超过96%),但答案具有零作者特征。论文认为,在这个区域,你根本无法判断是人类还是机器人完成了这项工作。这不仅仅是“难以分辨”的问题;而是“谁做了这件事?”这个问题本身就没有答案。
- 潜伏区(候车室): 这包括一些AI目前还不够聪明到能轻易通过的短数值问题。这些之所以“安全”,仅仅是因为AI现在的水平还不够。但作者警告说,这是一个滴答作响的时钟。一旦AI变得更聪明,这种“安全性”会瞬间消失,因为仍然没有任何作者特征可以作为后盾。
- 可检测区(安全区): 这包括长篇论文、反思性写作和复杂的编程项目。在这里,答案是如此多样且独特的,以至于AI检测器可以发挥作用。论文指出,研究如何检测代码中的AI是成功的,因为代码拥有足够的“指纹”细节,不像简单的数学答案那样。
令人震惊的数据
当作者将这一逻辑应用于一个典型的科学与工程类大学课程时,结果令人震惊。他们发现,在这些课程中,38% 的最终成绩来自于“暴露区”的任务(如多项选择题和问题集)。相比之下,只有5% 的人文课程掉入了这个陷阱。
如果你将证据标准提高到刑事法庭所需的水平(一个非常高的门槛),科学与工程类课程中的暴露任务比例会跃升至52%。这意味着,对于理科生超过一半的最终成绩,学校根本无法证明到底是谁完成了这项工作,而且不存在任何工具能够做到这一点。
这对学校意味着什么
该论文明确排除了“我们只需要购买更好的软件就能解决问题”的可能性。作者明确表示,任何检测技术的改进都无法解决多项选择或数学题的问题,因为信息本身就不在那里。根据“AI检测”来指控学生在数学测验中使用未经授权的AI不仅是无效的,作者认为,在数学上这甚至无法被证明。
相反,论文建议学校彻底改变策略:
- 停止监管那些无法被监管的事物: 不要对多项选择或短答数学题使用作者归属检测器。这是在浪费时间,并会导致不公平的指控。
- 改变游戏规则: 如果你想知道是谁完成了工作,你需要改变任务。使用监督式考试(老师看着你进行),要求学生当面解释他们的思路,或者设计针对特定课堂的问题,使AI无法直接查找答案。
- 接受局限性: 对于“暴露区”,唯一的真正保障是防止AI的使用(例如在封闭房间内),而不是在事后试图抓捕它。
简而言之,论文的结论是,目前的“一刀切”学术诚信方法已经失效了。你不能用设计给文章使用的工具去监管数学题。对于很大一部分科学与工程教育来说,真正的课题不是“我们如何抓住作弊者?”,而是“我们如何设计测试,使得‘未经授权使用AI’这个问题本身就变得毫无意义?”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。