Homoglyph-based Adversarial Perturbation of Introductory Computer Science Theory Problems
本文提出并评估了一种基于同形异义字符对抗性扰动的方法,用于修改计算机科学导论理论问题而不改变其语义,旨在防止学生依赖人工智能工具完成作业。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位老师,正试图给学生布置数学作业。你希望他们深入思考并独立解题。但最近,学生们一直在使用超级智能的 AI 助手(如 ChatGPT 或 Gemini)代劳。这些 AI 工具如此强大,甚至能即时回答那些略带棘手的问题。
这篇论文的作者想出了一个巧妙的招数来制止这种“懒惰学生”的行为。他们称之为“基于同形异义字的对抗性扰动”。这听起来很花哨,其实意思就是:“修改问题中的几个字母,让人类仍能读懂,但 AI 会感到困惑并给出错误答案。”
以下是他们方法的简要步骤分解:
1. 问题:AI 太擅长“猜题”了
研究人员发现,这些 AI 工具就像背熟了整本教科书的学生。如果你问它们一个经典的数学问题(例如“证明有理数乘以无理数是无理数”),它们会立即作答,因为在训练数据中,它们已经见过完全相同的问题上百万次。
即使你试图稍微搞乱问题——比如删掉一个词或改变一个数字——AI 也足够聪明,能根据记忆“填补空白”。这就像你问一个背熟了食谱的朋友:“如何用……呃……面粉、糖和……[空白] 来做蛋糕?”他们甚至不用你提示就会直接说“鸡蛋”,因为他们对食谱倒背如流。
2. 解决方案:“特洛伊木马”策略
作者意识到,仅仅打乱文本是不够的,AI 会自行修正。相反,他们采用了两步策略:
步骤 A:稍微修改“食谱”。 首先,他们拿一个标准问题,进行微调,使其不再存在于 AI 的记忆库中。
- 示例: 与其问“一个有理数”,他们可能会说“让我们称这个数为 7x"。
- 原因? 这使得问题变得独特。AI 以前从未在这个特定语境下见过"7x",因此无法直接从记忆中提取答案。
步骤 B:视觉幻觉(同形异义字)。 接下来,他们使用同形异义字。这些字符看起来与正常字母或数字几乎完全一样,但实际上是来自其他语言或字体的不同符号。
- 类比: 想象数字 7。现在想象一个符号,在你眼中看起来与 7 完全一样,但对计算机而言,它却是完全不同的字符(比如来自不同字母表的怪异符号)。
- 他们将一个普通数字(如 7)替换为这个“假 7"。
3. 结果:AI 被愚弄了
当 AI 看到这个“假 7"时,它会感到困惑。它无法识别该符号,于是惊慌失措,试图猜测它“应该”是什么。由于 AI 倾向于它记忆中的原始教科书问题,它会忽略这个“假 7",直接假设你指的是原来的"7"(或者有时直接将其删除)。
- 人类体验: 学生看着试卷,看到的是"7x"。他们能正确阅读并解决数学问题。
- AI 体验: AI 看到了一个它无法理解的怪异符号。它猜错了,忽略了数学逻辑,并给出了完全错误的答案。
4. 需要多少改动?
最棒的是,你不需要重写整个问题。研究人员发现,通常只需修改一两个字符就足以让 AI 失效。
- 如果你改动太多,AI 反而可能识破模式。
- 但如果你只改动极小的一点(比如将一个"6"换成一个长得像的"6"),AI 就会因此绊倒,而人类学生则能顺利通过。
5. 给教师的工具
作者不仅写了一篇论文,还构建了一个简单的交互式工具。
- 教师可以上传他们的作业题目。
- 他们可以点击想要修改的数字或字母。
- 该工具会向他们展示一系列“长相相似”的字符(同形异义字)。
- 他们选择一个,工具就会将其替换进去。
- 现在,作业对 AI 作弊是安全的,但对学生来说仍然易于阅读。
总结
可以将这种方法视为给作业披上了一层视觉伪装。对人类眼睛而言,作业看起来很正常。但对于依赖识别特定模式的 AI 来说,这份作业现在变成了一个它无法解决的谜题。它迫使学生真正动手做作业,而不是让机器人替他们完成。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。