'Your AI Text is not Mine': Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions
本文通过引入 AITDNA——一个包含详细交互历史的人机共建文本新基准,来解决目前对于有害 AI 文本使用缺乏共识的问题,旨在证明现有的检测器往往无法作为广泛的解决方案,而仅在针对特定 AI 生成内容定义的情况下表现良好。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正试图批改一叠论文的老师。你怀疑有些学生使用了“魔法写作机器人”(AI)来辅助写作,但你并不知道他们是如何使用的。是机器人写了整篇论文?还是它只是修改了几个句子?还是学生要求机器人针对一个不被允许讨论的主题写了一个特定的段落?
这篇论文认为,目前每个人都在玩一场规则各异的游戏,这也是为什么现有的“AI 检测器”经常感到困惑且不可靠的原因。
以下是该论文主要观点的拆解,使用了简单的类比:
1. 问题所在:每个人都在使用不同的地图
作者指出,构建 AI 检测器的研究人员都在试图解决同一个问题,但他们对“问题”的定义完全不同。
- “全或无”地图: 一些研究人员认为,只有当机器人从头到尾写完了整篇论文时,该文本才属于“AI”。
- “逐句检测”地图: 另一些人则认为,如果论文中任何一个句子是由机器人写的,那么它就是“AI”。
- “润色”地图: 有些人认为,只有当机器人编写了观点/思想时才算作作弊,即便文字是由人类书写的。
类比: 想象一下,你试图在湖中寻找一种特定类型的鱼。一组渔民在寻找任何鱼;另一组只在寻找蓝色的鱼;第三组则只寻找用网捕获的鱼。如果他们都汇报说“我们发现了鱼!”,但使用的定义各不相同,那么他们的报告就无法匹配。论文指出,在我们捕捉“鱼”(或“AI 文本”)之前,我们需要先对“鱼”到底是什么达成共识。
2. 新工具:“黑盒”写作实验室
为了解决这种混乱,研究人员构建了一个新的数据集,名为 AITDNA。
- 旧方法: 大多数之前的数据集就像是“假新闻”。研究人员让机器人重写人类的论文,或者让机器人写的文章由人类进行修改。这是一种经过编排的、人工模拟的情景。
- 新方法 (AITDNA): 研究人员建立了一个真实的“写作实验室”。他们雇佣了 99 个人,让他们在机器人旁边写作。他们记录了所有内容:人类何时打字、何时请求机器人的帮助、何时删除了机器人的建议,以及他们输入的每一个提示词(prompt)。
类比: 之前的数据集就像是在看一部演员表演烹饪美食的电影。你知道那是假的,因为他们并没有真的在切菜。而这个新数据集就像是在真实的厨房里架设摄像机,观察一位主厨和一位副厨如何共同烹饪,记录下每一次切剁、搅拌和品尝。这真实地呈现了人类与 AI 如何协同工作的全貌。
3. 发现:检测器是“专家”,而非“通才”
研究人员在他们全新的、更具现实感的资料上测试了各种 AI 检测器。他们发现了一个令人惊讶的事实:不存在一种能应对所有情况的“超级检测器”。
- “大局观”检测器: 一些检测器非常擅长识别是否整篇论文都是由机器人撰写的。它们就像一名保安,能判断出一栋建筑是空的还是满的。
- “微观”检测器: 另一些检测器则更擅长找出由机器人编写的单个句子。它们就像一名侦探,在寻找一个微小的指纹。
- 失败的情况: 当你要求一个“大局观”检测器去寻找单个句子时,它会失败;当你要求一个“微观”检测器去评判整篇论文时,它会感到困惑。
类比: 这就像试图用望远镜去阅读路牌。望远镜在观察遥远恒星(检测整篇 AI 论文)方面非常出色,但在阅读路牌上的小字(检测单个 AI 句子)方面却表现糟糕。论文发现,检测器通常对于它们受训的特定任务表现优异,但对于其他任务则表现得很差。
4. 新规则:“内容”与“意图”
论文还建议,我们需要新的方式来定义“AI 文本”,以符合现实世界的规则。
- 当前规则: “只要机器人碰过它,它就是 AI。”
- 拟议的新规则:
- 基于内容: “只有当机器人编写了观点/思想(例如文献综述)时,它才是 AI,即便文字是由人类书写的。”
- 基于意图: “只有当机器人被要求编写禁忌内容(例如考试作弊)时,它才是 AI,即便它只是润色了一个句子。”
类比: 想象一条学校规定:“禁止使用计算器。”
- 旧定义: 如果你在进行任何数学运算时使用了计算器,你就失败了。
- 新定义: 如果你使用计算器来解决问题,你就失败了;但如果你只是用计算器来检查你的加法结果,那是没问题的。论文认为,我们需要能够理解“意图”(为什么做)和“内容”(做了什么),而不仅仅是“谁”在做的检测器。
5. 结论:停止猜测,开始明确化
主要的启示是,除非我们对游戏规则达成共识,否则无法比较不同的 AI 检测器。
- 如果你想抓住一个让机器人写完整篇论文的学生,请使用“文档级”检测器。
- 如果你想抓住一个利用机器人编写特定段落的学生,请使用“句子级”检测器。
- 如果你想抓住一个利用机器人编写禁忌话题的学生,请使用“基于内容的”检测器。
最终的比喻: 这篇论文就像一位机械师在告诉你:“你不能用锤子去修理螺丝,也不能用螺丝刀去钉钉子。不要再抱怨你的工具不好用了,你只需要为特定的工作选择正确的工具。”
研究人员发布了他们新的“现实世界”数据和定义列表,以便所有人都能最终使用同一种语言,并构建出更好、更诚实的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。