Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence
本文介绍了 SurpMark,这是一种针对大语言模型生成文本的鲁棒黑盒检测器,它利用词元惊讶度动态和广义 Jensen-Shannon 散度度量,在无需访问源模型的情况下有效区分人类与机器写作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图判断一个故事是由人类还是机器人撰写的。过去,侦探们会寻找明显的线索,比如拼写错误或奇怪的语法。但如今的机器人(大型语言模型,或称 LLM)写作能力如此出色,它们极少犯这些错误。它们听起来几乎与人类完全一致。
本文介绍了一种名为SurpMark的新型侦探工具。SurpMark 不关注使用了哪些词语,而是关注作者在打字时如何思考。
以下是其工作原理,使用简单的类比来说明:
1. “惊喜计量表”
想象你正在阅读一个故事。
- 人类作者经常会有出人意料的转折。他们可能会说一些令人惊讶的话,然后下一句话显得有些混乱,或者突然跳转到一个新的想法。
- 机器人被训练得具有可预测性。当机器人写作时,它通常会选择“最安全”的下一个词。如果它确实选择了一个令人惊讶的词(也许是为了发挥创意),它会立即恢复高度可预测的状态以保持连贯。
SurpMark 就像一个惊喜计量表。它衡量语言模型对文本中每个词感到“惊讶”的程度。
- 如果文本出自人类,惊喜计量表会以狂野、不规则的模式上下跳动。
- 如果文本出自机器人,计量表则呈现出特定的节奏:一次大幅跳动(惊喜)之后立即跟随一个平静、可预测的下沉。
2. 将计量表转化为地图
本文将这些“惊喜”数值转化为简单的类别,就像交通信号灯一样:
- 🟢 绿色: 非常可预测(不令人惊讶)。
- 🟡 黄色: 略微令人惊讶。
- 🔴 红色: 非常令人惊讶。
SurpMark 不看原始数值,而是观察颜色的序列。它会问:“文本从红色变为绿色的频率有多高?从绿色变为黄色的频率有多高?”
3. “状态转换”地图
把这想象成一个舞池。
- 人类舞者可能会从慢步突然跳到快速旋转,再滑向另一个动作,方式非常独特且不可预测。
- 机器人舞者则有特定的习惯。如果它们做了一个狂野的旋转(红色),它们几乎总是会立即回到缓慢、稳定的步伐(绿色)。它们拥有一种“恢复”模式。
SurpMark 构建了这些舞步(转换)的地图。它基于事先研究的数千个例子,创建了一张“人类舞步地图”和一张“机器人舞步地图”。
4. 最终测试:“差距”
当新文本出现时,SurpMark 记录其舞步,并与这两张地图进行比较。
- 它计算新文本与人类地图之间的距离。
- 它计算新文本与机器人地图之间的距离。
- 它将两者相减。
如果文本的舞步更像机器人地图(尤其是那种特定的“旋转后恢复稳定”的模式),检测器就会将其标记为机器生成。如果它更像混乱的人类地图,则被标记为人类创作。
这有何特别之处?
本文突出了三个主要优势:
- 它无需知道机器人的名字: 许多检测器需要确切知道是哪个机器人撰写了文本才能有效工作。SurpMark 是一个“黑盒”检测器。即使文本是由它从未见过的、秘密且强大的机器人撰写的,它也能发挥作用。它只关注思考的风格,而非特定的模型。
- 它快速且廉价: 其他一些检测器试图重写文本或生成新版本以观察其变化。这就像要求嫌疑人写五遍故事,看看他们是否会紧张。这需要大量的时间和计算能力。而 SurpMark 只需阅读一次文本,就像快速瞥一眼指纹。
- 它能捕捉“高级”机器人: 研究发现,对于非常聪明、昂贵的机器人,“惊喜”水平看起来几乎与人类完全一致。然而,它们从惊喜中“恢复”的模式(即舞步)仍然不同。SurpMark 能够捕捉到其他检测器遗漏的这种微妙节奏。
核心结论
SurpMark 是一种通过分析写作中惊喜节奏来检测 AI 文本的工具。它不在乎具体的词语,而在乎文本的“心跳”。如果心跳具有机器特有的那种“冲击后恢复”的节奏,它就能识别出这是 AI,即使机器人正极力模仿人类。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。