Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI
本研究通过展示在 16 个多语言数据集上平均 87.6% 的检测准确率,挑战了人类无法区分 AI 生成文本的观点,同时指出了具体性、文化细微差别和多样性方面的关键差异,并揭示了当来源不明确时,人类并不总是偏好人类撰写的文本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和生动的类比对论文《人类喜欢像人类一样的文本吗?多语言人类检测与对 AI 的偏好》的解释。
核心问题:你能认出机器人吗?
想象你正在参加一个派对,大家都在讲故事。突然,一个机器人加入了人群。研究人员想知道:派对上的人类能否分辨出哪些故事是机器人讲的,哪些是真人讲的?
长期以来,专家们认为答案是“不能”。他们相信,现代人工智能(就像我们今天使用的智能聊天机器人)写得如此出色,以至于人类无法区分——这基本上就像抛硬币(50/50 的概率)。
但这篇论文说:“实际上,我们可以分辨出来。”
实验:全球口味测试
研究人员不仅测试了一种语言或一个主题。他们组织了一场大规模的“口味测试”,涉及:
- 9 种语言: 从英语和中文,到阿拉伯语、印地语和哈萨克语。
- 9 个领域: 从新闻文章和维基百科页面,到学生论文和推文。
- 11 种不同的人工智能模型: 包括最新、最智能的 AI 版本。
- 19 位专家侦探: 他们没有询问街头的随机路人,而是使用了母语为当地语言、且在语言和人工智能领域是专家的人(如博士生和研究人员)。
结果: 这些专家的正确率高达 87.6%。这远远优于随机猜测。事实证明,即使是最智能的 AI 也会留下“指纹”,受过训练的人类能够识别出来。
写作的“恐怖谷”:是什么暴露了 AI?
研究发现,AI 并非写不好;它只是在某些特定且怪异的方式上过于完美。以下是专家们用来识破机器人的五个主要“破绽”:
“模糊的旅行者”(缺乏具体细节):
- 人类: “我上周二去了主街上的乔氏餐厅,那里的咖啡烤焦了。”
- AI: “我去了一家当地餐厅,那里的咖啡不太好喝。”
- 比喻: 人类就像摄影师,会放大拍摄具体的细节。AI 则像画家,只画大致的风景。AI 会避免使用具体的名字、日期和网址,因为它害怕犯错。
“无文化的游客”(缺失细微差别):
- 人类: 使用当地俚语、宗教典故或只有当地人能懂的文化笑话。
- AI: 以一种“标准”的方式写作,感觉安全但平淡无味。
- 比喻: 人类作家是当地向导,知道秘密捷径和隐藏的宝藏。AI 则是旅游大巴司机,严格只走主干道,错过了地方的灵魂。
“机器人舞步”(公式化的结构):
- 人类: 写作时段落杂乱,有时有拼写错误,有时长句,有时短句。它是混乱而充满生机的。
- AI: 使用项目符号、粗体标题和完美的段落分隔。它总是说“第一、第二、最后”。
- 比喻: 人类写作就像爵士乐即兴演奏——有时混乱,有时令人惊喜。AI 写作则像行进乐队——完美同步且可预测。
“礼貌的陌生人”(情感与语调):
- 人类: 可以愤怒、讽刺、刻薄或充满深情。
- AI: 几乎总是礼貌、中立或过度积极。它很少采取强硬立场或变得“刻薄”。
- 比喻: 人类就像波涛汹涌的大海,情感起伏不定。AI 则像平静如镜的湖泊。
“语言搅拌器”(混合语言):
- 人类: 主要坚持使用一种语言。
- AI: 有时在写日语、阿拉伯语或哈萨克语时,会不小心混入英语单词或短语。
- 比喻: 这就像一位厨师在做传统的意大利菜时,不小心往酱汁里滴了一勺美式番茄酱。
我们能愚弄侦探吗?(“提示”实验)
研究人员问道:如果我们告诉 AI,“嘿,别那么完美!加些拼写错误,用点俚语,具体一点”,它能骗过我们吗?
他们给 AI 下达了新指令(提示),让它表现得更像人类。
- 奏效了吗? 是的,但只是部分奏效。
- 结果: 当 AI 努力听起来更像人类时,专家的检测准确率从 87.6% 下降到了 72.5%。
- 关键点: AI 变得更擅长隐藏了,但它仍然无法掌握人类写作的“灵魂”。它可以模仿人类文本的外观(添加标签或杂乱的格式),但在感觉(文化细微差别和真实情感)方面仍然挣扎。
转折:我们真的喜欢人类文本吗?
这是论文中最令人惊讶的部分。研究人员问专家:“你更喜欢哪种文本?人类的还是 AI 的?”
你可能会想:“当然他们更喜欢人类的!”
错了。
- 当他们知道哪个是哪个时: 他们通常更喜欢人类文本。
- 当他们无法区分时: 他们往往更喜欢 AI 文本!
为什么?
- “干净”因素: AI 文本通常更整洁、组织更好,且没有拼写错误。人类发现这更容易阅读。
- “刻薄”因素: 在某些情况下(如论坛上的情感问题),人类的回答可能苛刻、讽刺或粗鲁。而 AI 则礼貌且支持性强。在这些情况下,人类更喜欢机器人的善意。
- “无聊”因素: 当 AI 文本过于通用时,人类会因为其真实感而更喜欢人类文本。
比喻: 想象你在选择一顿饭:一边是一位有点邋遢但使用新鲜本地食材的厨师做的菜(人类),另一边是包装完美、无菌的自动售货机食物(AI)。
- 如果你知道哪个是哪个,你会为了味道选择厨师做的菜。
- 但如果你分不清,而且自动售货机的食物看起来更干净,而厨师的食物看起来有点油腻,你可能就会随手拿起自动售货机的食物。
结论
这篇论文得出了一个巨大的认识:
“像人类”并不等同于“被人类喜欢”。
当前的 AI 在模仿人类行为(看起来像人类)方面已经非常擅长。但要真正被人类喜欢,AI 需要做的不仅仅是模仿我们。它需要理解个人偏好、文化深度以及作为人类那种混乱、充满情感的现实。
研究人员发布了所有数据,以便其他科学家继续尝试构建不仅看起来像人类,而且让我们感觉像人类的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。