← 最新论文
💬 NLP

Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI

本研究通过展示在 16 个多语言数据集上平均 87.6% 的检测准确率,挑战了人类无法区分 AI 生成文本的观点,同时指出了具体性、文化细微差别和多样性方面的关键差异,并揭示了当来源不明确时,人类并不总是偏好人类撰写的文本。

原作者: Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Abassy, Saad El Dine Ahmed, Kareem Elozeiri, Nurkhan Laiyk, Maiya Goloburda, Tarek
发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Abassy, Saad El Dine Ahmed, Kareem Elozeiri, Nurkhan Laiyk, Maiya Goloburda, Tarek Mahmoud, Raj Vardhan Tomar, Alexander Aziz, Ryuto Koike, Masahiro Kaneko, Artem Shelmanov, Ekaterina Artemova, Vladislav Mikhailov, Akim Tsvigun, Alham Fikri Aji, Nizar Habash, Iryna Gurevych, Preslav Nakov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《人类喜欢像人类一样的文本吗?多语言人类检测与对 AI 的偏好》的解释。

核心问题:你能认出机器人吗?

想象你正在参加一个派对,大家都在讲故事。突然,一个机器人加入了人群。研究人员想知道:派对上的人类能否分辨出哪些故事是机器人讲的,哪些是真人讲的?

长期以来,专家们认为答案是“不能”。他们相信,现代人工智能(就像我们今天使用的智能聊天机器人)写得如此出色,以至于人类无法区分——这基本上就像抛硬币(50/50 的概率)。

但这篇论文说:“实际上,我们可以分辨出来。”

实验:全球口味测试

研究人员不仅测试了一种语言或一个主题。他们组织了一场大规模的“口味测试”,涉及:

  • 9 种语言: 从英语和中文,到阿拉伯语、印地语和哈萨克语。
  • 9 个领域: 从新闻文章和维基百科页面,到学生论文和推文。
  • 11 种不同的人工智能模型: 包括最新、最智能的 AI 版本。
  • 19 位专家侦探: 他们没有询问街头的随机路人,而是使用了母语为当地语言、且在语言和人工智能领域是专家的人(如博士生和研究人员)。

结果: 这些专家的正确率高达 87.6%。这远远优于随机猜测。事实证明,即使是最智能的 AI 也会留下“指纹”,受过训练的人类能够识别出来。

写作的“恐怖谷”:是什么暴露了 AI?

研究发现,AI 并非写不好;它只是在某些特定且怪异的方式上过于完美。以下是专家们用来识破机器人的五个主要“破绽”:

  1. “模糊的旅行者”(缺乏具体细节):

    • 人类: “我上周去了主街上的乔氏餐厅,那里的咖啡烤焦了。”
    • AI: “我去了一家当地餐厅,那里的咖啡不太好喝。”
    • 比喻: 人类就像摄影师,会放大拍摄具体的细节。AI 则像画家,只画大致的风景。AI 会避免使用具体的名字、日期和网址,因为它害怕犯错。
  2. “无文化的游客”(缺失细微差别):

    • 人类: 使用当地俚语、宗教典故或只有当地人能懂的文化笑话。
    • AI: 以一种“标准”的方式写作,感觉安全但平淡无味。
    • 比喻: 人类作家是当地向导,知道秘密捷径和隐藏的宝藏。AI 则是旅游大巴司机,严格只走主干道,错过了地方的灵魂。
  3. “机器人舞步”(公式化的结构):

    • 人类: 写作时段落杂乱,有时有拼写错误,有时长句,有时短句。它是混乱而充满生机的。
    • AI: 使用项目符号、粗体标题和完美的段落分隔。它总是说“第一、第二、最后”。
    • 比喻: 人类写作就像爵士乐即兴演奏——有时混乱,有时令人惊喜。AI 写作则像行进乐队——完美同步且可预测。
  4. “礼貌的陌生人”(情感与语调):

    • 人类: 可以愤怒、讽刺、刻薄或充满深情。
    • AI: 几乎总是礼貌、中立或过度积极。它很少采取强硬立场或变得“刻薄”。
    • 比喻: 人类就像波涛汹涌的大海,情感起伏不定。AI 则像平静如镜的湖泊。
  5. “语言搅拌器”(混合语言):

    • 人类: 主要坚持使用一种语言。
    • AI: 有时在写日语、阿拉伯语或哈萨克语时,会不小心混入英语单词或短语。
    • 比喻: 这就像一位厨师在做传统的意大利菜时,不小心往酱汁里滴了一勺美式番茄酱。

我们能愚弄侦探吗?(“提示”实验)

研究人员问道:如果我们告诉 AI,“嘿,别那么完美!加些拼写错误,用点俚语,具体一点”,它能骗过我们吗?

他们给 AI 下达了新指令(提示),让它表现得更像人类。

  • 奏效了吗? 是的,但只是部分奏效。
  • 结果: 当 AI 努力听起来更像人类时,专家的检测准确率从 87.6% 下降到了 72.5%
  • 关键点: AI 变得更擅长隐藏了,但它仍然无法掌握人类写作的“灵魂”。它可以模仿人类文本的外观(添加标签或杂乱的格式),但在感觉(文化细微差别和真实情感)方面仍然挣扎。

转折:我们真的喜欢人类文本吗?

这是论文中最令人惊讶的部分。研究人员问专家:“你更喜欢哪种文本?人类的还是 AI 的?”

你可能会想:“当然他们更喜欢人类的!”
错了。

  • 当他们知道哪个是哪个时: 他们通常更喜欢人类文本。
  • 当他们无法区分时: 他们往往更喜欢 AI 文本!

为什么?

  • “干净”因素: AI 文本通常更整洁、组织更好,且没有拼写错误。人类发现这更容易阅读。
  • “刻薄”因素: 在某些情况下(如论坛上的情感问题),人类的回答可能苛刻、讽刺或粗鲁。而 AI 则礼貌且支持性强。在这些情况下,人类更喜欢机器人的善意。
  • “无聊”因素: 当 AI 文本过于通用时,人类会因为其真实感而更喜欢人类文本。

比喻: 想象你在选择一顿饭:一边是一位有点邋遢但使用新鲜本地食材的厨师做的菜(人类),另一边是包装完美、无菌的自动售货机食物(AI)。

  • 如果你知道哪个是哪个,你会为了味道选择厨师做的菜。
  • 但如果你分不清,而且自动售货机的食物看起来更干净,而厨师的食物看起来有点油腻,你可能就会随手拿起自动售货机的食物。

结论

这篇论文得出了一个巨大的认识:
“像人类”并不等同于“被人类喜欢”。

当前的 AI 在模仿人类行为(看起来像人类)方面已经非常擅长。但要真正被人类喜欢,AI 需要做的不仅仅是模仿我们。它需要理解个人偏好、文化深度以及作为人类那种混乱、充满情感的现实。

研究人员发布了所有数据,以便其他科学家继续尝试构建不仅看起来像人类,而且让我们感觉像人类的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →