← 最新论文
💬 NLP

LLMs Generate Kitsch

本文认为,大语言模型(LLM)输出被感知为缺乏个性且空洞,源于其训练方法导致其系统性生成媚俗内容,这一观点得到了实证证据的支持,即读者认为大语言模型生成的故事比人类作品更具媚俗性。

原作者: Xenia Klinge, Stefan Ortlieb, Alexander Koller

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Xenia Klinge, Stefan Ortlieb, Alexander Koller

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《大型语言模型生成媚俗》的解释。

核心理念:“完美”的复制品 vs. 真实之物

想象你走进一家博物馆。一边是一幅由著名艺术家创作的画作,这位艺术家花费数年与自己的情感搏斗,画出了某种怪异而艰难、引人深思的作品。另一边是一幅看起来与经典杰作一模一样的画作,但它是由一台机器创作的,这台机器研究了数百万幅其他画作,并决定:“人们喜欢日落和悲伤的面孔,所以我要画一幅完美的日落配上悲伤的面孔。”

机器的画作在技术上完美无缺。它没有任何错误,也很美。但感觉有点空洞,就像你在加油站买的一张贺卡。这篇论文的作者将这种感觉称为“媚俗”(Kitsch)。

媚俗是指那些看起来像艺术,但实际上只是廉价、大规模生产的仿制品,旨在让每个人迅速产生一种简单的情感(比如“啊,好可爱”或“哦,好悲伤”),而无需让你深入思考。

这篇论文认为,像你现在正在对话的这种大型语言模型(LLM)本质上是“媚俗机器”。 它们不创造真正的艺术;它们创造的是高质量却空洞的复制品。


为什么大型语言模型会制造媚俗?

作者表示,这并非偶然,而是机器构建方式使然。他们通过一些简单的类比给出了三个原因:

1. 机器没有灵魂(没有意图)

想象一只鹦鹉,它能重复你说的任何句子。如果你让鹦鹉写一首关于心碎的诗,它会说出听起来像心碎的话,因为它以前听过这些话。但鹦鹉实际上并不感到悲伤。它没有内在生活。

  • 论文观点: 大型语言模型的工作原理与此相同。它们根据通常接下来会出现什么来预测下一个词。它们没有情感、记忆,也没有写作的原因。它们只是在模仿人类情感的形式,而没有实质

2. 机器求稳(常规表面)

想象一位厨师,只烹饪那些保证受欢迎的菜肴。他们永远不会尝试可能让人困惑的怪异或实验性口味。他们只会制作“经典”的千层面,因为他们知道每个人都喜欢它。

  • 论文观点: 大型语言模型被训练来预测最可能出现的下一个词。这意味着它们自然会避开怪异、冒险或创新的想法。它们坚持“标准”的讲故事或写诗方式。这使得它们的输出易于阅读和理解(这很好!),但也意味着它们缺乏真正人类创造力中那种独特而令人惊喜的火花。

3. 机器渴望被喜爱(大众吸引力)

想象一位讲笑话的喜剧演员。如果他们想让每个人都笑,他们会讲关于猫和披萨的安全、通用的笑话。如果他们讲的笑话太具体或太怪异,可能只有少数人会笑。

  • 论文观点: 大型语言模型通常使用一种称为“基于人类反馈的强化学习”(RLHF)的方法进行训练。这就像老师每当有人说“我喜欢这个答案”时,就给机器人一颗金星。机器人学到,为了获得金星,它必须说出能吸引最广泛受众的话。这迫使机器人产生“安全”、通用的内容,触发简单的情感(如怀旧或浪漫),而不是复杂、具有挑战性的情感。

实验:人们能察觉吗?

作者们并非凭空猜测;他们进行了一项测试。

实验设置:
他们选取了 10 篇由人类撰写的短篇小说(来自写作比赛),并要求人工智能基于相同的主题创作一篇新故事,但不查看原文。然后,他们让 100 多人阅读这些成对的故事,并猜测哪一篇是“媚俗”(虚假、空洞或过度感伤)。

实验结果:

  1. 人们识破了虚假: 当人们被要求将“媚俗”定义为“感伤”或“易于阅读”时,他们正确识别出 AI 故事为媚俗的比例约为85%。他们能分辨出 AI 故事就是那些“加油站贺卡”。
  2. 但人们更喜欢虚假: 这里有个转折。尽管人们知道 AI 故事是“媚俗”,他们仍然更喜欢阅读它。 大约 67% 的情况下,人们表示他们比人类故事更享受 AI 故事。

类比:
这就像吃一根经过完美工程设计的含糖糖果棒,与吃一块复杂、微苦的黑巧克力。

  • 糖果棒(AI/媚俗) 很甜,容易入口,能给你即时的糖分冲击。你当下更享受它。
  • 黑巧克力(人类艺术) 可能更难消化,有点苦,需要你细细品味。它具有更多的“营养价值”(艺术深度),但不像前者那样能立即带来满足感。

这意味着什么?

这篇论文得出了几个重要的结论:

  • "AI 垃圾”问题: 我们正看到大量 AI 内容的涌现,它们看起来很棒但感觉空洞。这是因为 AI 被设计得旨在受欢迎,而非深刻。
  • 不要只问“你喜欢吗?”: 如果研究人员想了解 AI 在创造艺术方面是否出色,他们不能只问人们“你更喜欢哪一个?”。因为人们往往更喜欢“媚俗”。他们需要提出更深入的问题,探讨作品的质量和原创性。
  • 人类的作用仍然不可或缺: 作者认为,AI 擅长创造力的“枯燥”部分(比如编写标准代码片段或基本故事大纲),但如果你想要真正具有艺术性、科学性或创新性的东西,人类必须掌握方向盘。如果你让机器全程驾驶,你得到的只是一段非常顺畅、非常无聊且通往虚无的旅程。

简而言之: 大型语言模型非常擅长制作让我们瞬间感觉良好的“完美”复制品,但它们极不擅长制造那些让我们思考的混乱、艰难且独特的东西。它们是媚俗的终极大师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →