Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories
本文揭示,大语言模型生成的故事表现出极低的多样性,其中“伊莱亚斯”和“灯塔”等少量词元主导了输出,这并非源于预训练数据,而是由于它们在偏好对齐数据集中更为普遍,从而凸显了小型高质量数据集对模型行为的不成比例的影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你请四位不同的厨师做一道“惊喜菜”,却不给他们任何具体食材。你本会期待四道截然不同的菜肴。然而,假如每位厨师端给你的都是一盘配柠檬和芦笋的烤三文鱼,而且他们都用了完全相同的食谱,那会怎样?
康奈尔大学的研究人员西尔·汉密尔顿(Sil Hamilton)和大卫·米姆诺(David Mimno)正是发现了这一点:当他们要求全球最先进的四个 AI 模型“写一个故事”时,结果竟如此。
以下是他们研究发现的简要说明,并辅以简单的类比:
1. “灯塔里的伊莱亚斯”流行病
研究人员让 AI 模型创作了 20,000 个故事,结果令人震惊地重复。
- 模式:88% 的故事都包含以下 11 个特定词汇中的某一个。
- 角色:故事几乎总是出现一位名叫伊莱亚斯(Elias)的男子、一位名叫玛拉(Mara)的女子,或一位名叫埃拉拉(Elara)的女子。
- 场景:一半的故事都发生在灯塔里。
- 职业:角色几乎总是灯塔看守人、钟表匠、面包师或图书管理员。
这就像所有 AI 模型都去了同一家“创意工厂”,并从架子上挑了完全同一套道具。
2. 这些想法从何而来?(侦探工作)
研究人员像侦探一样,试图找出 AI 为何总是选择这些特定的名字和地点。他们检查了三个潜在来源:
- 真实书籍:他们查阅了数千部已出版的小说。事实上,“伊莱亚斯”和“埃拉拉”这两个名字以及“灯塔”这一场景在真实文学中相当罕见。AI 并非只是在抄袭名著。
- 互联网(预训练):他们检查了 AI 在“训练”为有用助手之前所阅读的海量文本。这些词汇在其中几乎不存在。
- “微调”数据:这才是关键。在 AI 学会阅读之后,人类对它进行了第二轮训练,使其更好地遵循指令(这一过程称为“对齐”)。研究人员发现,AI 正是从极小极小的一部分数据中学到了这些特定的故事。
3. “小数据集,大影响”悖论
这是论文中最令人惊讶的部分:
- AI 的训练基于数十亿份文档。
- 特定的“灯塔里的伊莱亚斯”故事仅占 AI 在最终训练阶段所见故事的3.8%。
- 然而,尽管占比极小,这些故事却完全主导了 AI 的输出。
类比:想象一座拥有 1000 万本书的图书馆。其中只有 380 本是关于一位名叫伊莱亚斯的灯塔看守人的。如果你让一名学生基于这座图书馆写一个故事,你本会期待他从绝大多数其他书籍中汲取灵感。然而,这名 AI 学生似乎如此 intensely 地记住了那 380 本书,以至于忽略了其余 990 万本。
4. 为什么会发生这种情况?
论文指出,AI 并非仅仅在“学习”什么是流行的;它很可能在最终训练阶段被过度修正了。
- AI 被训练以避免“不良”内容(如受版权保护的角色或成人主题)。
- “灯塔里的伊莱亚斯”故事似乎是训练数据中“最安全”的故事。它们通用、安全,且没有版权问题。
- 由于 AI 非常擅长遵循安全规则,它已学会在每次被要求创作新内容时,默认选择这些“安全”故事,从而有效地忽略了它所知晓的广阔而多样的其他故事世界。
结论
该论文总结道,当我们要求这些强大的 AI 模型发挥创造力时,它们实际上并未展现创造力。它们陷入了“模式崩溃”(mode collapse),即反复输出相同、狭隘、安全且重复的故事,因为一小部分特定的训练数据教会了它们,这才是写故事的“正确”方式。
并非 AI 不知道其他故事的存在;而是它最后接受的“安全训练”教会了它,只向我们展示那座灯塔。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。