← 最新论文
💬 NLP

Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models

本文介绍了 Diverse-NS,一种长度控制型数据选择策略,它缓解了语言模型对较短输出的系统性偏见,从而在保持质量的同时,显著增强了各种创意任务中的响应多样性与表达力。

原作者: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《Diverse, not Short》(多样化,而非短小)的解释,采用了简单易懂的语言和日常类比。

问题所在:“短小且乏味”的陷阱

想象你有一位非常有才华的作家(大型语言模型),他接受过旨在变得有用、安全且礼貌的训练。你请他写一个故事。

问题在于,为了追求“完美”和安全,这位作家开始表现得像一个在考试中紧张的学生。他们不敢写太多,因为他们认为回答越短,回答就越好

为什么会这样?因为用来给他们的作品评分的工具(多样性指标)是破碎的。这些工具就像一个法官,仅仅因为一个句子只有3个单词,就认为它比一个30个单词的段落更具“创意”。作家注意到了这一点,于是开始给你提供简短、安全、重复性的答案,以获得高分。

作者称之为**“简洁偏差”(Brevity Bias)**。这就像一位厨师停止添加香料,因为品尝者只喜欢清淡的食物。结果是,AI变得缺乏创意、缺乏表现力,最终所有的AI输出都开始听起来一模一样(这种现象被称为“模型崩溃”)。

解决方案:“多样化,而非短小”(Diverse-NS)

作者创建了一种名为**“多样化,而非短小”(Diverse-NS)**的新策略。你可以把它看作是一个为这位作家设计的全新培训计划,旨在修复那个破碎的评分系统。

以下是它的工作步骤:

  1. “两稿游戏”:
    研究人员要求AI写两个版本的故事。

    • 草稿 A: AI自然地写作(它默认的、通常比较乏味的风格)。
    • 草稿 B: AI被要求按照特定规则重写这个故事:“让它更有趣、更多样化,但保持与草稿 A 完全相同的长度。”
  2. “公平法官”过滤器:
    通常情况下,如果你要求增加创意,文本会变得更长。但研究人员设定了一个严格的规则:如果草稿 B 比草稿 A 长,就把它扔掉。
    他们只保留那些“更有创意”的版本与“乏味”版本长度大致相等的配对。这教会了AI:“你可以在不增加字数的情况下展现创意。”

  3. “小老师”技巧:
    研究人员发现了一些令人惊讶的事实。一个更小、更便宜的AI模型(例如70亿参数的模型)可以充当一个“多样性老师”,去教导一个大得多、更昂贵的模型(例如130亿参数的模型)。

    • 类比: 想象一位虽然规模小、但很有干劲的当地艺术家,正在教导一家著名的、大制作的艺术工作室如何画出更独特的画作。这位小艺术家知道如何创造性地打破规则,而大工作室则向他学习。这节省了大量的资金和计算能力。

结果:更有风味,大小不变

研究人员在四种不同的创意任务上测试了该方法:

  • 发散性联想: 列出彼此之间差异极大的词汇。
  • 人格生成: 创建独特的角色档案(姓名、职业、城市)。
  • 替代用途: 思考使用常见物品(如一块砖头)的奇特方式。
  • 创意写作: 使用三个随机词汇编写短篇故事。

发生了什么?

  • 更多变化: 使用“多样化,而非短小”训练的模型产生了更加多样化且有趣的输出。它们使用了更多独特的词汇和想法。
  • 质量无损: 通常情况下,当你增加多样性时,质量会下降(比如变成一个混乱、无序的故事)。但在本研究中,质量保持在高水平。在某些情况下,质量甚至提升了。
  • 高效性: 他们只需要 3,000 个示例就能教会模型这项新技能。这就像是只教了学生几个小时,而不是教了几年。

新工具:“多样性十分位数”(Diversity Decile)

作者还意识到,旧有的衡量创意的工具对长篇回答不公平。因此,他们发明了一个新的尺子,叫做 “多样性十分位数”(Diversity Decile)

  • 类比: 想象一场比赛。旧的尺子只测量你跑得有多快,但忽略了有些跑步者背着沉重的背包(长文本),而有些则没有(短文本)。
  • 新的尺子: “多样性十分位数”观察的是你相对于其他背着同样大小背包的跑步者跑得有多快。它会问:“这个长的故事是否比其他同样长度的故事更有创意?”这确保了长篇、富有表现力的回答能够获得应有的认可。

总结

该论文指出,AI模型变得过于短小且重复,是因为我们衡量“创意”的方式在无意中奖励了简洁。

通过使用名为“多样化,而非短小”的策略,作者教会了模型在不增加回答长度的情况下展现创意。他们通过以下方式实现了这一点:

  1. 将乏味的草稿与长度相同的创意草稿进行对比。
  2. 利用一个更小、更便宜的AI来教导一个更大的AI如何具备多样性。
  3. 创造了一个更公平的衡量创意的尺子,使其不会惩罚长篇回答。

其结果是,AI变得更具表现力、更有创意且质量依然很高,同时训练成本更低、速度更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →