Are LLMs becoming similarly creative? Evidence from three years of models
本文分析了过去三年的大语言模型发布情况,并发现其在开放式创意任务上的输出多样性呈现出统计学意义上的显著下降,这表明存在一种趋向同质化的趋势,可能会削弱人类在人机协同创作工作中的主体性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:“大语言模型是否变得同样具有创造力?来自三年模型的证据”
问题陈述
虽然许多基准测试都在追踪大语言模型(LLM)在具有可验证答案的任务上的表现,但对于在创造力、原创性和多样性至关重要的开放式任务,目前缺乏纵向数据。现有研究表明,尽管 LLM 在个体层面可能表现出创造力,但它们往往表现出集体同质化,即不同模型之间的输出在不同时间点都呈现出相似性。然而,这种同质化是技术发展过程中的暂时现象,还是统计语言模型的一个必然特征,目前尚不明确。目前的基准测试(如 MMLU、HELM)侧重于具有明确标准的、可验证答案的任务,无法捕捉到创意输出的多样性或原创性随时间变化的趋势。
方法论
作者通过一个四步流程对 LLM 输出的多样性进行了初步的时间性分析:
- 提示词选择: 选择了两组互补的开放式提示词以激发创造性行为:
- 替代用途任务 (AUT): 一种标准化的心理测量评估,用于衡量发散性思维,要求模型生成常见物品的非常规用途。
- Infinity-Chat100: 一个包含 100 个真实世界开放式用户查询的集合,涵盖六个类别,包括创意内容生成、头脑风暴和构思。
- 数据收集: 将提示词应用于 2023 年 3 月至 2026 年 7 月期间发布的 68 个模型,这些模型代表了 12 家主要的模型提供商(33 个闭源权重模型和 34 个开源权重模型)。所有生成过程均使用 temperature 和 top-p 为 1.0 的设置,以保留随机采样特性。
- 语义嵌入: 使用
all-MiniLM-L6-v2句子转换器模型对响应进行嵌入。对于 AUT,将单个物体的所有用途嵌入为一个向量;对于 Infinity-Chat,则对每个响应分别进行嵌入。 - 回归分析: 研究计算了跨家族模型对之间嵌入的余弦距离,以衡量语义差异。这些模型对根据发布日期被分为九个时间分箱(temporal bins)。研究对平均余弦距离与分箱索引进行了普通最小二乘法(OLS)回归。为了减轻由于模型家族代表性不均带来的偏差,作者进行了 1,000 次家族平衡重采样,以生成斜率估计值的分布。
核心贡献
- 纵向框架: 本文提供了第一个用于追踪 LLM 创意输出随时间演变的框架,超越了对模型行为的静态快照观察。
- 双任务分析: 通过结合受控的心理测量任务(AUT)与现实世界的用户查询(Infinity-Chat100),本研究评估了结构化和非结构化语境下的创造力。
- 收敛性的定量证据: 研究提供了经验证据,表明 LLM 的输出正变得越来越相似,这挑战了“新模型本质上能提供更大创造多样性”的假设。
结果
分析显示,在三年的观察期内,模型输出的多样性呈现出统计学意义上的下降:
- 趋势: AUT 和 Infinity-Chat 数据集均显示,跨家族的余弦距离随时间推移呈现持续的负斜率,表明语义相似性(同质化)在增加。
- 幅度: 在替代用途任务(AUT)中,这种下降最为显著,平均跨家族距离从最早发布分箱中的约 0.50 下降到最近分箱中的 0.40 以下。Infinity-Chat 数据集的下降较为平缓但保持一致,从约 0.34 下降至约 0.32。
- 稳健性: 1,000 次重采样迭代均产生了两个数据集的负斜率,证实了该趋势在不同模型家族组合下都是稳健的。
意义与主张
论文指出,LLM 在需要开放式响应的任务中正变得缺乏创造力,这表明不同模型之间的创意实质正在趋同。作者认为,如果这一趋势持续下去,“LLM 驱动的同质化可能会逐步削弱人类在人机协同创作工作中的主体性”。
研究将这些发现定位为一项初步分析,要求人们仔细考虑 LLM 在人类创作过程中的角色。它强调了一个潜在的“AI 创造力悖论”:虽然单个模型可能看起来具有创造力,但它们的聚合输出却变得越来越缺乏多样性,这可能会限制用户接触到的想法范围,并对下游的人类创造力产生负面影响。作者明确表示,其工作是初步性的,并呼吁未来的研究去探讨背后的机制(例如共享训练数据或蒸馏)以及驱动这种收敛的具体因素。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。