← 最新论文
💬 NLP

Playing with Words, Improving with Rewards: Training Language Models for Creative Association

本文提出利用可验证奖励的强化学习在词义联想游戏《代号》上训练大语言模型以提升创造力,结果表明:虽然更大规模的模型(8B)在最小化推理损失的同时实现了稳定的创造力提升,但较小规模的模型(1.7B 和 4B)则优先保障推理精度而牺牲了创造力。

原作者: Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一群 AI 学生,每个都拥有不同大小的“大脑”:一个小脑(17 亿参数)、一个中脑(40 亿参数)和一个大脑(80 亿参数)。研究人员想要教导这些 AI 学生如何变得富有创造力

问题在于,创造力就像艺术一样,难以评分。如果你问一个人:“这首诗有创意吗?”这个人可能会说是,而另一个人可能会说不是。这使得训练 AI 变得困难,因为 AI 需要清晰的反馈才能学习。

解决方案:文字游戏“代号”

为了解决这个问题,研究人员将创造力转化为一款名为**“代号”(Codenames)**的游戏。

想象一块板上覆盖着随机单词,如“苹果”、“河流”、“椅子”和“云”。

  • 目标:一名玩家(“间谍大师”)看到一份秘密的目标单词列表(例如“苹果”和“河流”)。他们必须给出一个线索词(例如“水果”),该词能与其目标相关联,但不会意外地关联到板上的其他单词(例如“椅子”)。
  • 挑战:这需要两种思维方式:
    1. 发散思维:看着“苹果”和“河流”,思考:“它们有什么共同点?哦,也许是‘自然’或‘生长’?”(拓展思维)。
    2. 收敛思维:挑选唯一一个最完美的词,既能完美契合,又不会让团队出错。(聚焦重点)。

由于该游戏具有明确的输赢条件(你是否猜对了正确的单词?),AI 可以通过玩数百万轮游戏并获得简单的“做得好”或“再试一次”的评分来学习。无需人类裁判。

实验:通过奖励进行教学

研究人员使用了一种名为**“可验证奖励强化学习”(RLVR)**的方法。

  • 想象 AI 是一只狗。每当它在游戏中做出好举动,它就会得到一份奖励(奖励)。每当它做出坏举动,它就得不到奖励。
  • 他们训练了这三个 AI 模型(小、中、大)反复玩这个游戏,直到它们变得非常擅长。

惊人的发现:规模很重要

这里有一个转折。研究人员原本预期所有 AI 都会在各方面变得更好。相反,他们发现AI“大脑”的大小改变了它所学习的内容

1. 小型和中型 AI(17 亿和 40 亿参数):“精准专家”

  • 发生了什么:这些较小的模型在逻辑和数学问题(如解谜或算术)方面显著进步。
  • 权衡:它们实际上在创造力方面变得更差了。它们变得非常严格和精确,就像一个机器人会计师。它们不再冒险,而是开始寻找“安全”的答案。
  • 类比:这就像教一个小孩玩复杂的棋盘游戏。他们完美地学会了规则并停止犯错,但他们停止了发挥想象力。

2. 大型 AI(80 亿参数):“创意探索者”

  • 发生了什么:最大的模型在创造性任务(写故事、想有趣的标题、制作比喻)方面显著进步。
  • 权衡:它在严格的逻辑和数学方面略有退步。它开始承担更多风险,建立更多独特的联系,这有时会导致计算上的小错误。
  • 类比:这就像教一位才华横溢的艺术家玩同样的棋盘游戏。他们学会了规则,但开始看到隐藏的模式,并建立小型玩家会忽略的狂野、富有创意的联系。

大局观

该论文得出结论,你不能以同样的方式在所有 AI 模型中简单地“开启”创造力。

  • 如果你想要一个精准、逻辑性强的思考者,在这种文字游戏上训练有助于较小的模型变得更加敏锐。
  • 如果你想要一个富有创造力、充满想象力的思考者,在这种游戏上训练有助于较大的模型变得更加多样化和富有发明精神。

研究人员表明,通过使用一种简单、客观的游戏,他们可以根据模型的大小来“调整”AI 模型,使其要么在逻辑方面更出色,要么在创造力方面更出色。这是一种在不需人类不断评估其工作的情况下塑造 AI 行为的实用方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →