Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion
本文介绍了一种属性引导的体裁扩展框架,该框架通过将人类提示与精选的体裁属性相结合,将创意写作数据从故事扩展到了更多领域,从而生成了一个包含 5 万个样本的多体裁集合,这显著增强了大语言模型掌握多样化创意格式和结构规范的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何成为一名作家。长期以来,教机器人的最佳方法是给它喂食数百万个故事——冒险、悬疑和童话。这在教机器人如何讲述一个具有开头、中间和结尾的故事方面效果极佳。但在现实世界中,写作不仅仅是关于故事。有时你需要写一首具有特定押韵方案的饶舌歌曲,或者编写一个具有严格规则的游戏剧本,亦或是撰写一篇具有非常特定格式的新闻文章。如果你只给机器人喂食故事,它可能会成为一个伟大的讲故事者,但却是一个糟糕的饶舌歌手或游戏设计师,因为它不知道这些其他格式的“行路规则”。这篇论文正是针对这一问题:如何教 AI 在多种不同的风格中进行创作,而不仅仅是一种。
这项研究背后的研究人员,Hwan Chang 及其团队意识到,仅仅给 AI 更多的故事并不能解决问题。这就像试图通过观看一千部足球电影来学习如何打篮球一样;你会理解比赛的概念,但你不会知道如何运球或投篮。他们需要一种方法来教 AI 不同创意格式的特定“结构 DNA”。为此,他们构建了一个名为**属性引导的类型扩展(Attribute-Guided Genre Expansion)**的新系统。把它想象成一个创意工厂。他们不再只是递给 AI 一个空白页并说“写点什么”,而是给它两样东西:一个“种子”(一个酷炫的想法或主题,比如“赛博朋克城市”)和一个“规则手册”(一组特定的约束,比如“使用 AABB 押韵”或“包含时间戳”)。通过将这些种子和规则手册进行混合与匹配,他们创建了一个包含 13 种不同创意类型、拥有 5 万个样本的海量库,涵盖了从电影剧本到技术手册的各种内容。
该论文指出,这种方法效果显著。当他们在这种新的多样化库上训练 AI 模型时,模型不仅变得更擅长讲故事,而且在遵循其他格式的严格规则方面也变得出色得多。事实上,这些模型的表现优于那些使用现有的、专门化写作数据集进行训练的 AI 模型。研究人员发现了一个清晰的模式:AI 学习的写作类型越多,它的输出就变得越有创意且越独特。这就像是 AI 明白了“故事”和“饶舌歌曲”是不同的语言,通过同时学习两者,它成为了一个更流利的演说家。
然而,论文也指出了哪些做法是无效的。他们认为,单纯扩大故事数据的规模并不是答案。如果你只是向 AI 喂食更多的故事,它可能会变得更擅长描写一条龙,但它仍然无法正确格式化一份游戏设计文档,因为它没有学习到该类型的特定结构约束。该研究明确排除了“多多益善(更多同类事物)”是解决方案的观点。相反,他们认为解锁 AI 真正创意写作能力的关键在于多样性和结构。
该团队通过提取人类编写的故事提示词(例如来自一个流行的在线写作社区的提示词),并使用一种智能过程将其转化为不同的类型来构建其数据集。他们使用了“主题种子”(核心想法)并注入“类型属性”(特定规则)来生成新的示例。例如,他们将一个关于“都市孤独”的提示词转化成了具有特定节奏感的饶舌诗句、一个带有对话规则的电影剧本,以及一个带有特定语调的播客剧本。然后,他们使用强大的 AI 模型来编写响应,并仔细过滤掉质量较差的部分,以确保高质量。
结果通过了几项测试进行衡量。在这一新“多类型集合”上训练的 AI 模型,其得分始终高于仅在故事或其他现有写作数据集上训练的模型。它们在通用的写作挑战中表现更好,也更具创意。研究人员还测试了 AI 写作的“新颖性”。他们发现,随着 AI 训练的类型数量增加(从仅有的故事增加到全部 13 种类型),AI 产生新鲜、非重复想法的能力稳步提升。这表明,接触多样化的格式直接提升了模型的创意灵活性。
简而言之,这篇论文提议,要让 AI 成为真正的创意伙伴,我们需要停止将其视为一台故事书机器,而要开始将其视为一名多才多艺的艺术家。通过教它 13 个不同创意世界的特定规则,我们得到的不仅仅是更好的故事,还有更好的饶舌、更好的剧本和更好的游戏设计。作者总结道,这种将主题想法与严格的类型规则相结合的方法,是扩展创意写作能力的一种强大方式,为实现像人类作家一样多才多艺的 AI 提供了前进的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。