GENIE: A Fine-Grained Measure for Novelty
本文介绍了 GENIE,这是一种旨在衡量大型语言模型响应在特定任务特征维度上的新颖性的细粒度评估指标,解决了整体性指标的局限性,并为创造力缓解方法的有效性提供了见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位才艺表演赛的评委,100 名参赛者被要求讲述一个关于恐龙和电脑的故事。
大多数故事听起来都一模一样:一只霸王龙在丛林里发现了一台笔记本电脑,它被吓到了,然后逃跑了。但随后,一位参赛者讲述了一个关于霸王龙的故事,这只霸王龙实际上是一个困在史前躯壳里的无聊办公室职员,正试图在一条船上修理一台坏掉的面包机。
旧评委的问题
过去,如果你想知道一个故事多么“有创意”或多么“新颖”,你会使用一个“整体性(holistic)”评委。这个评委会观察整个故事并给出一个单一的分数,比如“7 分(满分 10 分)”。
- 缺陷: 这就像老师给你的一份数学考试只给了一个总分,却没告诉你哪些题目做对了,哪些做错了。如果这个恐龙故事得了“7 分”,你无法知道它是因“设定”(船上)而具有创意,还是因为“角色”(办公室职员)或“情节”。
- 混乱: 有时,一个故事看起来很新颖,可能仅仅是因为作者使用了华丽的辞藻(改写/释义),但实际的思想却是乏味的。旧的评委经常会被这些华丽的词汇所迷惑。
新的解决方案:GENIE
论文的作者构建了一个名为 GENIE(具有可解释性的细粒度创意想法评估)的新工具。你可以把 GENIE 想象成不仅仅是一个单一的评委,而是一个由专业检查员组成的团队。
GENIE 不仅仅给出一个分数,它会将故事分解为特定的“特征”或类别,例如:
- 设定: 故事发生在什么地方?
- 情节: 到底发生了什么?
- 角色: 谁是主角(或恐龙)?
- 风格: 它是如何书写的?
GENIE 如何运作(“问与答”游戏)
GENIE 不仅仅是靠猜测;它通过玩一场“二十个问题”的游戏来理解故事:
- 总体情况(Population): 首先,GENIE 会观察一大堆其他的故事(即“总体情况”),看看“标准”的恐龙故事是什么样子的。
- 问题: 对于一个新的故事,GENIE 会基于各项特征提出具体的问题。
- 问题: “设定是什么?”
- 答案: “一艘船。”
- 比较: GENIE 会将答案与那堆其他故事进行对比。
- 如果另外 99 个故事都说设定是“丛林”,而这一个说是“船”,那么 GENIE 会给出一个很高的设定新颖度分数。
- 如果另外 99 个故事都说“恐龙发现了电脑”,而这一个也说了同样的内容,那么 GENIE 会给出一个很低的情节新颖度分数。
为什么这更好
论文声称 GENIE 在识别真相方面比旧的“整体性”评委要好得多。
- 它是诚实的: 它能准确地告诉你创意究竟在哪里。“这个故事在设定上非常新颖,但在情节上非常乏味。”
- 它不会被华丽的词汇所迷惑: 如果一个作者只是用不同的同义词重写了一个乏味的故事(改写),旧的评委可能会认为它是新颖的。但 GENIE 发现问题的答案仍然是一样的,所以它知道这个故事其实并不新颖。
- 它区分了“新颖”与“优秀”: 有时一个故事虽然古怪且新颖,但读起来很糟糕。旧的评委经常将“创意”与“质量”混为一谈。GENIE 则将它们分开,只测量想法有多么“不同”,而不测量其书写水平如何。
测试工具
作者通过以下方式测试了 GENIE:
- 手术式修改: 他们拿走一个乏味的故事,并进行了“手术式”的改变,仅修改其中一个要素(比如将设定从丛林改为船上)。GENIE 正确地识别出只有设定发生了变化,并给予了该特定部分很高的分数。
- 改写(Paraphrasing): 他们拿走一个故事,用不同的词汇重写了它,但意思保持不变。GENIE 正确地指出“这并不是真的新颖”,而旧的评委则会感到困惑,误以为它变得不同了。
核心结论
GENIE 是一种衡量创意的新方法,它不再仅仅给出一个模糊的分数。它就像一个显微镜,向我们展示了故事中哪些部分是新鲜的,哪些部分仅仅是在模仿其他人。这有助于研究人员了解不仅是 AI 是否具有创意,而且是 AI 在哪里具有创意,以及在哪些方面需要改进。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。