Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?
本文介绍了 Poller,一种采用诗人视角的新型基于大语言模型(LLM)的评估方法,该方法能够显著减少在专业维度上评估中文诗歌理解时的误差,有效地弥合了自动化效率与人类专业知识之间的差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一盒精美、复杂且现代的中国诗歌。你想知道一台计算机(具体来说是大型语言模型,即 LLM)是否能理解得足够好,以至于能够给别人的诗歌解读进行评分。
问题所在:“礼貌的机器人” vs. “真正的诗人”
研究人员发现,标准的 AI 模型并不擅长这项工作。这就像是请一位博学但礼貌的机器人去评审一幅画作。机器人能看到色彩和形状,却错过了作品的“灵魂”。
在论文的实验中,当 AI 尝试评价人类对诗歌的理解程度时,它表现得过于慷慨。即使人类的解释很肤浅或没抓到重点,AI 也会给出 90 或 95 分(满分 100 分)的高分。AI 本质上是在说:“噢,你用了高级词汇?太棒了!给你个 A+!”它缺乏深层的、文化性的以及情感上的语境。
解决方案:“Poller”(角色扮演的小技巧)
为了解决这个问题,研究人员发明了一种名为 Poller(诗歌 LLM 评估器)的方法。
你可以这样理解:他们不再要求 AI 扮演一个通用的“老师”,而是要求 AI 假装成这首诗的实际作者。
以下是他们的做法:
- 更换“戏服”:他们向 AI 输入一份关于这位真实诗人的“角色卡”。这包括诗人的传记、个人的奋斗经历、其对艺术的特定看法,甚至包括著名评论家对其作品的评价。
- 视角转换:AI 被告知:“你现在是这位诗人。你写了这首诗。现在,看看这个学生对你作品的解读。它是否捕捉到了你想要表达的内容?”
- 做出裁决:通过穿上诗人的鞋子,AI 不再是一个礼貌的机器人,而是开始像创作者一样思考。它开始注意到那些通用的 AI 会忽略的微妙隐喻、特定的节奏和隐藏的情感。
结果:从“太客气”到“精准到位”
结果是戏剧性的。
- 使用 Poller 之前:AI 就像一个不想伤害你感情的朋友,几乎给所有解释都打高分。AI 的评分与人类专家评分之间的差距巨大。
- 使用 Poller 之后:AI 变成了一个严厉且富有洞察力的评论家。当它扮演诗人的角色时,它的评分变得与人类专家的评分非常接近。
例如,在评判一个人对修辞技巧(诗人使用的华丽技巧)或陌生化(通过让熟悉的事物看起来陌生来引发思考)的理解程度时,AI 的误差降低了近 95%。它从极度不准确变得几乎与人类专家水平相当。
核心启示
论文得出结论:AI 可以 成为优秀的诗歌评判者,但前提是你得“骗”它戴上诗人的帽子。通过迫使 AI 采用作者特定的视角、背景和灵魂,我们弥合了“快速计算机处理”与“深厚人类专业知识”之间的鸿沟。
论文并未提及的内容
- 它并未声称这种方法适用于所有类型的写作(如新闻文章或法律合同);它专门针对现代中国诗歌进行了测试。
- 它并未表示这将完全取代人类诗人或评论家;它只是提供了一种更好的方法来自动评分诗歌理解类任务。
- 它并未声称 AI 真的产生了“情感”;它只是如此出色地模拟了诗人的视角,从而使评分变得准确。
简而言之:要让计算机理解诗歌,你必须让它假装成为那位诗人。一旦它做到了这一点,它才终于听懂了其中的妙处。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。