Can ChatGPT Really Understand Modern Chinese Poetry?
该论文提出了一种由专业诗人参与的多维度评估框架,发现 ChatGPT 在理解现代中国诗歌时虽有 73% 的意图契合率,但在捕捉“诗意”等维度上仍显不足,从而验证了该框架的有效性并为未来研究奠定了基础。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一场**“请诗人当考官,给 AI 上语文课”**的有趣实验。
想象一下,ChatGPT(也就是那个很火的 AI 聊天机器人)是个才华横溢的**“超级翻译官”和“模仿大师”**。它能写诗,也能把诗翻译成别的语言,甚至写得有模有样。但是,大家心里一直有个大问号:它真的“懂”诗吗?还是说它只是在玩“文字接龙”的游戏,碰巧说对了?
为了搞清楚这个问题,澳门大学的几位研究员(包括一位教葡萄牙语的老师,看来是跨学科合作)决定搞个大动作。他们找来了6 位真正的现代诗人,让 AI 去解读这 6 位诗人亲手写的 48 首现代诗,然后请诗人本人来给 AI 的解读打分。
1. 考试怎么考?(五大维度)
诗人给 AI 出了一套非常专业的“阅读理解题”,不是简单的“这首诗讲了什么”,而是从五个刁钻的角度来考:
- 内容(Content): 就像问“这故事讲了啥?”(AI 答得不错,大概能猜对 80%)。
- 表达方式(Expression Methods): 就像问“作者用了什么修辞手法?节奏感怎么样?有没有什么新奇的比喻?”(AI 能认出明显的比喻,比如“像……",但遇到隐晦的就不行了)。
- 思想与情感(Thought & Emotion): 就像问“作者心里在想什么?是悲伤还是愤怒?”(AI 能感受到大概的情绪,但很难捕捉到那种微妙的、复杂的内心戏)。
- 现代性(Modernity): 就像问“这首诗有没有‘现代味儿’?是不是反映了现代人的孤独或困惑?”(AI 居然挺擅长这个,能看出诗里的现代气息)。
- 诗意(Poeticity): 这是最难的! 就像问“整首诗里,哪一句最‘有诗意’、最打动人心?”(AI 在这里彻底翻车了)。
2. 考试结果如何?
- 总体成绩:73% 的及格率。
在大多数情况下,AI 的解读和诗人原本想表达的意思是一致的。这说明 AI 确实不是瞎编,它真的“读懂”了大部分内容。 - 强项: 只要诗里有明显的画面感(意象),或者主题很清晰,AI 就能分析得头头是道。
- 弱项(翻车现场):
- 抓不住“灵魂”: 当被问到“哪一句最有诗意”时,AI 经常选错。它选出来的句子,在诗人眼里可能只是普通的陈述,毫无美感。
- 不懂“弦外之音”: 诗歌里有很多“言有尽而意无穷”的地方,AI 太直白,喜欢把话说明白,反而破坏了诗的朦胧美。
- 文化隔阂: 有一类诗是“古风新写”(用现代形式写古代题材),AI 在处理这类诗里的古语和文化梗时,经常理解偏差,就像让一个只读过现代小说的人去读《红楼梦》的诗词,容易望文生义。
3. 一个有趣的发现:AI 也怕“自己人”
研究人员还让其他大模型(比如 GPT-4o, Qwen 等)来当“阅卷老师”,给 AI 的解读打分。结果发现,这些 AI 互相打分,和真人诗人的打分差距很大。
这说明:在诗歌这种充满情感、文化和微妙语境的领域,目前的 AI 还无法替代人类专家来评价诗歌。就像让一个只会背字典的人去评价一首诗的“意境”,他永远无法真正理解那种“只可意会不可言传”的感觉。
4. 总结:AI 是个好助手,但不是好诗人
这篇论文告诉我们:
- AI 很聪明: 它能处理 70% 以上的诗歌解读任务,可以作为人类读者的辅助工具,帮我们梳理思路。
- AI 还没“开悟”: 它缺乏人类那种基于生命体验、文化积淀的“直觉”。它能看到“鱼”和“礁石”,但很难真正感受到“鱼在礁石上搁浅”那种绝望又荒诞的诗意。
- 未来的路: 我们设计了一个新的框架(就像给 AI 制定了一套新的考试大纲),以后研究 AI 怎么读诗,就得按这个标准来,不能再只看它写得好不好,要看它“懂”没懂。
一句话总结:
ChatGPT 现在就像一个博学的图书管理员,能告诉你书里写了什么、用了什么技巧,但它还成不了那个在深夜里对着月亮流泪、真正懂得诗歌灵魂的“诗人”。要真正读懂诗,人类那双充满情感的眼睛,暂时还无法被替代。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。