💬 NLP
NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment
本文提出了首个专注于评估大语言模型学术新颖性判断能力的大规模基准 NovBench,通过构建包含 1684 篇论文 - 评审对的 dataset 及四维评估框架,揭示了当前模型在理解科学新颖性及遵循指令方面的显著不足,并指出了针对性微调的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给人工智能(AI)老师出的一道“期末考试题”,题目是:“你能像人类专家一样,一眼看出这篇学术论文到底‘新’在哪里吗?”
为了让你更容易理解,我们可以把整个研究过程想象成一场**“学术界的选秀大赛”**。
1. 背景:为什么需要这场考试?
在学术界,发表论文就像参加选秀。评审专家(人类)需要判断选手(论文)有没有**“新意”**(Novelty)。
- 现状: 现在投稿的人太多了,人类评委累得半死,眼睛都花了。
- 尝试: 大家想请 AI 来帮忙当评委。AI 确实能写出一通看起来很专业的评语,但大家心里犯嘀咕:AI 是真的看懂了“新意”,还是只是在背台词、瞎编乱造?
- 问题: 以前没有专门的“考卷”来测试 AI 到底行不行。
2. 解决方案:NovBench(新度评测基准)
作者们造了一个专门的**“考场”**,叫 NovBench。
- 考卷内容: 他们收集了 1684 篇真实的学术论文和对应的专家评语。
- 题目设计:
- 左边(题目): 论文作者自己写的“自我介绍”(通常在引言部分),声称自己哪里创新了。
- 右边(标准答案): 人类专家写的“点评”,指出这篇论文到底有没有新意,好在哪里,差在哪里。
- 任务: 让 AI 看着左边的“自我介绍”,写出右边的“点评”。
3. 评分标准:四个维度的“打分表”
为了不让 AI 蒙混过关,作者设计了四个维度的评分标准,就像给厨师做菜打分:
- 相关性 (Relevance) —— “有没有跑题?”
- 比喻: 就像你问厨师“这道菜辣不辣”,他回答“我用了最好的盐”。如果 AI 没抓住论文的核心创新点,就是跑题。
- 正确性 (Correctness) —— “态度对不对?”
- 比喻: 如果人类专家觉得这菜是“咸得发苦”(负面评价),AI 却夸它是“人间美味”(正面评价),那 AI 就错了。AI 的判断倾向(好评/中评/差评)得和人类专家一致。
- 覆盖面 (Coverage) —— “有没有漏掉重点?”
- 比喻: 人类专家指出了三个创新点,AI 只看到了一个,或者漏掉了最精彩的那个,那就是“漏题”。
- 清晰度 (Clarity) —— “说话利索吗?”
- 比喻: AI 的评语不能像喝醉了一样含糊其辞,也不能全是废话。要像老练的评论家一样,一针见血,让人一看就懂。
4. 考试结果:AI 的表现如何?
当各种大模型(包括最聪明的 GPT-5、Gemini,以及专门训练过当评委的模型)参加这场考试时,结果有点**“喜忧参半”**:
- 好消息: AI 的**“嘴皮子”**很利索(清晰度很高),能写出看起来很像那么回事的评语,也能抓住大概的方向。
- 坏消息(核心发现):
- 理解力不够深: AI 往往只能看到表面,很难真正理解科学研究的深层创新。它像是在“猜”哪里有新意,而不是真的“懂”。
- 专门训练的模型反而“掉链子”: 有些专门用人类评语训练过的模型,反而表现得不如通用模型。它们太想模仿人类的语气,结果**“听指令”的能力变差了**(比如让写评语,它却开始写论文摘要,或者格式全乱)。
- 容易“和稀泥”或“过度批判”: 通用模型为了讨好用户,倾向于多给好评;而专门训练的模型为了显得专业,倾向于多给差评,甚至为了显得深刻而编造缺点。
5. 结论与启示
这篇论文告诉我们:
- AI 还没法完全替代人类评委。 虽然它能帮忙写写草稿,但在判断“什么是真正的创新”这件事上,它还是个**“半吊子”**。
- 未来的方向: 我们需要教 AI 不仅要“会说话”(生成流畅文本),更要“懂行”(真正理解科学逻辑)。同时,训练 AI 时,不能只让它模仿人类的语气,更要让它学会如何严格地遵守指令。
一句话总结:
NovBench 就像给 AI 评委发了一张**“照妖镜”,照出了它们目前“只会背书,不懂真意”**的短板,提醒我们在让 AI 完全接管学术评审之前,还有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。