💬 NLP
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
该论文提出了基于树状工作流的评估方法 Tree-of-Writing (ToW) 及包含 12 种体裁的大规模中文写作基准 HoWToBench,旨在解决现有指标在评估大语言模型长篇开放写作能力时的不一致性与偏差问题,并验证了 ToW 在鲁棒性、与人类判断的高相关性以及对输入长度干扰的抗噪能力方面的显著优势。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给大语言模型(LLM)举办一场"人类写作能力大考",并且发明了一套全新的"树状评分法"来当考官,还准备了一份极其专业的"题库"。
我们可以把整件事想象成这样一个场景:
1. 为什么要搞这个?(背景与痛点)
以前,我们评价 AI 写的文章好不好,就像是用尺子去量云彩。
- 旧方法太死板:以前的评分标准(比如 BLEU、ROUGE)就像是在玩“找茬游戏”,只看 AI 写的字和参考答案有多少重合。但这就像评价一首诗,只看它有没有用“爱”和“梦”这两个词,完全忽略了意境和情感。
- AI 当裁判不靠谱:后来大家让 AI 自己当裁判(LLM-as-a-judge),但这就像让一个没有主见的和事佬来打分。它经常把“语言流畅度”、“逻辑性”、“情感表达”这些不同的维度混在一起,最后给个平均分。结果就是,它今天觉得“逻辑”最重要,明天觉得“文采”最重要,打分忽高忽低,非常不稳定(论文里叫“协商不一致”)。
2. 核心发明:Tree-of-Writing (ToW) —— “树状评分法”
为了解决 AI 裁判“和稀泥”的问题,作者发明了一个叫 **Tree-of-Writing **(ToW) 的框架。
想象一下,ToW 就像是一个经验丰富的“老编辑”在审稿:
- 不是乱打分:老编辑不会把所有优点缺点混在一起算个平均数。他会把文章拆解成一棵树。
- 树根是总分:最上面是最终得分。
- 树干是三大支柱:
- **内容 **(Content):文章说了什么?逻辑通不通?开头结尾好不好?
- **格式 **(Format):分段对不对?标题有没有?有没有乱用列表?
- **印象 **(Impression):读起来感觉怎么样?有没有感染力?
- 树叶是细节:在“内容”这棵枝干下,又分出“逻辑”、“情感”、“修辞”等小叶子。
- 动态权重(关键创新):这是 ToW 最聪明的地方。它知道不同文章类型,重点不一样。
- 如果是写诗,它会给“情感”和“修辞”很高的权重,给“逻辑”低权重。
- 如果是写合同,它会给“逻辑”和“格式”极高的权重,给“情感”几乎零权重。
- 比喻:以前的裁判是拿着一个固定的食谱做菜,不管做川菜还是粤菜都放一样的盐。ToW 则是根据你点的菜,动态调整盐量,这样打出来的分才公平、精准。
3. 新题库:HOWTOBENCH —— “写作奥林匹克”
为了测试 AI 到底行不行,作者们建了一个叫 HOWTOBENCH 的超级题库。
- 规模巨大:里面有 1300 多道题,涵盖了 12 种文体(从写小说、写诗,到写公文、写合同、写演讲稿)。
- 难度分级:
- **Level 1 **(补全):给你一段话,让你把中间缺的补上。(像做填空题)
- **Level 2 **(大纲写作):给你一个大纲,让你扩写成文。(像根据提纲写报告)
- **Level 3 **(自由创作):只给一个题目,让你自由发挥。(像真正的创作,最难)
- 真材实料:这些题目和参考答案(Human Reference)都是由人类专家写的,不是 AI 生成的。这就像是用米其林三星大厨的手艺作为标准,来考核 AI 厨师。
4. 考试结果:发现了什么?(主要发现)
用这套新系统去考 10 个顶尖的大模型(比如 GPT-4, Claude, DeepSeek 等),发现了一些有趣的现象:
- AI 很擅长“填空”,但不擅长“创作”:
- 在有详细背景信息(Level 1)的情况下,AI 表现很好。
- 一旦让它自由发挥(Level 3),很多模型就“掉链子”了,文采和逻辑都大幅下降。
- 字数多不代表写得好:
- 以前大家觉得 AI 写得越长越好。但研究发现,输入给 AI 的信息越多,它写出来的东西反而可能越差(负相关)。
- 比喻:这就像给一个厨师堆了太多食材,他反而不知道做什么菜了,最后端上来一盘大杂烩。这说明 AI 不能靠“堆料”来凑字数,它需要真正的理解力。
- ToW 很抗揍:
- 如果把文章里故意加一些乱码、重复句子或者改变格式,传统的评分方法(包括其他 AI 裁判)很容易被骗,给高分。
- 但 ToW 像是一个火眼金睛的考官,能一眼看出这些“花招”,稳稳地给低分。它非常稳健。
5. 总结
这篇论文的核心思想就是:评价 AI 写作,不能只看它“像不像”人类,而要看它“懂不懂”人类。
- 旧方法:像用复印机比对,看字迹重不重合。
- 新方法 (ToW + HOWTOBENCH):像请了一位懂行、有经验、会根据不同文体灵活调整标准的资深编辑来打分。
这套系统让 AI 的写作能力评估变得更透明、更稳定、更像人类专家,为未来 AI 真正写出打动人心的好文章指明了方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。