← 最新论文
💬 NLP

NLG Evaluation: Past, Present, Future

本文追溯了自然语言生成(NLG)评估从 1990 年以语言学为焦点的起源到当前由机器学习驱动的实验范式的演变历程,同时预测随着 NLG 技术的普及,未来的评估将日益重视影响力、定性指标和安全指标。

原作者: Ehud Reiter

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ehud Reiter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将自然语言生成(NLG)想象成一位厨师,他使用计算机而非炉灶来撰写食谱并烹饪菜肴。在过去的 30 年里,我们评判这位厨师作品的方式已彻底改变,而它即将再次发生转变。本文由 Ehud Reiter 撰写,梳理了我们如何学会对这些“数字菜肴”进行品尝测试的时间线。

以下是关于 NLG 评估的故事,分为三幕:过去、现在和未来。

第一幕:过去(1990 – 2010)

“厨师笔记”时代

  • 1990 年:艺术评论家 approach
    回到 1990 年,当作者获得博士学位时,没有人真正用数据来“测试”烹饪成果。如果一位厨师声称他的新食谱更好,他并不会端给 100 个人品尝以观察他们的喜好。相反,他们会写一篇长文,解释为什么这个食谱是好的,运用华丽的语言学或工程学论据。这就像一位美食评论家说:“这道酱汁很美,因为食材的语法流畅”,却从未真正询问任何人它是否尝起来美味。
  • 2000 年:品尝测试大爆发
    到了 2000 年,人们意识到需要真正品尝食物。研究人员开始尝试各种方法来评判这些菜肴:让人类对它们进行评分、检查食物是否解决了特定问题,或使用早期的计算机评分。这有点混乱——每个人都在尝试不同的方法,当时还没有单一的“黄金标准”。
  • 2010 年:标准化菜单
    到了 2010 年,厨房变得井然有序。学术界开始采用“共享任务”,这就像烹饪比赛,每个人都必须制作同一道菜。他们商定使用特定的尺子来衡量食物:
    • 尺子(指标): 他们使用 BLEU 和 ROUGE 等计算机评分。可以将这些想象为将新菜肴与一道“完美的参考菜肴”进行比较,并计算有多少单词匹配。
    • 评审团(人工评分): 他们也会让人类对菜肴进行排名。这成为了判断食物是否真正美味的标准方法,因为计算机尺子有时会出错。

第二幕:现在(2026)

“超级厨师”时代

快进到 2026 年。这位厨师(现在由称为大语言模型(LLM)的庞大 AI 模型驱动)变得极其出色。食物如此完美,以至于旧的评判方式正在失效。

  • 旧尺子的问题:
    过去,我们将 AI 的食物与人类编写的“参考菜肴”进行比较。但现在,AI 的食物往往优于人类参考。你不能通过将杰作与草图进行比较来评判它;相比之下,草图只会显得糟糕。
  • 新法官(LLM 作为法官):
    由于食物如此复杂,我们开始使用一个 AI 来评判另一个 AI。这就像雇佣一位也是机器人的超级品酒师来评论这顿饭。这在某些情况下效果很好,但如果机器人品酒师存在偏见或困惑,则存在风险。
  • 专家小组:
    普通人(众包工人)已不足以发现这些高质量菜肴中的细微错误。有时他们甚至利用 AI 来进行评判!因此,我们现在需要专家(如医生或律师)仔细检查食物是否存在特定问题,例如“厨师是否幻觉出了虚假的食材?”或“这条建议是否安全?”
  • 安全检查:
    因为这些 AI 厨师现在在医院和律师事务所工作,我们不能只关心这顿饭有多“平均”。我们需要检查最坏情况。如果医疗 AI 在 99.9% 的情况下给出完美建议,但在 0.1% 的情况下给出致命建议,那就是一场灾难。我们需要揪出那些罕见而危险的错误。

第三幕:未来(2036)

“现实世界影响”时代

展望 2036 年,作者认为我们需要停止仅仅衡量厨师在测试厨房中烹饪得有多好,转而衡量食物如何影响现实世界。

  • 影响评估(健康检查):
    目前,我们主要问:"AI 是否得到了正确的答案?”在未来,我们需要问:“使用这个 AI 是否真的帮助了患者?”或“它是否为公司节省了资金?”这就像从在实验室中评判食谱,转变为观察餐厅在现实世界中是否真正让客户满意并保持健康。
  • 定性评估(讲故事):
    我们将需要停止仅仅依赖数字(统计数据),转而倾听故事。我们将使用访谈和焦点小组来了解人们为什么喜欢或讨厌这种体验。数字告诉我们发生了什么;故事告诉我们感觉如何
  • 安全评估(护栏):
    安全将成为最重要的事情。政府可能会开始介入制定规则,就像他们对汽车或药物所做的那样。我们需要持续监控 AI,确保它不会失控,特别是当黑客试图欺骗它或它面临奇怪、不可预测的情况时。

核心要点

本文结论指出,该领域正从核对清单(数字是否匹配?)转向检查现实世界(这是否真正帮助或伤害了人们?)。

作者警告说,当前的研究文化有些懒惰;每个人都想快速发表成果,而审稿人往往忽视测试是否真正有效。为了向前发展,学术界需要更加严谨,停止作弊,并学习如何在它们实际被使用的混乱、复杂的现实中测试这些强大的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →