A Comparative Study of Controlled Text Generation Systems Using Level-Playing-Field Evaluation Principles
本文引入一个公平竞争评估框架以公平比较受控文本生成系统,揭示标准化评估往往得出远逊于原始报道的性能结果,并强调亟需可复现的评估实践以避免误导性主张。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:每位厨师都声称自己制作了镇上“最好”的披萨。一位厨师说他们的披萨最好,因为他们使用了特定的烤箱;另一位说他们的披萨胜出,是因为使用了特殊的面粉;第三位则说他们的披萨更胜一筹,因为他们仅针对一份特定的配料清单进行了评判。
问题在于:你无法判断谁真正制作了最好的披萨,因为没有人使用相同的烤箱、相同的面粉或相同的品尝者。他们都在遵循不同的规则。
这正是人工智能领域中**受控文本生成(CTG)**系统所面临的困境。这些 AI 模型旨在生成遵循特定规则的文本,例如使其听起来愉快(情感)、谈论特定主题(话题)或包含某些词语(关键词)。多年来,研究人员一直声称他们的 AI 是“最好的”,但他们以不同的方式测试这些模型,使得人们无法确定谁才是真正的赢家。
解决方案:“公平竞技场”厨房
本文的作者米凯拉·洛兰迪(Michela Lorandi)和阿尼亚·贝尔兹(Anya Belz)决定终结这种混乱。他们构建了一个**公平竞技场(LPF)**评估系统。不妨将其想象为设立一个巨大的单一厨房,要求每位厨师必须:
- 使用完全相同的烤箱。
- 使用完全相同的食材烹饪。
- 接受完全相同的品尝者小组评判。
他们并非只采用一种品尝披萨的方式,而是聘请了一个多元化的评委小组,以确保没有任何一位评委的个人偏见扭曲结果。
他们做了什么
研究人员收集了12 种不同的 AI“厨师”(技术),这些技术在文本控制领域颇负盛名。他们让所有这些技术接受严格测试,测试内容包括:
- 四份不同的“菜单”(数据集): 用于启动写作过程的不同提示集合。
- 四种不同的“订单”(控制类型): 生成愉快文本、悲伤文本、关于体育的文本、关于商业的文本,或必须包含特定词语的文本。
- 公平的评判小组: 他们并未仅使用一个计算机程序来评分,而是使用了三个不同的程序并取其平均分。这防止了结果被单一且古怪的评判者操纵。
令人震惊的结果
当他们在这些严格且公平的条件下重新评估这些著名的 AI 系统时,结果令人惊讶:
- “最佳”未必真正最佳: 在许多情况下,那些原本声称是顶级表现的系统,其得分实际上远低于他们此前报告的分数。事实证明,那些高分部分是因为原始研究人员恰好使用了一位“评委”,而这位评委偏爱他们特定的披萨风格。
- 专家胜过通才: 专门针对这些任务训练的 AI 模型(“专家厨师”)通常优于那些试图包揽一切的大型通用大语言模型(如 Falcon 或 LLaMa)。专家模型在遵循特定规则方面表现更佳。
- “两者兼顾”的陷阱: 当被要求同时遵循两条规则时(例如,撰写关于“体育”且同时“愉快”的文本),几乎所有系统都出现了显著困难。这就像要求一位厨师同时制作出既“辛辣”又“甜美”的披萨;结果往往分崩离析。
为何这很重要
该论文得出结论:长期以来,AI 文本生成领域充斥着误导性声明。由于每个人都使用不同的测试方法,我们实际上并不知道哪种技术真正有效。
通过采用这种“公平竞技场”方法,作者表明:
- 标准化迫在眉睫: 我们需要一种单一、公平的测试这些系统的方法,否则我们将继续相信关于 AI 智能程度的虚假声明。
- 性能往往被夸大: 若缺乏公平测试,已发表的结果可能使系统看起来比实际能力强大得多。
简而言之,这篇论文呼吁停止那种每个人使用不同规则的“烹饪比赛”,转而举办一场公平的锦标赛,让我们最终能够看清谁才是厨房里真正的最佳厨师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。