Active Testing of Large Language Models via Approximate Neyman Allocation
本文提出了一种针对生成式大语言模型的新型主动测试算法,该算法利用代理模型的语义熵对评估池进行分层并执行近似奈曼分配,与均匀采样及现有基线方法相比,显著降低了均方误差和标注成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个巨大的问题库(“评估池”)和一个你想要测试的超级智能人工智能(“大语言模型”)。你需要了解该人工智能的平均表现如何。
问题在于:这个库包含数千个问题,而为每个问题获取“正确答案”代价高昂。这通常意味着需要聘请人类专家来评估人工智能的工作成果。如果你要求专家评估每一个问题,成本将极其昂贵,且耗时漫长。
目标:你希望只要求专家评估少量问题,但仍能以高精度获知该人工智能在整个库中的平均得分。这被称为“主动测试”。
旧方法:“猜谜游戏”
此前,研究人员试图挑选“最有趣”的问题进行评估。他们将人工智能视为一个简单的选择题机器。他们会观察人工智能显得多么“困惑”(使用一种称为“熵”的数学技巧),并挑选那些人工智能看起来最不确定问题。
为何失败:
- 关注点错误:现代人工智能不仅仅是选择 A、B、C 或 D。它会撰写段落。旧方法关注的是人工智能写的字母,而非含义。这就像通过数厨师掉了多少次勺子来评判一位厨师,而不是品尝食物的味道。
- “自信陷阱”:这些聪明的人工智能往往过度自信。即使它们不知道答案,也会表现得好像知道一样。旧方法被这种虚假的自信所迷惑,最终挑选了随机问题,这与单纯猜测并无二致。
新方案:“智能图书管理员”
本文作者创造了一种新方法,其作用如同智能图书管理员。他们不再关注人工智能的字母,而是关注答案的含义。
以下是该方法逐步运作的过程:
1. “影子教师”(代理模型)
在请求昂贵的人类专家之前,他们使用一个更小、更便宜、更快的人工智能(“代理”)快速浏览所有问题。
- 类比:想象一位教学助理(代理),其聪明程度不如主讲教授(目标人工智能),但速度快且成本低。助教会先尝试回答所有问题。
2. 测量“含义困惑度”(语义熵)
助教为每个问题生成几个不同的答案。
- 如果助教给出了五个完全不同且毫无意义的答案,这意味着该问题很难,且含义不确定。
- 如果助教给出了五个答案,它们用不同的词语表达了相同的意思,那么该问题很容易,且含义清晰。
- 创新点:新方法测量的不是字母数量,而是这种“含义困惑度”(语义熵)。这告诉他们哪些问题真正棘手。
3. 图书分类(分层)
图书管理员根据助教的困惑程度,将整个库中的问题分类到不同的“书架”(层)中:
- 书架 A:助教完全自信的问题(容易)。
- 书架 B:助教略有不确定性的问题(中等)。
- 书架 C:助教完全迷失的问题(困难)。
4. 智能预算(近似奈曼分配)
现在,你有一个有限的预算(例如,你只能支付专家评估 70 个问题)。
- 旧错误:从整个库中随机评估 70 个问题。
- 新策略:该方法使用一条数学规则(奈曼分配)来决定从每个书架评估多少问题。
- 它将更多预算花在“困难”书架(书架 C)上,因为这些问题变化最大且最难预测。
- 它在“容易”书架(书架 A)上花费较少,因为那些答案是可预测的。
- 它利用助教的表现来猜测答案会有多大的“变化”,因此无需查看最终的专家评分即可做出此决定。
结果:节省资金与时间
该论文在不同的人工智能模型上,针对各种困难任务(如高级科学问题和图像分析)测试了这种方法。
- 更高的准确性:通过将有限的预算集中在真正重要(即令人困惑)的问题上,他们的方法比随机猜测更准确地预测了人工智能的总分。
- 巨大的节省:他们发现,在专家评估费用上**减少 23%的情况下,仍能获得相同水平的准确性。在某些情况下,他们节省了高达28%**的成本。
- “神谕”基准:理论上存在一种“完美”的执行方式(称为神谕 - 奈曼),即你在开始前就能神奇地确切知道每个问题的难度。新方法即使没有这种神奇的知识,也能非常接近这一完美得分。
总结
这就像品尝汤。
- 旧方法:你随机从顶部、中部和底部各舀一勺。你可能会错过底部的咸味点。
- 新方法:你使用一个廉价的试味员(代理)来找出汤中味道奇怪的地方。然后,你专门将昂贵的品尝预算花在这些奇怪的地方,以判断整锅汤的真实味道。
这种方法使公司能够更可靠地测试其昂贵的人工智能模型,而无需在人类专家身上花费巨额资金。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。