The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice
本文提出并评估了一个三源框架,该框架将小型随机实验与离线模拟器相结合,以识别并纠正大规模观测性语言模型日志中固有的选择偏差,从而实现对模型性能的有效因果比较。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你试图找出三位厨师中谁做的汤最好。你有一本来自繁忙餐厅的庞大客户评论笔记本(即观测日志,或OBS)。然而,有一个陷阱:客户并非随机选择厨师。他们是根据自己的心情、饥饿程度或过往经历,挑选了他们认为最好的厨师。
如果你只是阅读这本笔记本,你可能会认为 A 厨师最好,因为选择 A 厨师的人本来就心情愉快,对一切都喜爱有加。但也许 B 厨师实际上更好;他们只是服务了那些太疲惫而无法欣赏汤味的暴躁顾客。这就是混淆:人们选择厨师的原因与他们喜欢食物的程度混杂在了一起。
为了解决这个问题,你可以进行一项小型、严格的实验,强制客户随机选择一位厨师(即随机化实验,或EXP)。这将给你一个公平、无偏的味觉测试。但运行这项实验既昂贵又会让客户感到烦恼,所以你只能进行几次。
本文提出了一种巧妙的三部分策略,利用“厨房模拟器”作为桥梁,以兼得两者的优势。
三种要素
- 大笔记本(OBS): 一大堆现实世界的评论。它是有偏的,但拥有大量数据。
- 小公平测试(EXP): 一小堆评论,其中客户被强制随机选择。它是无偏的,但非常小。
- 厨房模拟器(SIM): 一个可以重新烹饪汤的机器人。如果你告诉它"A 厨师为这位特定顾客做了这碗汤”,机器人可以立即生成即使顾客从未实际点过,A 厨师的汤本会呈现的样子。
重大发现:“魔法技巧”
本文的主要发现是一个数学证明(定理 1),指出:你不需要大笔记本就能找出谁才是真正的最佳厨师。
这就是魔法技巧:
- 模拟器可以向展示任何厨师为任何顾客会做出什么汤。
- 小公平测试确切地告诉你,在那少数几次随机情况下,汤有多好。
通过结合这两者,你可以从数学上计算出每位厨师的真实技艺。大笔记本(OBS)不需要用来证明谁更好;它仅在后来的阶段被需要,以使你的估计更精确(减少答案中的“噪声”)。
可以这样想:模拟器和小型公平测试给了你真相。大笔记本只是一把放大镜,帮助你更清晰地看到真相,但它本身并不创造真相。
混合要素的六种方法
一旦知道真相是可以恢复的,本文便提出:“我们如何利用大笔记本来帮助我们,而不被其偏差所误导?”他们测试了六种不同的数据混合“配方”(估计量):
- 纯实验者(仅 EXP): 完全忽略大笔记本,仅使用小型公平测试。
- 优点: 完全无偏。
- 缺点: 如果公平测试太小,结果会非常不稳定(高方差)。
- 笔记本阅读者(仅 OBS): 忽略公平测试,只阅读大笔记本。
- 优点: 数值非常稳定。
- 缺点: 由于偏差而完全错误(低方差,高偏差)。
- 翻译者(表示 -EXP): 利用大笔记本学习客户喜好的“语言”,然后利用小型公平测试在该语言中学习实际评分。
- 优点: 如果笔记本的“语言”捕捉到了正确的细节,效果很好。
- 缺点: 如果笔记本遗漏了重要细节,则会失败。
- 基于根基的修正者(Grounded): 从“笔记本阅读者”的答案开始,然后利用小型公平测试来“修正”错误。
- 优点: 如果笔记本大体正确但存在微小的系统性误差,效果极佳。
- 混合者(CVCI): 将笔记本和公平测试混合在一起,根据哪种组合在小型公平测试中表现最佳来调整混合比例。
- 优点: 通常是最平衡的方法。
- 残差混合者(CVCI-Residual): 类似于混合者,但首先利用笔记本去除问题的“简单”部分,然后利用公平测试来修正剩余的“困难”部分。
实验结果
作者在两项现实世界任务上测试了这些配方:新闻文章摘要和修复计算机代码。
- 没有“放之四海而皆准”的方案: 没有单一的赢家。哪种配方效果最好取决于两件事:
- 你有多少数据? 如果你拥有的公平测试数据很少,你需要 heavily 依赖笔记本(但要小心)。如果你拥有大量公平测试数据,你可以更容易地忽略笔记本的偏差。
- 你在测量什么?
- 在摘要任务中,“混合者”(CVCI)通常表现最好。它完美地平衡了海量的笔记本数据与小型公平测试。
- 在代码任务中,结果取决于“成功”的定义。如果成功意味着“代码是否修复了 bug?”,基于笔记本的方法更好。如果成功意味着“代码风格是否优美?”,则另一种方法(表示-EXP)效果更好。
核心结论
当你使用现实世界日志评估 AI 模型时,不能仅仅因为人们基于隐藏因素选择模型就信任这些数字。
本文证明,如果你拥有模拟器(用于重新生成输出)和小型随机化测试(用于获取公平评分),你就可以从数学上找到模型的真实性能。海量的有偏现实世界日志有助于微调答案,但它不是解锁真相的关键。关键在于模拟器与随机化实验的结合。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。