← 最新论文
📈 economics

The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice

本文提出并评估了一个三源框架,该框架将小型随机实验与离线模拟器相结合,以识别并纠正大规模观测性语言模型日志中固有的选择偏差,从而实现对模型性能的有效因果比较。

原作者: Jikai Jin, Vasilis Syrgkanis

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jikai Jin, Vasilis Syrgkanis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图找出三位厨师中谁做的汤最好。你有一本来自繁忙餐厅的庞大客户评论笔记本(即观测日志,或OBS)。然而,有一个陷阱:客户并非随机选择厨师。他们是根据自己的心情、饥饿程度或过往经历,挑选了他们认为最好的厨师。

如果你只是阅读这本笔记本,你可能会认为 A 厨师最好,因为选择 A 厨师的人本来就心情愉快,对一切都喜爱有加。但也许 B 厨师实际上更好;他们只是服务了那些太疲惫而无法欣赏汤味的暴躁顾客。这就是混淆:人们选择厨师的原因与他们喜欢食物的程度混杂在了一起。

为了解决这个问题,你可以进行一项小型、严格的实验,强制客户随机选择一位厨师(即随机化实验,或EXP)。这将给你一个公平、无偏的味觉测试。但运行这项实验既昂贵又会让客户感到烦恼,所以你只能进行几次。

本文提出了一种巧妙的三部分策略,利用“厨房模拟器”作为桥梁,以兼得两者的优势。

三种要素

  1. 大笔记本(OBS): 一大堆现实世界的评论。它是有偏的,但拥有大量数据。
  2. 小公平测试(EXP): 一小堆评论,其中客户被强制随机选择。它是无偏的,但非常小。
  3. 厨房模拟器(SIM): 一个可以重新烹饪汤的机器人。如果你告诉它"A 厨师为这位特定顾客做了这碗汤”,机器人可以立即生成即使顾客从未实际点过,A 厨师的汤本会呈现的样子。

重大发现:“魔法技巧”

本文的主要发现是一个数学证明(定理 1),指出:你不需要大笔记本就能找出谁才是真正的最佳厨师。

这就是魔法技巧:

  • 模拟器可以向展示任何厨师为任何顾客会做出什么汤。
  • 小公平测试确切地告诉你,在那少数几次随机情况下,汤有多好。

通过结合这两者,你可以从数学上计算出每位厨师的真实技艺。大笔记本(OBS)不需要用来证明更好;它仅在后来的阶段被需要,以使你的估计更精确(减少答案中的“噪声”)。

可以这样想:模拟器和小型公平测试给了你真相。大笔记本只是一把放大镜,帮助你更清晰地看到真相,但它本身并不创造真相。

混合要素的六种方法

一旦知道真相是可以恢复的,本文便提出:“我们如何利用大笔记本来帮助我们,而不被其偏差所误导?”他们测试了六种不同的数据混合“配方”(估计量):

  1. 纯实验者(仅 EXP): 完全忽略大笔记本,仅使用小型公平测试。
    • 优点: 完全无偏。
    • 缺点: 如果公平测试太小,结果会非常不稳定(高方差)。
  2. 笔记本阅读者(仅 OBS): 忽略公平测试,只阅读大笔记本。
    • 优点: 数值非常稳定。
    • 缺点: 由于偏差而完全错误(低方差,高偏差)。
  3. 翻译者(表示 -EXP): 利用大笔记本学习客户喜好的“语言”,然后利用小型公平测试在该语言中学习实际评分。
    • 优点: 如果笔记本的“语言”捕捉到了正确的细节,效果很好。
    • 缺点: 如果笔记本遗漏了重要细节,则会失败。
  4. 基于根基的修正者(Grounded): 从“笔记本阅读者”的答案开始,然后利用小型公平测试来“修正”错误。
    • 优点: 如果笔记本大体正确但存在微小的系统性误差,效果极佳。
  5. 混合者(CVCI): 将笔记本和公平测试混合在一起,根据哪种组合在小型公平测试中表现最佳来调整混合比例。
    • 优点: 通常是最平衡的方法。
  6. 残差混合者(CVCI-Residual): 类似于混合者,但首先利用笔记本去除问题的“简单”部分,然后利用公平测试来修正剩余的“困难”部分。

实验结果

作者在两项现实世界任务上测试了这些配方:新闻文章摘要修复计算机代码

  • 没有“放之四海而皆准”的方案: 没有单一的赢家。哪种配方效果最好取决于两件事:
    1. 你有多少数据? 如果你拥有的公平测试数据很少,你需要 heavily 依赖笔记本(但要小心)。如果你拥有大量公平测试数据,你可以更容易地忽略笔记本的偏差。
    2. 你在测量什么?
      • 摘要任务中,“混合者”(CVCI)通常表现最好。它完美地平衡了海量的笔记本数据与小型公平测试。
      • 代码任务中,结果取决于“成功”的定义。如果成功意味着“代码是否修复了 bug?”,基于笔记本的方法更好。如果成功意味着“代码风格是否优美?”,则另一种方法(表示-EXP)效果更好。

核心结论

当你使用现实世界日志评估 AI 模型时,不能仅仅因为人们基于隐藏因素选择模型就信任这些数字。

本文证明,如果你拥有模拟器(用于重新生成输出)和小型随机化测试(用于获取公平评分),你就可以从数学上找到模型的真实性能。海量的有偏现实世界日志有助于微调答案,但它不是解锁真相的关键。关键在于模拟器与随机化实验的结合。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →