Identifying Model Quality Effects on User Engagement: A Within-Version Causal Estimator with Synthetic Data Validation
本文介绍了一种新颖的因果估计框架,该框架利用单个 LLM 版本内不同能力之间非均匀的质量提升,来隔离模型更新对用户参与度的影响,该方法在合成数据上得到了验证,通过在纠正测量误差后,其表现显著优于标准方法并能准确恢复真实的因果效应。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,公司正在构建能够编写代码、起草故事并解决复杂问题的庞大语言模型。为了了解这些模型是否正在变得更好,工程师们会对它们进行严格的离线测试,在这些测试中,答案是已知的且评分是精确的。他们可以肯定地说,一个新版本在编程能力上比旧版本提高了百分之十二。与此同时,他们也在观察用户数量的变化。当一个新模型发布时,通常伴随着一波媒体报道和营销活动,他们会看到更多的人在使用该产品。但一个困难的问题仍然存在:用户量的激增是因为模型实际智能度的提升,还是仅仅因为大家都听说了这次发布?
这是一个在嘈杂环境中关于因果关系的经典问题。当新版本到来时,一切都在同时发生变化。模型变得更聪明了,但营销团队在投放广告,新闻媒体在撰写报道,季节性的趋势也在发生偏移。在这种同步变化的风暴中,想要利用标准实验来分离出模型质量的具体贡献几乎是不可能的。你无法轻易地让一部分用户使用旧的、较差的模型,而让另一部分人使用新的模型,因为这会对第一组用户造成糟糕的体验,且在操作上也难以维护。如果没有一种方法能将模型的质量与周围的噪声分离开来,公司将很难知道其工程投资是否真正驱动了用户参与度。
谷歌的一位研究员约翰·特里比亚(John Triblia)提出了一种通过观察不同的人如何实际使用这项技术来解决这一谜题的不同方法。其核心理念基于一个简单的观察:模型的改进在各项技能上并不均匀。一个新版本可能会在编写计算机代码方面显著提升,但在创意写作方面仅有微小的进步。这在同一组用户中创造了一个自然实验。两个人在同一时间可能使用完全相同的模型版本,但如果一个人整天都在编写代码,而另一个人整天都在构思小说,那么他们体验到的质量提升程度是非常不同的。程序员看到了性能的巨大飞跃,而小说家看到的只是温和的提升。由于这种体验上的差异是由用户自身的既有习惯和职业角色驱动的,而非对新模型的反应,因此它提供了一种衡量真实影响的清晰方法。
为了测试这个想法,研究人员构建了一个答案已知的模拟世界。他创建了一个包含十万个虚拟用户、跨越二十六周的数据集,并在其中引入了在不同类别中已知的特定质量改进。他准确地知道“编程”技能提升了多少,以及“写作”技能提升了多少,并且知道这些改进理应对用户活动产生的真实影响。随后,他将他的新方法应用于这些数据,以观察其是否能找到真相。该方法的效果非常出色。通过比较使用相同版本但专注于不同任务的用户,该估算器恢复了百分之八十一到百分之八十八的真实效应。剩下的微小差距并非方法的失败,而是因为研究人员使用了过去的用法模式作为当前习惯的代理变量,这引入了一定程度的统计噪声。
研究人员直接解决了这一噪声问题。他们计算了用户习惯随时间变化的稳定性,并利用该信息来调整最终数值。一旦应用了这种修正,该方法便恢复了完整的效应,精准地落在了真实值上。这一成功与其它常见方法形成了鲜明对比。当研究人员尝试那些忽略特定模型版本或使用可能受质量变化影响的实时用法数据的简单方法时,结果要糟糕得多。这些简单的方法仅恢复了大约百分之六十二到百分之六十三的真实效应,未能达标。该新方法还证明了它不仅仅是在寻找随机模式;当研究人员通过打乱数据以消除任何真实的关联时,该方法正确地发现不存在效应,从而证实了它测量的是真实存在的东西。
研究还探讨了用于衡量用户习惯的时间长度如何影响结果。研究人员发现,使用更长的过往行为记录可以使测量更加精确。当他们查看新模型到来前七周的用户习惯历史时,结果比仅查看三周的历史要清晰得多。这表明存在一个实际的权衡:公司拥有的历史数据越多,就越能准确地衡量模型更新的影响。该方法还成功区分了不同类型的用户产出。它正确识别出质量的提升增加了用户的活跃天数,但并未错误地声称质量提升了消息发送的总量,这表明该模型能够区分真正的参与度和单纯的活动量。
这种方法为无法进行传统实验的产品团队提供了一个强大的工具。它允许他们利用客户工作方式中的自然变异,来理解是什么驱动了参与度。通过在模型到达之前冻结用户习惯的测量,并观察不同群体对他们所经历的具体质量变化的反应,公司可以分离出工程工作的真实价值。研究表明,即使没有受控实验,只要考虑到发布的噪声和不同用户与技术交互的具体方式,也是有可能确定模型的改进是否是人们使用产品频率增加的原因的。研究结果表明,通过适当的统计调整,即使在最繁忙的产品发布过程中,也能清晰地捕捉到质量提升的信号。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。