← 最新论文
🤖 machine learning

Contextual Scalarisation Thompson Sampling for multi-objective decisions in public media

本文介绍了上下文标量化汤普森采样(Contextual Scalarisation Thompson Sampling, CSTS),这是一种多目标上下文多臂老虎机算法,它能够根据上下文动态学习如何权衡相互竞争的编辑目标,并在来自瑞士国家广播机构的真实数据上展示了在相关性和与专家策展一致性方面的提升。

原作者: Théo Maëtz, Luc Guillet, Andrea Cavallaro

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Théo Maëtz, Luc Guillet, Andrea Cavallaro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位非常著名的、由公共资金资助的餐厅的主厨。你的工作不仅仅是提供当日最受欢迎的菜肴;你肩负着一项复杂的使命。你需要确保:

  • 餐厅座无虚席: 你需要有足够的顾客(受众)。
  • 菜单多样化: 你不能每晚都只供应披萨;你需要为不同的口味提供多样性(多样性)。
  • 尝试新鲜事物: 你需要偶尔引入新鲜的食材(新颖性)。
  • 不被起诉: 你必须遵守关于允许使用哪些食材以及何时过期的严格合同(权利)。
  • 击败竞争对手: 如果隔壁的餐厅正在供应一份巨大的牛排,也许你也应该提供一些不同的东西来脱颖而出(竞争)。

在过去,这家公共广播机构 Radio Télévision Suisse (RTS) 的主厨们(策展人)必须手动做出这些决定。他们需要在大脑中权衡数千部电影,并试图平衡所有这些相互竞争的目标。这很困难,速度很慢,且完全依赖于他们的个人经验。

这篇论文介绍了一个名为 CSTS(上下文标量化汤普森采样器)的“智能助手”来帮助他们。以下是它的工作原理,通过简单的解释说明:

1. “一刀切”的问题

大多数推荐系统(如 Netflix 或 Spotify)通常只选择一个目标:“什么能获得最多的点击?”或者“什么是最受欢迎的?”

有些系统试图平衡目标,但它们使用的是固定规则。想象一位主厨决定:“我将始终优先考虑新颖性而非受众规模。”这在周五晚上的派对上可能行得通,但在一个安静的周二早晨新闻时段可能会是一场灾难。论文认为,一个好的决策“配方”应该根据情况(上下文)而变化。

2. 解决方案:变色龙主厨

CSTS 系统就像是一个变色龙主厨。它没有固定的规则手册。相反,它学会了根据当下的“天气”来改变其优先级。

  • 食材(价值信号): 系统会查看每一个候选电影,并根据五种不同的“风味”对其进行评分:受众、多样性、新颖性、权利和竞争。
  • 上下文(天气): 它会观察特定的时间段。是周五晚上吗?是节假日吗?竞争对手的频道正在播放大片吗?
  • 神奇之处(上下文标量化): 系统学会了将这五种风味混合成一个单一的“口感得分”。
    • 例子: 在周五晚上,它可能会决定:“好吧,让我们混合 40% 的受众、30% 的新颖性和 30% 的多样性。”
    • 例子: 在周二早上,它可能会切换到:“让我们混合 10% 的受众、50% 的权利(我们需要用完即将过期的合同)和 40% 的多样性。”

3. 它是如何学习的(“赌徒”类比)

该系统使用了一种称为**汤普森采样(Thompson Sampling)**的技术。把这想象成一个带着笔记本的聪明赌徒。

每当人类主厨做出一个选择时,系统都会检查它的笔记本。

  • 如果系统猜中了那个情境下正确的“风味组合”,它会得到一个赞。
  • 如果它猜错了,它就会学习。
  • 至关重要的一点是,系统对于新情况是存在不确定性的。当它不确定时,它会尝试几种不同的“组合”来看看会发生什么(探索)。随着获得更多数据,它会变得更加自信,并坚持使用有效的方法(利用)。

这使得它能够为每个特定时间段找到完美的平衡,而不是使用通用的平均值。

4. 测试结果如何?

研究人员使用来自这家瑞士广播机构两年的真实数据测试了这个助手。他们将 CSTS 与以下对象进行了对比:

  1. 固定规则: 一个永远不会改变其优先级的系统。
  2. 标准 AI: 只寻找最受欢迎电影的系统。
  3. 人类专家: 实际策展人所做的选择。

结果显示:

  • 更擅长“契合氛围”: 与其他系统相比,CSTS 系统更擅长找到符合特定上下文(例如,为周六早晨寻找一部家庭电影)的电影。它实现了 98.7% 的相关性率 来寻找合适的选项,击败了固定规则系统(92.0%)和标准 AI(80.0%)。
  • 不仅仅是复制历史: 有趣的是,“固定规则”系统在预测人类过去选择的确切电影方面表现稍好。然而,作者认为人类有时会做出不一致或次优的选择。CSTS 更擅长为该特定情况找到最佳电影,即使它不是人类上次选择的那部完全相同的电影。
  • 平衡行为: 系统成功地学会了比固定规则更频繁地优先考虑“权利”(使用即将过期的合同)和“多样性”,而固定规则则沉迷于“新颖性”。

核心结论

论文声称,CSTS 是一个决策支持工具,旨在帮助人类策展人管理庞大的电影库。它并没有强行将一套单一、僵化的规则应用于每一个决策,而是像一个灵活的专家一样,知道:“现在,对于这个特定的时间段,我们需要关注 X,但下周我们应该关注 Y。”

它并不是要取代人类主厨;它为人类提供了前 5 个最佳选项的精选名单,这些选项完美契合当前的“天气”,使人类做出最终选择的工作变得更加轻松且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →