One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation
本文介绍了 OSMF,这是一个统一的框架,它通过动态对用户进行分组,并采用经过 Group-DPO 微调的组感知多模态大语言模型来对齐多样化的分组点击偏好,从而解决了“一刀切”式广告图像生成的局限性,并在离线和在线指标上均实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营一个向数百万人展示广告的海量数字广告牌。在过去,策略是**“一刀切”(One Size Fits All)**。你会为一双鞋子制作一个看起来完美的广告,然后展示给所有人。目标是获得最高的总点击量。
但问题在于:并不是每个人都喜欢同样的东西。
- 青少年可能会喜欢带有硬核、都市滑板公园背景的鞋类广告。
- 祖父母辈可能更喜欢同样的鞋子出现在洁净、阳光明媚的花园场景中。
- 如果你把“滑板公园”的广告展示给祖父母辈,他们不会点击。如果你把“花园”的广告展示给青少年,他们也不会点击。
这篇论文介绍了一个名为 OSMF(一型多适,One Size, Many Fits) 的新系统来解决这个问题。它不再是为所有人制作一个广告,而是从同一个“计算机大脑”中,为特定的群体创造独特的广告。
以下是该系统的运作方式,分为简单的步骤:
1. “智能分组”(PAAG)
类比: 想象一位派对策划师,他们不仅仅是按年龄或性别来划分宾客。相反,他们会将“菜单”(产品)和“宾客”结合起来观察。
- 如果产品是智能手机,策划师会意识到男性和女性可能有截然不同的口味。
- 如果产品是跑步鞋,策划师会意识到年龄比性别更重要。
- 论文中的做法: 系统使用了一个名为 PAAG(产品感知自适应分组)的工具。它观察产品并结合用户的历史记录,动态地将人们分入正确的“俱乐部”。它不使用僵化的规则;它会计算出:“对于这个特定的产品,这5万个人实际上想要同样的东西。”
2. “超级翻译官”(G-MLLM)
类比: 想象一位大厨,他可以为一大群人烹饪,但通常只是做一大锅汤。这个新系统就像一位能根据坐在桌前的客人瞬间切换食谱的大厨。
- 系统使用了一个组感知多模态大语言模型(G-MLLM)。这是一个能够理解文本和图像的超智能 AI。
- 在开始“烹饪”之前,它会进行“预训练”,以理解每个特定群体的“风味”(偏好)。它学习到 A 组喜欢“明亮的色彩”,而 B 组喜欢“极简风格”。
3. “口味测试”(Group-DPO)
类比: 想象大厨做了两道菜。一组品鉴者(奖励模型)尝试它们并说:“A 组很喜欢那个辣味的,但 B 组讨厌它。”
- 系统使用了一种名为 Group-DPO 的技术。它不只是问“哪张图片更好?”,而是问“哪张图片对这个特定群体更好?”
- 它对比同一产品的两个广告。如果“都市风”广告从青少年群体中获得了更多点击,AI 就会学习为他们制作更多“都市风”的广告。如果“花园风”在老年群体中胜出,它也会学习这一点。
- 这确保了 AI 不会被冲突的口味所困扰。它学习如何成为一只变色龙,为每个群体改变自己的风格。
4. “海量食谱库”(GAIP 数据集)
类比: 要教会一位大厨如何为4000万人烹饪,你需要一本拥有真实反馈的海量食谱。
- 研究人员发现找不到这样规模的公开书籍,所以他们编写了自己的。
- 他们创建了 GAIP,这个数据集包含 4000 万用户和 60 万个不同的群体。这就像拥有了一份详细记录:当 4000 万个不同的广告展示在 60 万种不同类型的人面前时,他们分别点击了什么。这是首次公开如此大规模且详细的“偏好图谱”。
结果
当他们测试这个系统时:
- 线下(模拟): 它预测点击量的准确度高于以往任何方法。
- 线上(现实世界): 当他们真正将这些广告展示在一个大型电子商务网站上时,“一型多适”的方法比旧有的“一刀切”方法获得了显著更多的点击量。
简而言之: 论文指出,“不要试图用一个广告去讨好所有人。利用智能分组来弄清楚谁喜欢什么,训练一个超强 AI 来理解这些特定群体,并为每一个群体生成定制化广告。这种方法效果更好,而且我们有数据来证明这一点。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。