Click prediction boosting via Bayesian hyperparameter optimization based ensemble learning pipelines
本文提出了一种基于贝叶斯超参数优化的集成学习流水线,该流水线通过将特征消除与堆叠模型相结合,使在线旅行社的酒店点击预测准确率提升了约 10%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一个巨大且繁忙的数字市场,数以百万计的人在其中徘徊,寻找完美的睡眠之地。在预订房间之前,他们经常会跳到“元搜索”网站上——把这些网站想象成像 Kayak 或 TripAdvisor 这样的大型比较商店——在那里,他们可以同时看到来自数十家不同旅行社的价格和评论。为了在这个拥挤的市场中获得关注,旅行社需要支付广告费。但棘手之处在于:他们通常只有在有人真正点击其广告时才会付费。如果他们对价格的判断失误,可能会在那些从未发生的点击上花费巨资;或者更糟的是,如果出价过低,可能会错失成千上万的潜在客户。因此,这些机构面临的重大问题是:“如果我们把价格设定在这个特定的数值,会有多少人真正点击?”
为了回答这个问题,科学家们使用了一个名为“机器学习”的计算机科学分支,这基本上是在教计算机如何通过寻找数据中的模式,而不是仅仅遵循僵化的规则。一种流行的方法是“集成学习”(ensemble learning),这就像是组建一支超级侦探队。与其依赖于可能漏掉线索的单个侦探,不如召集一整个小队,让他们各自调查案件,然后将他们的理论结合起来,以获得更准确的答案。这篇论文深入探讨了那个世界,试图构建一支终极算法团队,来预测在线旅行社的酒店点击量。
这项研究的作者试图利用来自土耳其一家主要在线旅行机构的海量数据集来解决点击预测之谜。他们不仅仅是把一种算法投入到问题中;相反,他们构建了一个复杂的流水线,以创建一个预测者的“梦之队”。首先,他们清理了杂乱的数据,填补了缺失的空白,并添加了有用的背景信息,如天气报告以及某天距离节假日的距离。然后,他们使用了一种基于名为 XGBoost 的工具的智能过滤过程,剔除了嘈í且无用的信息,只留下最重要的线索。
接下来,他们训练了十种不同类型的数学模型,从复杂的树状系统到简单的线性方程不等。但真正的魔力发生在他们组合这些模型的时候。他们测试了四种混合这些模型的方法:简单地平均它们的答案、给予更聪明的模型更高的权重,以及两种被称为“堆叠”(stacking)和“融合”(blending)的高级技术。堆叠就像是让第一支侦探队撰写一份报告,然后由第二支资深侦探队阅读这些报告并做出最终裁决。融合与之类似,但资深团队在阅读报告时还会再次查看原始线索。
结果非常明确。虽然单个模型表现尚可,但团队协作的效果显著更好。论文指出,最好的方法是“堆叠集成”模型,特别是当资深团队使用线性回归等简单工具来解读第一支团队的报告时。这个表现最佳的模型达到了一个分数(称为 R² 为 0.639),比表现最好的单个模型高出约 10%。作者发现,由于繁重的工作已经由第一层模型完成了,简单的模型作为“最终法官”效果最好。他们还注意到,更复杂的模型并不一定会让最终决策变得更好;事实上,有时它们反而会让情况变糟。
最后,这项研究表明,通过仔细选择特征、调整算法设置并以聪明的方式结合多个模型,在线旅行社可以更清晰地了解其广告将产生多少点击量。作者提出,这种方法是该行业一个充满前景的方向,尽管他们也承认仍有提升空间。他们暗示,在未来,他们可能会尝试加入更多类型的模型,例如人工神经网络或处理类别的专门工具,以观察是否能榨取出更高的准确性。然而,就目前而言,证据指向了一个简单的真理:在预测点击量的世界里,一支协调有序的多样化思考者团队总是胜过孤独的天才。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。