← 最新论文
🤖 machine learning

Learning Peer Influence Probabilities with Linear Contextual Bandits

本文通过引入一个刻画了遗憾最小化与估计误差之间基本权衡的上下文线性老虎机框架,并提出一种不确定性引导算法以实现该频谱上的最优性能,解决了在网络化环境中学习异质同伴影响概率的挑战。

原作者: Ahmed Sayeed Faruk, Mohammad Shahverdikondori, Elena Zheleva

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Sayeed Faruk, Mohammad Shahverdikondori, Elena Zheleva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家大型社交俱乐部的经理,这里的会员不断地向朋友分享新闻、产品或创意。你的目标是弄清楚谁在影响谁。爱丽丝(Alice)的推荐是否让鲍勃(Bob)买了一部新手机?查理(Charlie)的发帖是否让戴夫(Dave)去听了一场音乐会?

问题在于,影响力是非常难以捉摸的。有时候人们分享东西是因为他们本身很相似(同质性),而不是因为其中一人真的说服了另一人。如果你只是观察自然发生的情况,你就无法区分“爱丽丝说服了鲍勃”和“爱丽丝与鲍勃恰好喜欢同样的东西”。

为了解决这个问题,这篇论文的作者提出了一种通过主动测试这些影响概率的新方法,就像科学家进行实验一样,而不是仅仅进行观察。

以下是该核心思想的拆解,通过简单的概念进行说明:

1. 两个冲突的目标(“拔河比赛”)

研究人员发现,你无法鱼与熊掌兼得。你陷入了一场拔河比赛,在两个目标之间挣扎:

  • 目标 A:做一个优秀的销售员(最小化遗憾值/Regret)。 你希望把推荐展示给那些现在最有可能说“是”的人。这能实现即时成功最大化。
  • 目标 B:做一个优秀的侦探(最小化估计误差/Estimation Error)。 你希望学习出所有人真实的实际影响概率,甚至是那些很少说“是”的人。为了做到这一点,你必须去测试那些你不确定的人,这意味着你可能会错过一些即时的销售机会。

类比: 想象你是一位试图弄清楚哪些学生能通过考试的老师。

  • 如果你只给那些表现已经很优秀的同学做模拟测试(目标 A),你会立刻获得很高的分数,但你永远无法得知那些表现挣扎的学生是真的掌握了知识,还是仅仅需要更多帮助。
  • 如果你强迫每个学生都参加模拟测试,包括那些通常表现不佳的学生(目标 B),你会得到一张完美的关于谁掌握了什么的地图,但你的班级平均分(你的“遗憾值”)会下降,因为你把时间花在了测试那些并不需要测试的人身上。

论文在数学上证明了:没有任何单一策略能够同时完美地实现这两个目标。 你必须做出选择并寻找平衡。

2. 解决方案:“影响力上下文多臂老虎机”(InfluenceCB)

作者构建了一个名为 InfluenceCB 的智能系统,它就像一个灵活的开关。它允许你通过调节旋钮来决定你更看重成为“销售员”还是“侦探”。

  • 旋钮(参数 β\beta):

    • 如果你将旋钮转向**遗憾值(Regret)*一侧,系统就会表现得像一个谨慎的销售员。它主要向它认为*会说“是”的人展示推荐,以保持较高的即时成功率。
    • 如果你将旋钮转向 **RMSE(误差)**一侧,系统就会表现得像一个好奇的侦探。它会故意向那些不确定或表现较低的人展示推荐,以收集更多数据并了解真相,即使这意味着会减少一些即时的“是”的回答。
  • 不确定性测量器: 系统会不断检查:“我对这段友谊有多不确定?”如果不确定性过高,它就会强制进行实验(探索);如果它很有信心,它就顺其自然(利用)。

3. 他们是如何测试的

他们不仅仅是靠猜测;他们在真实的社交网络数据(如博客、照片分享网站和 Twitter 网络)上运行了模拟实验。他们创建了一个已知“真实”影响概率的虚拟世界,然后让他们的算法尝试去学习。

结果:

  • 旧方法(静态方法): 这些方法就像是在看一张过去的相片。它们在猜测方面还不错,但无法学习新事物。
  • 标准的多臂老虎机(Standard Bandits): 这些像是只跟最受欢迎的人说话的销售员。它们能获得良好的即时结果,但对整个网络的理解非常模糊。
  • 他们的算法(InfluenceCB): 这是最终的赢家。通过调整旋钮,他们可以绘制出一条完美的曲线(称为帕累托前沿/Pareto frontier)。
    • 如果客户想要最好的即时结果,InfluenceCB 能在保持学习的同时提供最佳结果。
    • 如果客户想要最准确的影响力地图,InfluenceCB 能在获得尚可结果的同时,提供最准确的地图。

4. 核心结论

这篇论文的主要贡献在于证明了学习影响力是一种平衡的艺术。你不能只优化即时利润并期望能学到真相,你也不能在不损害表现的情况下尝试学习一切。

他们的工具 InfluenceCB 为你提供了方向盘。它让你决定在任何给定时刻,你究竟想要多少程度的探索(学习)与利用(获利),从而确保无论你是进行病毒式营销活动,还是仅仅想了解信息如何在社区中传播,都能获得最符合你需求的最佳结果。

简而言之: 他们构建了一个聪明的算法,这个算法知道自己不可能在所有方面都做到完美,因此它让你能够精确选择在某一领域牺牲多少完美度,以换取在另一领域的完美表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →