← 最新论文
🤖 AI

Joint AP Probing and Scheduling: A Contextual Bandit Approach

本文通过将该问题建模为一种新型的带探测上下文老虎机(CBwP)框架,并提出了一种针对伯努利数据速率具有已确立遗憾界限的高效算法,解决了联合探测和调度未知无线链路的挑战。

原作者: Tianyi Xu, Ding Zhang, Parth H. Pathak, Zizhan Zheng

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyi Xu, Ding Zhang, Parth H. Pathak, Zizhan Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图寻找去学校的最佳路线,但交通灯坏了,而且路况每分钟都在变化。你无法同时看到整张地图。这就是现代无线网络的日常挣扎。在计算机科学领域,特别是“在线学习”领域,研究人员试图教会计算机如何在信息不全的情况下做出明智的决策。他们使用了一种巧妙的数学工具,叫做“多臂老虎机”(multi-armed bandit)。想象一排老虎机(手臂)。你不知道哪一台的赔率最高,所以你必须拉动杠杆来进行测试。难点在于平衡“探索”(尝试新的机器以获取知识)与“利用”(玩目前看起来最好的那台机器)。通常情况下,只有在你拉动杠杆并失去一个回合之后,你才会知道一台机器是否好用。但如果,在你决定投入某台机器之前,你可以先窥视其中几台机器内部的情况,看看正在发生什么,而无需实际进行游戏呢?这正是这篇论文所探讨的核心问题:如何将“窥探”(探测)与“游玩”(连接)结合起来,以在变化的世界中获得最佳结果。

该论文的作者,天一徐(Tianyi Xu)及其同事,解决了一个无线网络中的特定问题:移动设备(如手机或笔记本电脑)需要连接到许多接入点(AP)中的一个以获取互联网。连接速度会根据用户所处的位置以及阻挡信号的物体而不断变化。传统上,设备要么只是猜测使用哪个 AP,要么必须一个接一个地进行测试,这会浪费大量时间。研究人员提出了一种名为“带探测的上下文老虎机”(Contextual Bandits with Probing, CBwP)的新方法。把它想象成一场游戏节目,在做出最终猜测之前,你有有限数量的“提示”(探测)。在他们的模型中,设备可以检查一小部分 AP,以查看它们当前的信号质量,然后再决定实际连接到哪一个。

论文表明,通过使用这种“先看再玩”的策略,设备可以更快地学习在当前位置哪个 AP 最好。研究人员构建了一种智能算法,它表现得像一个好奇的探索者。它不仅仅是随机选择;它利用用户的地理位置(“上下文”)来推测哪些 AP 可能表现良好,检查其中的几个,然后选出胜者。他们从数学上证明了,如果连接质量是“好”或“坏”(伯努利分布),那么他们的方法是实现这一目标的最佳离线方式。当他们在利用一个拥有 12 个不同 AP 的学生宿舍真实数据进行的计算机模拟中测试他们的想法时,他们的算法学习做出更好选择的速度比其他方法快得多。即使在有新学生走进房间并改变环境时,它也能保持极低的“悔恨值”(即选择错误连接导致的损失机会)。结果表明,这种方法可以帮助未来的无线网络实时适应移动用户,而无需浪费时间测试每一个连接选项。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →