← 最新论文
🤖 machine learning

Bootstrap-Conditioned Action Selection with Tabular Foundation Models

本文提出了 BC-ICL,这是一种新型的上下文老虎机策略,它利用具有上下文学习能力的预训练表格基础模型和自助重采样技术,实现了样本高效且鲁棒的在线决策,并在稀疏和冷启动场景下优于既有的基准模型。

原作者: Devansh Gupta, Shiv Tavker, Dmitry Efimov, Suchitra Sathyanarayana, Gitanjali Bhutani, Boris N. Oreshkin

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Devansh Gupta, Shiv Tavker, Dmitry Efimov, Suchitra Sathyanarayana, Gitanjali Bhutani, Boris N. Oreshkin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图在浩瀚、迷雾重重的星系中寻找最佳航线的飞船船长。每当你选择一条路径时,你都会得到一个微小的提示——也许是一道闪光,或者一阵静电——告诉你你是接近了宝藏,还是仅仅在驶向死胡同。这就是科学家们称之为“上下文多臂老虎机”(contextual bandits)的问题核心。这是计算机学习如何根据你的身份和以往喜好来做出个性化选择(例如向你推荐你可能会喜欢的电影或让你想跳舞的歌曲)背后的数学原理。棘手的部分在于“冷启动”:当计算机对你几乎一无所知时,它必须进行疯狂的猜测来学习。传统方法往往会陷入重复猜测错误路径的怪圈,或者因为担心出错而变得过于胆小,不敢尝试新事物。它们需要一种既勇敢又聪明的方法,能够在不撞毁飞船的前提下探索未知。

现在,为你的飞船迎来了一位新成员:“基础模型”(foundation model)。把这想象成一位超级聪明的、经过预训练的侦探,他已经读过数百万本推理小说,比任何人都擅长发现数据中的模式。通常情况下,这些侦探只是坐在那里给出答案。但如果我们能把这位侦探变成一名探险家呢?这正是 Devansh Gupta 及其团队的研究人员想要做的事情。他们提出了一个问题:我们能否通过搅动它所看到的线索,让这个已经“冻结”且无法即时学习新招式的预训练侦探,去玩一场“猜猜最佳动作”的游戏?

他们构建了一种名为 BC-ICL(基于引导条件的上下文学习动作选择)的方法。用通俗易懂的话来说,它是这样运作的:想象侦探正在查看飞船过去所有航行的历史记录。计算机并没有一次性查看整个历史,而是提取了一个“引导样本”(bootstrap sample)。这就像是给历史日志复印了一份,但带有一个转折:它随机挑选一些条目进行两次复制,并完全忽略另一些条目,从而创造出一个略有不同的、“如果……会怎样”版本的过去。这个被冻结的侦探随后观察这个略微扭曲的版本,并对最佳路径做出猜测。因为历史日志发生了细微的变化,侦探的猜测也会随之改变。通过重复这个过程——打乱线索、询问侦达、挑选最佳猜测——计算机创建了一种能够自然探索新路径的策略,而无需从头开始重新训练侦探。

为了让效果更好,团队还添加了一个特殊的“臂-上下文”(arm-context)功能。想象一下,你的飞船有很多种不同的引擎(动作)可以使用。通常情况下,计算机会将每个引擎视为一个独立的、孤立的机器。但这种新方法将引擎视为一个团队。它使用了一种“乘法”映射,让侦探能够看到当前的状况(上下文)是如何与每一个引擎同时发生相互作用的。这意味着,如果侦探学到了关于“速度”引擎在风暴中表现如何的知识,它可以立即将这一智慧应用到“转向”引擎上。这就像一位厨师,在了解了盐如何影响番茄之后,立即就能知道盐会对蘑菇产生什么影响,而不是必须对每种蔬菜都进行单独试味。

研究人员在各种具有挑战性的谜题上测试了这个想法,从预测蘑菇是否有毒到识别手写数字。结果发现 BC-ICL 是一个明星选手。在许多情况下,它犯错更少(这是一个被称为“遗憾值/regret”的指标),比那些依赖线性数学或从头训练复杂神经网络的传统方法表现得更好。例如,在名为“Mushroom”的数据集上,这种新方法比流行的神经网络方法减少了 85% 的错误。更令人印象深刻的是,它的效率极高;通过使用一种智能方式来挑选要查看的历史日志(例如只记住最近的航行或最相似的航行),尽管它进行了更复杂的思考,但运行速度几乎与旧方法一样快。

然而,论文也划定了一条清晰的界限。他们测试了如果侦探每次都只猜测“最佳”路径而不打乱历史记录(即“贪婪”策略)会发生什么。结果显示,这种贪婪策略经常失败,容易过早陷入错误的路径且无法恢复。同样,仅仅依靠侦探自身的确定性来引导选择,也无法超越这种新方法。论文指出,神奇之处不仅在于侦探的大脑,更在于在征求意见之前“搅动线索”的行为。研究人员基于他们在八个不同数据集上的模拟实验,对这些结果充满信心,但他们也指出,这种方法在很大程度上取决于侦探是否拥有正确类型的预训练。如果侦探过去的训练内容与当前的星系不匹配,该方法可能会遇到困难。尽管如此,对于合适类型的数据,这种“摇晃并猜测”的策略提供了一种强大且实用的方法,可以将一个静态的、预训练的模型转化为一个动态的、具有探索能力的决策者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →