Test-Time Graph Search for Goal-Conditioned Reinforcement Learning
本文介绍了测试时图搜索(TTGS),这是一种轻量级且无需训练的规划封装方法,它利用现有离线目标条件强化学习策略固有的几何结构,在无需额外监督或参数更新的情况下,显著提升长程任务的成功率。
原作者已查阅我们通俗解释的论文。
本页收录的每篇论文,都有至少一位原作者阅读并参与了我们的通俗解释——或是确认其准确无误,或是提出修正意见并由我们随后采纳。作者的确认并不等同于对每一句话的正式背书,但说明该解释已经过论文作者的审视。
1221 篇论文已由作者审阅 · 821–830 / 1221
本文介绍了测试时图搜索(TTGS),这是一种轻量级且无需训练的规划封装方法,它利用现有离线目标条件强化学习策略固有的几何结构,在无需额外监督或参数更新的情况下,显著提升长程任务的成功率。
本研究探讨了在存在交易成本的情况下,双资产组合期权的最佳对冲策略,并通过模拟证明,若经风险调整后价值指标判定相关性足够高且交易成本足够低,则使用与标的资产相关但非标的资产的对冲方式可能优于使用正确资产的对冲方式。
本研究证明,虽然 StyleGAN2-ADA 生成的合成脑部 MRI 图像并未在所有模型架构中普遍提升肿瘤分类性能,但在采用 1:1 真实与合成数据比例并结合特征空间过滤时,它们显著提高了 MobileViTV2 的准确率,这表明数据增强效用取决于特定的分类器与数据配置,而不仅仅取决于视觉保真度。
本研究证明,范德华反铁磁体 CrSBr 中的激子共振通过介电响应的玻色子驱动调制瞬态激活标称暗激子,从而为 GHz 磁振子和太赫兹声子集体激发提供了一个统一的宽带光学接口。
通过实施将木星深对流区与浅层天气层隔离或耦合的三维非弹性对流模拟,该研究揭示:Busse 柱驱动赤道超旋转,而位涡均匀化产生高纬度急流并缓慢向极区迁移,其中天气层显著改变了热风平衡与急流排列。
本文通过证明共形软高自旋粒子生成一个与标准子代数不对易的子代数(对于有色粒子则为-代数),从而将引力子和胶子的全息对称代数进行了扩展,该结果经由树阶MHV振幅得到验证,并推广至非零宇宙学常数的情况。
本文提出了一种用于个性化智能体强化学习的统一框架,该框架整合了个性化锚点奖励解耦策略优化(PARPO)、偏好解耦奖励模型以及偏好对齐技能演化图记忆(PSGM),以有效应对异构用户偏好并提升智能体在多样化规划与工具使用场景中的性能。
本文提出了一个形式化框架和三项互补度量,用于量化差分隐私下的数据库不公平性,并提供了隐私保护算法,这些算法在保持强隐私保障的同时,能有效近似非隐私偏见评估。
本文介绍了 BBO-Pile,这是首个包含 3,095 个黑盒函数上超过 500,000 条优化轨迹的大规模开源数据集,并证明了基于该数据进行可扩展预训练的基础模型能够有效学习并模仿黑盒优化策略。
本文表明,对于资源受限的单标签文本分类任务,在最终令牌嵌入上通过分类头对因果大语言模型进行微调,比指令调优具有显著更高的参数效率,同时其性能与指令调优的大语言模型及领域专用 BERT 模型相当或更优。