Bayesian Neural Networks versus deep ensembles for uncertainty quantification in machine learning interatomic potentials
本文在 aenet-PyTorch 框架内引入了一种贝叶斯神经网络实现,并系统地比较了其在 TiO 结构上的不确定性量化能力与深度集成(deep ensembles)的差异,旨在为开发可靠的机器学习原子间势函数提供指导。
原作者已查阅我们通俗解释的论文。
本页收录的每篇论文,都有至少一位原作者阅读并参与了我们的通俗解释——或是确认其准确无误,或是提出修正意见并由我们随后采纳。作者的确认并不等同于对每一句话的正式背书,但说明该解释已经过论文作者的审视。
1206 篇论文已由作者审阅 · 571–580 / 1206
本文在 aenet-PyTorch 框架内引入了一种贝叶斯神经网络实现,并系统地比较了其在 TiO 结构上的不确定性量化能力与深度集成(deep ensembles)的差异,旨在为开发可靠的机器学习原子间势函数提供指导。
本文挑战了“输入与表示之间的低互信息意味着几何压缩”这一假设,揭示了两者之间存在一种复杂的非线性关系,其中泛化能力是一个混淆因素,而非直接结果。
该论文介绍了 BabelJudge,一个开源基准测试与可靠性审计框架,它通过对金标准标签进行受控扰动,在多种语言和智能体轨迹上评估 LLM-as-a-Judge 模型,从而揭示出原始准确率指标无法捕捉的隐藏失效模式(如位置偏见和冗长偏见)。
本文通过应用叙事学定义来分析人物塑造的八个复杂维度,研究了由大语言模型生成的故事与人类创作的故事之间的异同,旨在确定人工智能模型是否能产生在多样性和深度上与人类作者相媲美的人物。
本文表明,通过在特定领域数据上进行训练,紧凑且经过任务适配的小型语言模型(参数量在3B以下)在通用及文学关系抽取方面,其表现能显著超越零样本(zero-shot)的前沿大语言模型,从而在无需生成式规模化的情况下,提供一种硬件高效且兼顾隐私的替代方案。
本文表明,通过在理想和非理想天线配置下的共振俯仰角散射,外部发射的螺旋波可以有效抑制 DIII-D 托卡马克中的跑电子增长,同时强调了异常共振会增强跑电子族群,并且对于破裂后应用而言,显著的传播挑战仍然存在。
本文纠正了量子版本空间感知器算法中一个有缺陷的复杂度假设,并提出了两种新的用于感知器学习的量子增强型切割平面算法,这些算法利用 Grover 搜索和量子行走搜索,在理想化条件下建立了改进的复杂度界限。
本文介绍了 SCENIC,这是一个端到端的框架,它能够使规模小于 0.2B 的高效 Transformer 模型部署在资源受限的边缘物联网设备上,用于生成结构化智能家居指令,通过先进的剪枝、量化和硬件感知优化,在显著降低模型大小和推理延迟的同时,实现了近乎完美的准确率(99.0% EM@1)。
OTTER 是一个黑盒红队测试框架,它通过优化提示词以通过极小的标记变化来规避检测,从而展示了基于毒性的 LLM 防御机制的脆弱性,进而实现了攻击成功率的显著提升,并为分类器的加固提供了具有实践意义的见解。
本文通过提出涌现-密度反转(Emergence-Density Inversion, EDI)假说,对标准的自然语言处理(NLP)实践提出了挑战,该假说证明了丢弃职位公告中低密度的“噪声”会忽视新兴职业的关键领先指标,这一点已通过分析数据集中诸如提示词工程师(Prompt Engineer)和 AI 安全研究员(AI Safety Researcher)等新型 AI 相关角色在短时间内迅速趋于稳定的现象得到了证实。