AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning
该论文介绍了 AXIOM,一种“信任优先”的神经符号架构,它仅利用语言模型将自然语言问题规范化为确定性的计算机代数系统流水线,在数学基准测试中实现了 94.36% 的正确率和 100% 的信任度(零置信错误),同时确保系统的改进永远不会导致先前已验证结果的回退。
原作者已查阅我们通俗解释的论文。
本页收录的每篇论文,都有至少一位原作者阅读并参与了我们的通俗解释——或是确认其准确无误,或是提出修正意见并由我们随后采纳。作者的确认并不等同于对每一句话的正式背书,但说明该解释已经过论文作者的审视。
1209 篇论文已由作者审阅 · 741–750 / 1209
该论文介绍了 AXIOM,一种“信任优先”的神经符号架构,它仅利用语言模型将自然语言问题规范化为确定性的计算机代数系统流水线,在数学基准测试中实现了 94.36% 的正确率和 100% 的信任度(零置信错误),同时确保系统的改进永远不会导致先前已验证结果的回退。
本文提出了“稳定性蒸馏假说”,认为生命的起源是一个由稳定性差异驱动的选择性富集过程,这一过程是必然且统一的,它在逻辑上必然导致信息的自发出现、RNA的选择、区室化以及细胞与病毒的共同起源,而无需依赖于极低概率的偶然事件。
本文揭示了最长递增子序列问题尽管可以在多项式时间内求解,但在低温下却表现出玻璃动力学和热力学稀疏性,即局部搜索算法由于缺乏可达构型而非能量势垒而陷入亚稳态。
本文表明,外部信息流的策划与排序可以系统性地引导大语言模型智能体做出对抗性决策,尤其是在其处于不确定状态时,这揭示了安全评估必须审计上游的推荐层,而非仅仅孤立地测试模型本身。
本文证明了在对协议导数存在物理约束的弱驱动系统中,最小化不可逆功的最优解为恒定驱动速度和线性协议,这一结果通过一个移位特征值方程推导得出,并经由数值遗传规划进行了验证。
本文引入了一种统一的物理信息深度学习框架,该框架通过强制执行微分方程残差和信息论边界,来准确预测热力学与金融系统中的熵,实现了零第二定律违背、卓越的数据效率,并具备通过几何分析识别相不稳定性(phase instabilities)的能力。
本文表明,低资源场景下的安全性失效源于决策校准的失调而非缺乏有害性表示,并提出了一种通过仅使用少量目标语言示例来重新校准现有高资源安全性闸门的方法来修复这一问题。
本文首次通过利用提霍诺夫正则化、收缩性质和 R-连续性理论,确立了在非可和误差条件下,用于求解希尔伯特空间中单调包含问题的实用不精确近端点算法与 Tseng 算法的收敛性。
本文引入了 DECK,一种全新的 2x2 分类法,该分类法基于样本间一致性和标记级置信度的检测特征对大语言模型(LLM)幻觉进行分类,揭示了特定的错误类型(漂移、根深蒂固、虚构、纠缠)需要不同的检测方法,并暴露了一个普遍的盲点,即在知识缺口输入下,那些具有高置信度且可重复的编造内容,对于目前的输出级不确定性量化方法而言仍是无法检测的。
本文介绍了 ChartArena,这是一个全面的双语基准测试,涵盖了数字、印刷和手绘场景下的八类图表家族,并采用了一种与格式无关的评估协议,旨在系统地评估并揭示 26 个领先的多模态大语言模型在解析各类图表时的当前能力与局限性。