本页收录的每篇论文,都有至少一位原作者阅读并参与了我们的通俗解释——或是确认其准确无误,或是提出修正意见并由我们随后采纳。作者的确认并不等同于对每一句话的正式背书,但说明该解释已经过论文作者的审视。

1209 篇论文已由作者审阅 · 741–750 / 1209

🤖 AI

AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning

该论文介绍了 AXIOM,一种“信任优先”的神经符号架构,它仅利用语言模型将自然语言问题规范化为确定性的计算机代数系统流水线,在数学基准测试中实现了 94.36% 的正确率和 100% 的信任度(零置信错误),同时确保系统的改进永远不会导致先前已验证结果的回退。

Alessio Bruno2026-06-02✓ Author reviewed
💻 computer science

Physics-Informed Deep Learning for Entropy Prediction in Heterogeneous Systems: Thermodynamic and Information-Theoretic Case Studies

本文引入了一种统一的物理信息深度学习框架,该框架通过强制执行微分方程残差和信息论边界,来准确预测热力学与金融系统中的熵,实现了零第二定律违背、卓越的数据效率,并具备通过几何分析识别相不稳定性(phase instabilities)的能力。

Biswajeet Sahoo, Debadutta Patra2026-06-02✓ Author reviewed
💬 NLP

DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations

本文引入了 DECK,一种全新的 2x2 分类法,该分类法基于样本间一致性和标记级置信度的检测特征对大语言模型(LLM)幻觉进行分类,揭示了特定的错误类型(漂移、根深蒂固、虚构、纠缠)需要不同的检测方法,并暴露了一个普遍的盲点,即在知识缺口输入下,那些具有高置信度且可重复的编造内容,对于目前的输出级不确定性量化方法而言仍是无法检测的。

Mohit Singh Chauhan2026-06-02✓ Author reviewed
💻 computer science

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

本文介绍了 ChartArena,这是一个全面的双语基准测试,涵盖了数字、印刷和手绘场景下的八类图表家族,并采用了一种与格式无关的评估协议,旨在系统地评估并揭示 26 个领先的多模态大语言模型在解析各类图表时的当前能力与局限性。

Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuo (…)2026-06-02✓ Author reviewed