Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework
本文提出了一种统一的多维行为框架,从正确性、一致性、鲁棒性、逻辑连贯性、效率和稳定性六个不同维度评估大语言模型的推理能力,以揭示关键见解并防止传统仅依赖准确率的指标所忽略的排名错误。
原作者已查阅我们通俗解释的论文。
本页收录的每篇论文,都有至少一位原作者阅读并参与了我们的通俗解释——或是确认其准确无误,或是提出修正意见并由我们随后采纳。作者的确认并不等同于对每一句话的正式背书,但说明该解释已经过论文作者的审视。
1211 篇论文已由作者审阅 · 801–810 / 1211
本文提出了一种统一的多维行为框架,从正确性、一致性、鲁棒性、逻辑连贯性、效率和稳定性六个不同维度评估大语言模型的推理能力,以揭示关键见解并防止传统仅依赖准确率的指标所忽略的排名错误。
本文介绍了 Habermolt,这是一个用于 AI 代理委托审议的公共平台,其中代理人在集体决策中代表人类,并通过代表性、聚合与修订三个维度评估其有效性,以应对可扩展且可信赖的 AI 代表所面临的全新设计与对齐挑战。
本文介绍了概念分配区(CAZ),这是一个将 Transformer 模型中的概念形成重新定义为在残差流连续区域内发生的深度扩展过程的框架,而非局限于单个“最佳”层,该框架利用新指标识别这些区域,并揭示许多概念存在于微妙且多模态的分配区域中,这些区域具有因果活性,却对标准峰值检测方法不可见。
本文首次对基于 Transformer 的菲律宾语 - 英语代码切换语音中的痴呆症检测进行了系统性评估,结果表明,尽管单语模型无法跨语言泛化,但双语微调能有效消除跨语言性能下降,并无论模型架构如何均实现高精度。
本文介绍了 SiST-GNN,这是一种新颖的动态图神经网络,它通过引入跨时间边来增强图结构,将空间与时间消息传递统一为单一操作,从而在多种基准测试中实现了链接预测和节点分类的顶尖性能。
本文介绍了正交瓶颈,这是一种轻量级且与架构无关的机制,它通过固定的正交投影将强化学习表示约束到低维子空间,从理论和实证两方面证明了在最小化维度的同时能够保留并往往提升任务相关的价值函数,并稳定特征几何结构。
本文提出了一种面向串联球面显微手术工具的运动学与传动感知设计框架,该框架包含解析工作空间建模以及基于动力学信息的自锁传动设计方法,并通过在专为玻璃体视网膜手术定制的机器人系统上开展的实验验证了该框架的有效性。
本文系统评估了视觉基础模型在人脸深度伪造检测中的跨域泛化极限,揭示出尽管这些模型在全脸合成检测方面表现优异,但由于预训练范式与线性探针评估结构之间的固有权衡,它们在应对局部编辑技术时却面临困难。
本文提出了一种基于深度Q网络并采用个体奖励函数的能量感知多智能体强化学习模型,旨在提升任务导向型无人机网络的鲁棒性、能效和成功率,特别是在扩大环境规模和增加智能体数量时,相较于传统共享奖励方法具有显著优势。
本文提出了一种统一且分支一致的代换框架,通过将主值反三角函数的指数表示为代数形式,将涉及二次根式的积分转化为有理函数,从而在降低定义域复杂度和表达式膨胀的同时,恢复了欧拉代换和魏尔斯特拉斯代换等经典方法。