When Reward Is Not Grammar: A Reward-Action Validity Audit of Deep Reinforcement Learning for English Inflection
本文引入了一种奖励-动作有效性审计,旨在证明一个声称学习了英语形态学的深度 Q 网络笔记本,实际上由于奖励函数、动作表达能力、状态编码及评估方法的根本缺陷,未能习得语法规则。
2354 篇论文
本文引入了一种奖励-动作有效性审计,旨在证明一个声称学习了英语形态学的深度 Q 网络笔记本,实际上由于奖励函数、动作表达能力、状态编码及评估方法的根本缺陷,未能习得语法规则。
这项实证研究表明,在手势图像分类中,增加卷积神经网络(CNN)的容量并不保证性能的提升,且 Dropout 正则化(尤其是针对架构依赖型的速率)显著优于 L1 和 L2 惩罚,其中一个中等规模的模型达到了 96.66% 的最高准确率。
本文介绍了 LMS-FAIR-India,这是一个来自一所私立印度大学、包含 170 万条 LMS 交互事件的全合成且符合 FAIR 标准的数据集,能够在不使用真实学生数据的情况下实现保护隐私的学习分析研究。
本文通过对 131 起真实世界事件的实证评估,分析了三种主流智能体 AI 风险分类法(OWASP-ASI、MSFT-AIRT 和 NIST AI RMF)的覆盖范围与互补性,旨在为从业者提供基于证据的指导,并识别未来框架修订中的具体空白。
本文提出了一种将变邻域下降算法与蚁群系统相结合的新型模因蚁群算法,用于解决增材制造中的多机调度问题,通过同时优化能耗、完工时间和零件取向,展示了其相对于现有方法的显著效率提升。
本文介绍了曲率感知信息瓶颈(CurvIB)框架,这是一种基于信息几何和曲率-信息对偶定理、具有理论依据的模型压缩技术,它通过统一曲率敏感自适应剪枝、Wasserstein 感知最优量化以及基于最优传输的精度恢复,显著提升了深度学习模型在极端资源约束下的性能。
本研究表明,在 BUSI 数据集上,各种轻量级注意力机制在乳腺超声病灶分割中的性能提升在统计学上微乎其微且低于数据的分辨率,而网络深度和数据泄露(通过检查点选择或近乎重复的数据)所产生的效应则显著更大且可观测。
本文介绍了一个全流程可复现的自然语言处理(NLP)流水线,其中包括一个经过策划的语料库、一个六分类的 ESG 分类体系以及一个经过微调的西班牙语 BERT 分类器,旨在通过一种新颖的“言行差距指数”(Say-Do Gap Index)来量化企业 ESG 修辞与媒体报道中可观察结果之间的分歧,同时解决构念效度与跨语境适用性问题。
这项实证研究表明,针对葡萄牙语临床决策支持,结合了 BM25 与稠密检索的混合检索方法通过利用两者的互补优势,显著优于单一策略方法,同时也验证了基于大语言模型(LLM)的自动化评估以及确定性引用验证,以确保准确性并减少幻觉。
本文介绍了 Brazilian-PHI,这是首个用于检测临床文本中七种巴西个人健康信息的基准测试,证明了带有校验和验证的自定义 Presidio 识别器在准确性、延迟以及对 LGPD 合规性要求方面,显著优于默认工具和大语言模型。