Validating Large Language Model Extraction of Actuarial Variables from Unstructured Claims Documents
本研究评估了一个用于从工伤赔偿索赔中提取14个精算变量的大型语言模型流水线,结果显示其与人工审核者之间存在中度总体一致性(二次加权Kappa系数为0.53)以及各维度间的显著差异性,这强调了在正式验证前进行校准和分阶段部署的必要性。
2550 篇论文
本研究评估了一个用于从工伤赔偿索赔中提取14个精算变量的大型语言模型流水线,结果显示其与人工审核者之间存在中度总体一致性(二次加权Kappa系数为0.53)以及各维度间的显著差异性,这强调了在正式验证前进行校准和分阶段部署的必要性。
本研究表明,一种基于 Transformer 的深度学习模型在预测电网稳定性方面优于传统的机器学习算法,在二分类和回归任务中均实现了高准确度,同时为实现韧性智能电网这一全球可持续发展目标提供了支持。
本研究指出,深色皮肤上较低的病灶-背景对比度会产生结构性类别重叠,导致人工智能皮肤科模型系统性地过度预测恶性程度并为深色皮肤患者产生过多的转诊需求,这是一种即使在修正了混杂类别分布后依然存在的公平性瓶颈,且通过按肤色进行类别平衡而非肤色调节能得到最好的缓解。
本研究提出了一种利用集成方法和可解释人工智能(XAI)的机器学习框架,通过分析系统指标,提前最多15分钟预测数据仓库故障,从而通过主动异常检测和自动化根因分析来减少停机时间。
通过一项全面的蒙特卡洛调查,本文证明了虽然训练样本量是 SHAP 归因保真度的主要驱动因素,但常见的类别不平衡处理方法往往会扭曲特征排名和量级,从而导致作者建议在优先考虑 SHAP 可解释性时,应避免使用重平衡,而倾向于使用类别权重。
本文介绍了 CLHA,一种用于权重共享混合专家(Mixture-of-Experts)Transformer 模型训练后量化的跨层 Hessian 聚合方法,该方法通过结合共享层之间的 Hessian 统计信息来最小化总重构误差,在显著优于现有逐层校准方法的同时,还解决了 Hessian 估计中关键的实现陷阱问题。
本文介绍了代理式标注语言(Agentic Annotation Language, AAL),这是一种新型带内标注系统,它能够为自主智能体实现即时上下文注入,与传统的全局规则文件相比,在显著降低 Token 消耗和上下文污染的同时,仍能保持对特定领域约束的高合规性。
本文提出了首个针对乌尔都语虚假新闻检测的跨数据集泛化研究,揭示了在 Ax-to-Grind 数据集上训练的模型在应用于 Notri-Fact 数据集时会出现灾难性的失败,其原因是训练数据中存在的系统性长度混淆导致了捷径学习,从而凸显了当前低资源自然语言处理领域在数据集构建和评估实践中的关键缺陷。
本文介绍了级联渐进式蒸馏网络(CPDN),这是一种新型深度学习框架,它利用来自 CatBoost 教师模型的知识蒸馏来克服优化停滞和不可微问题,从而在异构表格数据上实现了最先进的分类性能。
本文表明,采用 QMIX 的集中式训练与分布式执行(CTDE)方法在智能城市电动汽车充电协调方面显著优于独立 Q 学习(IQL)及非强化学习基准模型,在有效管理部分可观测性和交通动态性的同时,实现了更高的接受率和成功概率。