💻 computer science

Validating Large Language Model Extraction of Actuarial Variables from Unstructured Claims Documents

本研究评估了一个用于从工伤赔偿索赔中提取14个精算变量的大型语言模型流水线,结果显示其与人工审核者之间存在中度总体一致性(二次加权Kappa系数为0.53)以及各维度间的显著差异性,这强调了在正式验证前进行校准和分阶段部署的必要性。

Robert Lieberthal, Vietbao Phan, Jawand Singh, Elizabeth Sottung, Richard Tran2026-06-25
💻 computer science

Contrast-Induced Class Overlap as a Fairness Bottleneck in Dermatological AI: Evidence from HAM10000

本研究指出,深色皮肤上较低的病灶-背景对比度会产生结构性类别重叠,导致人工智能皮肤科模型系统性地过度预测恶性程度并为深色皮肤患者产生过多的转诊需求,这是一种即使在修正了混杂类别分布后依然存在的公平性瓶颈,且通过按肤色进行类别平衡而非肤色调节能得到最好的缓解。

Aaron Ajit2026-06-25
💻 computer science

Cross-Dataset Generalization in Urdu Fake News Detection: An Empirical Study with XLM-RoBERTa and a Length Confound Analysis

本文提出了首个针对乌尔都语虚假新闻检测的跨数据集泛化研究,揭示了在 Ax-to-Grind 数据集上训练的模型在应用于 Notri-Fact 数据集时会出现灾难性的失败,其原因是训练数据中存在的系统性长度混淆导致了捷径学习,从而凸显了当前低资源自然语言处理领域在数据集构建和评估实践中的关键缺陷。

Muhammad Abdullah Haroon2026-06-25
💻 computer science

Human-Centric Cooperative MARL for Reliable EV Charging Coordination in Smart Cities: A Controlled Multi-Seed Comparison of Centralised and Decentralised Training

本文表明,采用 QMIX 的集中式训练与分布式执行(CTDE)方法在智能城市电动汽车充电协调方面显著优于独立 Q 学习(IQL)及非强化学习基准模型,在有效管理部分可观测性和交通动态性的同时,实现了更高的接受率和成功概率。

Nour-Eddine Moumni2026-06-25