Validating Large Language Model Extraction of Actuarial Variables from Unstructured Claims Documents
本研究评估了一个用于从工伤赔偿索赔中提取14个精算变量的大型语言模型流水线,结果显示其与人工审核者之间存在中度总体一致性(二次加权Kappa系数为0.53)以及各维度间的显著差异性,这强调了在正式验证前进行校准和分阶段部署的必要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个庞大的保险理赔文件库。这些文件非常杂乱:其中包含手写的医生笔记、电话通话记录、法律信函和医疗记录。几十年来,保险专家(精算师)不得不通过手工阅读这些杂乱的文件,来确定他们未来可能需要预留多少资金。这既缓慢、昂贵,又容易产生人为错误。
这篇论文提出了一个简单的问题:一个超级聪明的计算机(大语言模型,简称 LLM)能否像人类一样,从这些杂乱的文件中提取出精算师所需的特定数字和事实?
以下是他们实验的简要说明:
实验设置:“虚构”图书馆测试
研究人员不想冒风险去测试真实的人类隐私医疗数据,因此他们构建了一个模拟图书馆。他们使用计算机程序生成了 20 份“虚构”的保险理赔文件。因为这些文件是由计算机创建的,研究人员掌握了这些文件中每一个事实的“正确答案”(即标准答案)。
他们将这些虚构文件输入到他们的 AI 系统中。AI 的任务是提取 14 个特定的信息点,例如“伤势有多严重?”或“是否存在诉讼风险?”
评判者:人类审核员
为了观察 AI 的表现是否达标,他们聘请了两名专家级人类审核员(拥有高级学位的药剂师)来为 AI 的工作打分。他们使用了一份包含 10 个不同类别的成绩单,例如:
- 相关性(Relevance): AI 谈论的是否是正确的话题?
- 准确性(Accuracy): 它获取的事实是否正确?
- 幻觉(Hallucination): AI 是否编造了文件中不存在的事实?
- 缺失信息(Missing Info): AI 是否忘记提到了某些重要的信息?
如果两名人类评判者之间的分歧很大(在 5 分制中超过 2 分),则由第三名评判者介入做出最终裁定。
结果:“好、坏与怪”
1. 总体得分:“还可以,但不完美”
两名评判者在给出完全相同的分数方面,达成一致的比例仅为 51%。当考虑到他们“接近”(误差在 1 分以内)的情况时,他们的达成一致的比例为 81%。在统计学领域,这被视为**“中等”程度的一致性**。这就像两位天气预报员都预测会有雨,但一个说是“毛毛细雨”,另一个说是“暴雨”。
2. 好消息:AI 擅长基础工作
评判者在 AI 是否具有相关性(谈论正确话题)以及恰当性(表达清晰)方面几乎达到了完美的一致。如果 AI 说“患者腿部骨折”,评判者都会认为这是正确的课题。
3. Bad News:AI 在“缺失什么”和“什么是假的”方面表现挣扎
这是评判者争论最激烈的地方。
- 缺失信息: 一位评判者可能认为 AI 遗漏了一个关键细节,而另一位则认为 AI 已经涵盖了所有内容。他们的分歧率达到了 40%。这就像两个人在看拼图;一个人认为缺了一块,而另一个人认为拼图已经完整了。
- 幻觉: AI 有时会编造事实。评判者很难就这些编造的事实到底“有多严重”达成一致。
- 语境(Context): AI 有时会误解医学术语,评判者也无法就 AI 到底有多困惑达成共识。
4. “严厉”的评判者
其中一位人类评判者始终比另一位更严格。当他们产生分歧时,第三名评判者(决胜者)在 15 次中有 10 次站在了“宽松”的评判者(即给分较高的那位)一边。这表明,“严厉”的评判者过于谨慎,或许是太担心那些其实并不存在的缺失情况了。
这对未来意味着什么?
研究人员根据他们的发现划定了一条清晰的分界线:
- “分诊”区(目前是安全的): AI 足以可靠地用作分类器。想象一个邮件收发室,AI 扫描一堆信件并说:“嘿,这封看起来很紧急,把它放在人类的桌子最上面。” AI 擅长识别明显的事物。
- “资金”区(尚未准备就绪): AI 还不具备直接进行保险公司需要预留多少资金的最终计算的能力。因为 AI 有时会遗漏细节或捏造事实,而且人类甚至无法就这些错误是否发生达成共识,所以你现在还不能信任 AI 独立完成最终的数学计算。
核心结论
论文的结论是,我们需要更好地校准我们的人类评判者,然后才能信任 AI。目前,AI 就像是一个能承担繁重阅读工作的实习生,但仍需要资深专家来复核最终的数字,特别是要确保实习生没有遗漏任何东西或凭空捏造。
研究人员还指出,AI 的“置信度评分”(它自己给出的表示“我有 90% 的把握!”的数字)并不是很有用,因为它总是很高,即使在出错的时候也是如此。这就像一个学生,即使考了 C,也会总是说“我确信我拿了 A”。
简而言之:这项技术很有前景,在排序和标记理赔方面表现良好,但在能够被信任处理实际的资金计算之前,它还需要更多的训练和更好的人类监督。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。