Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting
本文提出并评估了一种用于小型商业保单直通核保的智能体 AI 框架,证明了结合了针对性检索、第三方数据校验和显式规则评估的多智能体系统,在需要透明度和可审计性的复杂场景中,其表现优于单 LLM 和朴素 RAG 基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营一家规模巨大、速度极快的披萨店。每天,都有数百人送来订单。有些订单很简单:“只要芝士,不要洋葱。”有些则很棘手:“我要意式腊肠,但前提是这些腊肠必须来自特定的农场,而且我需要知道那个农场是否在50英里以内,但客户忘了在单子上写下农场的名称。”
在过去,你的店使用一份僵化的清单。如果单子上没写“意式腊肠”,你就没法做这块披萨;如果写了,你就照做。但现实生活是混乱的。人们可能会写下“我喜欢来自街角那个农场的辣肉”之类的话,而不是填写标准的表格。
这篇论文是关于一种新型的保险公司“厨房经理”(专门针对被称为BOP的小型商业保单)。作者 Robert Richardson 及其团队想要观察智能体AI(Agentic AI)——这是一个术语,指一种聪明的、多步骤的机器人助手——是否能比旧方法更好地处理这些混乱的订单。
三位厨房经理
为了进行测试,他们构建了一个模拟厨房(一个由计算机生成的数据构成的虚拟世界,而非真实的客户订单),其中包含 635 份不同的“申请”(即披萨订单)。他们测试了三种处理方式:
- 单LLM厨师(“一次性通过”型厨师): 这是一个超级聪明的机器人,它阅读订单和规则手册,然后立即大喊“是!”或“否!”。它很快,但它不会停下来思考自己是否缺少了某个环节。它只是根据眼前看到的东西进行猜测。
- RAG厨师(“图书管理员”型厨师): 这个机器人更聪明一些。在喊出答案之前,它会跑向图书馆(一个规则数据库)去寻找与订单匹配的具体规则。它更擅长寻找事实,但它仍然只是阅读书籍并给出答案。它并没有真正去规划下一步该做什么。
- 智能体厨师(“队长”型厨师): 这不仅仅是一个机器人,而是一个由三个专业人员组成的团队,他们相互交流。
- 员工 1 查看订单并说:“这看起来很简单,”或者“这看起来很奇怪,”或者“我缺少信息。”
- 员工 2 在信息缺失时介入。它会说:“嘿,客户没写建筑面积,但让我们检查一下我们的外部数据库,看看能否找到它。”
- 员工 3 是“思考者”。如果订单涉及数学计算(例如:“客户有一个 12,000 平方英尺的建筑,但只有一半用于杂货;那么杂货部分是否在 5,000 平方英尺以下?”),这个员工会进行数学计算并核对规则。
- 如果他们仍然无法搞定,队长会说:“停!我们需要人类来看看这个。”
重大发现
论文表明,**智能体厨师(团队)**在处理复杂情况时表现最好,能获得最正确的答案。
以下是他们在模拟实验中的数据结果:
- 当订单简单时,三位厨师的表现都不错。
- 但当订单变得棘手(例如需要进行数学计算或寻找缺失信息)时,智能体厨师成为了明显的赢家。
- 对于信息缺失但可以通过其他渠道找到的情况,智能体厨师的正确率达到了 88.2%。而单次通过型机器人仅为 80.3%。
- 对于信息缺失且无法找到的情况(即“无法解决的谜题”),智能体厨师能做到在 84.3% 的情况下知道停下来请求人类协助。而单次通过型机器人仅在 56.7% 的情况下知道停下来。
最重要的发现是,智能体系统更擅长知道何时说“我不知道”。其他的机器人试图进行猜测,并且经常出错。智能体团队意识到:“我们没有足够的证据,所以让我们找个真人。”这正是高风险工作(如保险业)中所需要的。
这个系统“不是”什么
作者非常明确地说明了这不是什么。
- 它不是神奇的心灵感应者。 论文明确反对认为 AI 可以像人类一样“思考”的观点。这些机器人没有感情或真正的头脑;它们只是在遵循统计模式和规则。
- 它不是人类的替代品。 论文认为,目标不是解雇所有的核保员(人类决策者)。相反,目标是让机器人处理那些简单的、以及“我需要去查一下”的事情,从而让专业人员能够专注于那些真正困难、复杂的案例。
- 它还不是在现实世界中经过验证的事实。 结果来自于一个合成数据集(由计算机创建的虚拟世界)。作者承认,现实世界的保险数据是混乱、嘈杂且充满意外的,他们的虚拟数据可能无法捕捉到这些特征。因此,虽然结果令人鼓舞,但它们是模拟的,尚未在真实的保险公司中得到证实。
权衡:速度 vs. 智慧
这里有一个代价。变聪明需要时间。
- 单LLM厨师是最快的,每份订单约耗时 1.64 秒。
- 智能体厨师是最慢的,每份订单约耗时 4.72 秒。
论文建议,对于棘手的订单,这种额外的时间是值得的,因为它可以防止错误。但对于那些超级简单的订单,你可能并不需要整个团队。
总结
这篇论文表明,如果你想实现保险决策的自动化,你不应该只使用一个快速猜测的单一机器人。相反,你应该建立一个机器人团队,他们可以停顿、查阅笔记、进行数学计算、查找缺失的事实,并在陷入困境时承认自己无法处理。
在他们的模拟厨房中,这种“智能体”方法比其他方法犯错更少,并且能为他们的决策提供更好的理由。然而,作者提醒我们,这只是一个概念验证,使用的是虚拟数据。在我们信任这些机器人处理真实的资金和业务之前,我们需要在混乱的现实世界中测试它们,并确保人类始终掌握最终决定权。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。