← 最新论文
💬 NLP

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

该论文介绍了 INS-ActBench,这是一个包含来自 16 个精算协会的 12,000 多个问题的综合基准测试,旨在评估大语言模型在知识、长上下文案例推理以及基于工具的实践方面的能力,并揭示了尽管前沿模型在标准化知识方面表现出色,但在复杂的专业工作流方面仍显著落后。

原作者: Changyu Chen, Chenwei Lin, Xian Xu

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Changyu Chen, Chenwei Lin, Xian Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人成为一名金融奇才。你已经向它展示了如何阅读金钱术语词典,以及如何进行基础数学运算。但要成为真正的奇才,不仅仅是知道那些咒语;而是要懂得在何时使用它们,在情况复杂时如何将它们混合在一起,并拥有稳健的双手,确保在施展咒语时不会把城堡给烧了。这就是**大语言模型(LLMs)**的世界——这些是能够像人类一样阅读、写作和推理的超级智能计算机程序。长期以来,我们一直在孤立的任务上测试这些机器人:“你能定义这个词吗?”或者“你能解出这道数学题吗?”但在现实世界中,专业人士并非孤立工作的。他们必须阅读一份百页的合同,找到那个至关重要的微小条款,计算风险,然后使用电子表格或代码来证明他们的答案是正确的。这篇论文提出了一个重大问题:这些人工智能奇才真的能胜任整项工作,还是仅仅擅长背诵闪卡?

于是有了 INS-ActBench,这是由复旦大学的研究人员创建的一个全新的、大规模的“期末考试”,旨在测试人工智能在**精算学(Actuarial Science)**这一特定高风险职业上的表现。你可以把精算师想象成一名专业的风险侦探,为保险公司工作。他们利用数学、统计学和经济学来判断发生某些坏事(如车祸或房屋火灾)的可能性有多大,以及公司需要储备多少资金来支付这些损失。这是一份需要了解规则、阅读关于现实世界灾难的复杂故事,并进行精确到不容出错的计算的工作。研究人员构建了一个包含 12,050 道题目的题库,这些题目取自全球精算师参加的真实考试。他们不仅仅是在问简单的常识;他们设计了这项测试,以观察人工智能是否能够处理三个不同难度的水平:

  1. 闪卡(INS-Act-Know): AI 能记住定义和公式吗?
  2. 推理小说(INS-Act-Case): AI 能阅读一段关于公司财务的长篇复杂故事,找到隐藏的线索,并对未来做出明智的预测吗?
  3. 工作坊(INS-Act-Practice): AI 真的能通过编写正确的计算机代码或电子表格公式来获得一个可供检查的数字吗?

当研究人员让九种不同的 AI 模型接受这场严苛的测试时,结果既有“哇”也有“哎呀”。AI 模型在第一个水平上表现得非常出色。它们精通闪卡,在标准化知识问题上的得分往往高于人类专家。事实证明,如果你只是要求 AI 背诵一条规则或解一道简单的数学题,它就是一个天才。

然而,一旦测试变得复杂,这些机器人就开始踉跄了。当 AI 需要阅读一段冗长且复杂的保险案例(即“推理小说”水平)时,它们的得分大幅下降。它们难以将故事的不同部分联系起来。更糟糕的是,当它们进入“工作坊”并实际编写代码或电子表格公式以产生最终数字时,它们无法可靠地完成任务。研究发现,虽然 AI 可以谈论数学,但它往往无法以一种一致且可验证的方式来执行数学运算。

研究人员还发现,AI 的表现会根据规则的来源而改变。美国的、英国的和日本的保险法律各不相同。对于在训练数据中经常看到的“标准”规则,AI 模型表现得很好,但当问题来自具有不同地方法规的国家时,它们就会感到困惑。他们还发现,AI 最大的失败通常不是因为忘记如何使用工具(如计算器),而是因为它们正确地使用了工具,却将错误的逻辑或公式应用到了问题上。

简而言之,这篇论文表明,虽然人工智能已成为精算知识的优秀百科全书,但它还不是一个可靠的专业助手。它可以通过笔试,但还没准备好坐在办公室里做出那些保障保险公司安全的最终决策。研究人员得出结论,要让 AI 真正协助这一领域,它需要更好地在长篇故事中建立联系,并在执行复杂的、分步骤的工作流时,避免犯下细小但代价高昂的错误。目前来看,人类专家仍然是那个握笔的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →