FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking
FinRAG-12B 是一个经过生产验证、数据高效的 120 亿参数框架,它结合了专用训练流程与校准后的拒绝机制,为超过 40 家金融机构提供高度准确、有据可依且成本效益高的问答服务,其在引用质量和查询解决方面优于 GPT-4.1,同时显著降低了延迟和运营成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在为一家银行招聘一名新助理。你需要一个极其聪明、对银行规则了如指掌,且——最重要的是——从不凭空捏造的人。如果不知道答案,他们必须说“我不知道”,而不是胡乱猜测并给出可能导致银行陷入麻烦的错误财务建议。
本文介绍了FinRAG-12B,这是一款专为上述工作设计的专用人工智能助手。以下是作者如何构建它以及它为何有效,以通俗易懂的方式解释。
问题:过于“讨好”的助理
标准人工智能模型(比如你在线聊天的那些)擅长写故事或编写代码,但在银行业有一个坏习惯:它们过于急于取悦用户。如果你问了一个它们无法从记忆中回答的问题,它们往往会编造一个听起来合理的答案。在银行,这是危险的。如果客户询问抵押贷款罚款,而人工智能猜错了,可能会导致诉讼或资金损失。
解决方案:打造聪明、诚实助理的“配方”
团队创建了一个拥有 120 亿参数的 AI(可以将其想象为一个非常大但并非巨大的大脑),并使用特定的“配方”对其进行训练,以解决这些问题。他们并没有只是喂给它海量的数据,而是精心策划了一个高质量、较小的数据集(仅 1.43 亿个“标记”或单词),以教会它三项特定技能:
1. “引用”技能(展示你的推导过程)
想象一个学生在参加考试。普通的人工智能可能只会写出答案。FinRAG-12B 被训练成像一个必须展示推导过程的学生。
- 他们是如何做到的: 他们创建了一个训练流程,要求 AI 仅使用提供给它的特定文档(如银行政策手册)来回答问题。
- 结果: 当 AI 回答时,它会指出文档中支持其答案的确切句子。它学会了说“根据政策第 4 页,费用为 50 美元”,而不是仅仅猜测。在测试中,它在这方面的表现甚至优于最先进的商业 AI 模型。
2. “诚实”技能(知道何时停止)
这是最关键的部分。团队意识到,如果 AI 仅针对它能回答的问题进行训练,它将永远学不会说“我不知道”。
- 类比: 想象一位老师只问学生知道答案的问题。学生将永远学不会承认无知。
- 修正: 团队故意向 AI 提供了 22% 的问题,这些问题的答案不在提供的文档中。他们教导 AI,在这些情况下,正确的答案是“我不知道”。
- 结果: AI 学会了“校准”。当它不确定时,它会拒绝回答(12% 的情况),这比基础模型(95% 的情况会猜测)更安全,也比其他过于频繁拒绝回答的模型(20% 的情况)更少令人烦恼。
3. “课程”学习(对 AI 进行学校教育)
他们没有一次性将所有数据灌输给 AI。他们采用了一种“课程”方法,就像学校系统一样:
- 第一阶段(普通学校): 他们使用开源数据向 AI 教授通用的金融语言。这为其奠定了坚实的基础。
- 第二阶段(专业训练): 然后,他们将其引入真实的私人银行对话和特定规则。
- 为何重要: 如果随机混合这两种类型的数据,AI 会感到困惑且表现不佳。通过分阶段教学,它先学习了规则,然后学习如何将其应用于现实生活。
现实世界结果:“现场测试”
作者不仅是在实验室中测试了这一点;他们将其部署在40 多家金融机构中。以下是发生的情况:
- 更多问题得到解决: 新 AI 成功回答了比旧系统多 7.1% 的客户问题,且无需人工介入。
- 速度与成本: 它比使用顶级商业 AI API 快 3 到 5 倍。更重要的是,其运行成本低 20 到 50 倍。
- 类比: 使用旧的商业 AI 就像为了去杂货店短途旅行而乘坐私人飞机。FinRAG-12B 就像驾驶一辆可靠、高效的电动汽车。它能让你更快到达目的地,且价格仅为前者的一小部分。
- 客户满意度: 虽然单个回答的质量没有发生巨大变化,但由于更多的问题得到了成功解决,客户总体上感到更满意。
总结
FinRAG-12B 是一款经过专门训练的银行 AI,旨在做到诚实、有据可依且高效。通过教导它引用来源并承认不知道答案,作者创建了一个对银行更安全、运行成本更低,且实际上比“现成”替代方案能解决更多客户问题的系统。
关于局限性的说明: 作者谨慎地指出,这是专门针对银行问题(如贷款和账户)进行测试的。他们并不声称它目前适用于股票交易或保险,并且由于隐私法律,他们无法分享其私有训练数据,尽管他们确实分享了其公开的训练方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。