Retrieval-Augmented Large Language Models as Components of Cognitive Computing architecture for Regulatory Knowledge Management
本文证明,将本地部署的大型语言模型与检索增强生成(RAG)技术相结合,可在消费级硬件上将其转化为可靠的认知计算组件,从而在无需模型重训练的情况下,提升事实准确性、可审计性以及动态监管知识管理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不再仅仅是处理数字,而是能真正“思考”复杂规则的世界,就像律师阅读合同或医生检查诊断一样。这就是认知计算(Cognitive Computing)的领域,该领域正试图构建能够模仿人类推理而非仅仅遵循僵化指令的机器。在这股新浪潮的核心是大语言模型(LLMs),它们就像是超级聪明、博学多才的机器人,可以通过预测句子中的下一个词来进行写作、总结和聊天。然而,这些机器人有一个棘手的习惯:有时它们会极其自信地胡编乱造,这种故障被称为“幻觉”。为了解决这个问题,科学家们使用了一种叫做**检索增强生成(RAG)**的技巧。把 RAG 想象成给机器人一张借书证,并规定一条严格的规则:“除非你先找到书中证明该观点的确切页面,否则你不准回答问题。”本文探讨了将这两个想法——聪明的机器人与严格的图书馆规则——结合起来,是否可以创建一个可靠的系统来管理复杂的法律规则,同时将数据安全地保留在公司内部,而不是发送到云端。
由波兰 WSB 大学 Dariusz Nowak-Nova 领导的研究团队,旨在测试这种“机器人加图书馆”的组合能否将标准的 AI 转变为一个值得信赖的认知计算系统组件。他们并没有使用通常执行此类任务所需的大规模、昂贵的超级计算机。相反,他们在一部配备 Apple M4 处理器和 24 GB 内存的标准消费级笔记本电脑上运行了实验,使用了名为 Bielik 和 PLLuM 的开源波兰语语言模型。他们建立了一个本地的“认知架构”,使 AI 能够与存储在电脑上的 17,377 份法律文件(总计 22.84 GB)组成的庞大数字图书馆进行对话。这种设置允许 AI 在回答问题之前实时查阅具体的法律条文,而不是仅仅依赖于它在训练期间所记忆的内容。
团队向 AI 提出了四个关于波兰法律中“房地产”定义的问题,首先让 AI 根据自身的记忆进行回答,然后让它在使用 RAG 系统搜索法律文件后进行回答。结果非常引人入胜。当 AI 使用 RAG 系统时,它的回答变得更加精准,且充满了正确的法律术语,听起来更像是一位资深的律师,而不是一本通用的百科全书。文本变得更加密集和专业,而这正是处理严谨法律时所需要的。例如,经过 RAG 增强后的回答正确引用了《民法典》及其他法案的具体条款,而单纯的 AI 有时则给出模糊或不完整的总结。
然而,研究也发现该系统目前尚不完美。虽然 RAG 系统改善了回答的“风格”和“特异性”,但并未完全消除错误。在其中一个案例中,使用 RAG 系统的 AI 犯了一个根本性的法律错误,暗示在某些条件下房地产可以是“动产”,这违背了财产法的基本定义。研究人员指出,虽然 AI 能够找到正确的文档,但它有时在理解“定义”一个概念的法律与仅仅为不同目的(如税务)而“使用”该概念的法律之间的区别时会感到困难。这表明,虽然该系统在寻找信息方面做得越来越好,但它仍需要帮助来理解规则背后的深层逻辑。
最终,论文表明,将这些 AI 模型部署在带有 RAG 系统的本地计算机上,是处理监管知识的一种强大方式,且无需承担数据泄露到云端的风险。它将 AI 从一个猜测答案的“黑箱”转变为一个可以被审计、检查和随着法律变化而更新的“认知模块”,且无需重新训练整个模型。作者得出结论,这种方法是构建可靠的法律和监管工作 AI 助手的一个充满前景的步骤,前提是我们必须记住,AI 是一个用于查找和组织信息的强大工具,但在验证最终逻辑时仍需要人类专家。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。