Mint-Agent: Introducing Finance-Native Agentic Foundation Models
本文介绍了 Mint-Agent,这是一个金融原生智能体基础模型家族,它构建于专门的数据引擎、交互框架以及先进的训练流水线之上,在复杂的、可审计的金融任务中实现了最先进的可靠性与可执行性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在金融领域,一个正确的答案很少仅仅是一个数字或一个简单的实事。它是通过一系列严谨的链式反应得出的:寻找正确的文档、确定正确的时间周期、比较不同来源的数值,并进行必须经得起推敲的计算。当人类分析师在这一过程中出错时,他们通常可以追溯步骤以找到逻辑断裂之处。但当人工智能系统尝试执行同样任务时,它往往会产生一个听起来颇具说服力的答案,而这个答案却建立在一个隐藏的错误、对表格的误读,或是一个虽然相关但不具权威性的来源之上。由于缺乏从原始证据到最终结论的清晰、可追溯路径,结果便无法被信任或修正。这种在自信的回答与可验证的真相之间的差距,正是研究人员试图解决的核心挑战,即如何教导机器充当独立的金融调查员。
一组研究人员提出了一种应对此问题的新方法,他们将该系统称为 Mint-Agent。该系统并非仅仅训练计算机去记忆金融事实或猜测正确答案,而是将其设计为一个将每一个结论都视为必须由可追溯证据支撑的“主张”的系统。该系统基于三个主要原则运行:它通过学习现实世界的金融文档来理解行业特定的规则;它使用一个专门的环境,该环境会对其执行的每一次搜索和计算保留永久且可审计的记录;它通过一种过程进行学习,这种过程不仅奖励最终答案,还奖励通往答案的整个过程的正确性。其成果是一系列人工智能模型,它们能够进行长时间、复杂的金融研究,同时保持清晰的证据链,以证明它们是如何得出结论的。
研究人员构建该系统的方法是,首先建立了一个庞大的金融任务库,这些任务源自真实的各类公司报告、市场数据和会计记录。他们将这些任务分为两类。第一类涉及原子技能,例如从表格中提取特定数字或进行标准计算,其证据已然存在。第二类涉及长程执行,即系统必须自行寻找证据,通常需要在较长时间内搜索多个文档,以拼凑出一个复杂的答案。为了处理第二类任务,他们创建了一个名为 MintHarness 的数字环境。该环境作为一个安全的协作空间,AI 可以在其中使用工具、搜索信息并进行计算。至关重要的是,该环境为所采取的每一步行动、查看的每一份文档以及计算的每一个数字都保留了一份永久账本。这份账本确保了即使 AI 遗忘了一个细节,其寻找答案的过程记录依然完好无损,并可供人类审查。
为了教导 AI 如何有效地使用该环境,研究人员采用了将金融推理能力与管理长期研究项目的能力相分离的训练方法。他们首先训练了一个版本的模型成为纯粹金融推理专家,专注于在数据已摆在面前的情况下确保数学和逻辑的正确性。他们又训练了第二个版本的模型成为执行专家,专注于如何搜索、何时停止以及如何在多个步骤中组织信息。最后,他们将这两个专家合并为一个统一的系统。这个组合模型有两个尺寸,并针对广泛的专业金融基准进行了测试。名为 Mint-Ag 的较大模型在金融推理测试中获得了 98.33 分,超越了数个领先的商业系统。在需要复杂多步研究的测试中,它也取得了最高分,在一个主要基准上达到 76.00 分,并在一个更新、更难的版本上达到了 60.49 分。规模更小、更为紧凑的 Mint-Cu 模型同样表现出色,在搜索密集型任务中得分 69.86,证明了即使在较小的系统中也能保留强大的金融研究能力。
这些结果之所以意义重大,不仅在于高分,还在于其表现的本质。研究人员发现,他们的模型不仅仅是在生成答案,它们是在生成可以被审计的答案。在一个详细的案例中,系统成功追踪了一家半导体公司的预测,整个过程经历了三十七个调查步骤。在此期间,它遇到了受阻的文档、错误的时间周期和冲突的数据。由于系统维持着一份持久的发现记录,它能够舍弃死胡同,纠正自身的错误,并仅使用其获取的有效证据重新计算最终数值。在另一个涉及企业收购的案例中,系统在找到确凿的法律文件后才锁定最终价格,从而忽略了早期模糊的来源。这种区分“线索”与“事实”,并保持两者差异清晰记录的能力,正是让该系统值得信赖的原因。
研究人员认为,对于人工智能要在金融等高风险领域发挥作用,它必须超越仅仅生成看起来正确的文本。一个值得信赖的智能体必须能够展示其推导过程,尊重所使用数据的时效边界,并愿意在证据不支持其结论时修正结论。通过构建一个将数据构建、执行和学习都与单一的可验证证据标准相联系的系统,Mint-Agent 团队已经证明,创造出既有能力又具问责性的金融智能是可能的。研究结果表明,金融领域可靠 AI 的未来不在于让模型变得更大或更快,而在于通过工程设计,使其在做出每一项决策时都能留下清晰、可测试的痕迹。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。