MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning
MoCA-Agent 是一个主张市场(market-of-claims)代码智能体,它通过将问题分解为用于专家验证的原子化主张、从市场支持的证据中合成可执行代码,并应用严格的验证,从而增强金融与数值推理能力,并在多种金融基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一个基于混乱电子表格的极其棘手的数学问题。如果你向标准的 AI 求助,它可能会写出一个长篇大论、听起来很有信心的故事,但最后导向一个错误的数字。这就像一个学生写了一篇完美的论文,却在最后一步不小心除以了零——文章看起来很棒,但答案是错的。
这篇论文介绍了一种名为 MoCA-Agent 的新型 AI,它专门设计用于阻止这些在财务和数值任务中的“沉默错误”。它并不让 AI 仅仅通过聊天来推导答案,而是将问题视为一个事实的股票市场。
以下是它的工作原理,使用简单的类比进行说明:
1. “主张目录”(拆解过程)
与其要求 AI “解决问题”,MoCA-Agent 首先将问题分解为微小的、原子级的碎片,称为主张(claims)。
- 类比: 想象你在盖房子。与其说“盖一栋房子”,不如列出每一块砖、每一根梁和每一枚钉子。
- 在论文中: 如果问题是“利润是多少?”,系统会列出如下主张:“收入是 100 美元”、“支出是 20 美元”、“利润意味着收入减去支出”以及“符号应该是正数”。
2. “交易员市场”(辩论过程)
这是核心创新。系统不仅仅是询问一个 AI 进行思考,而是雇佣了四位不同的“专家交易员”来对每个微小的关于主张的正误进行“下注”。
- 交易员组成:
- 提取器(The Extractor): 检查数字是否与原始文档相符。
- 公式专家(The Formula Expert):ly 检查数学逻辑是否合理。
- 会计师(The Accountant): 检查单位(美元、百分比)和符号(正负号)是否正确。
- 怀疑论者(The Skeptic): 主动寻找错误,并对看起来不可靠的主张进行“卖出”(拒绝)。
- 市场机制: 每位交易员会对每个主张进行“买入”或“卖出”指令。如果会计师和怀疑论者都“卖出”了一个主张(即认为其错误),该主张的市场价格就会下降,从而被拒绝。如果大家都达成一致,价格就会上升,主张被接受。
- 为什么这很重要: 在普通的 AI 辩论中,如果三个 AI 都对一个错误答案达成一致,它们听起来都会非常有信心。但在这种模式下,即使“公式专家”很有信心,如果数字对不上,“怀疑论者”也可以通过“做空”来阻断整个过程。
3. “合成器”(构建程序)
一旦市场结算(决定了哪些主张被接受),一个“合成器(Synthesizer)”代理就会编写一个 Python 计算机程序。
- 规则: 合成器被严格禁止使用任何被市场拒绝的主张。它只能使用“经过批准的砖块”进行构建。
- 类比: 这就像一位建筑工头,只能使用那些通过了安全检查的蓝图。如果一份蓝图被拒绝了,即使他很想用,也绝对不能使用。
4. “验证器”(安全检查员)
在给出最终答案之前,一个“具备代码感知能力的验证器(Code-Aware Verifier)”会运行该程序。
- 检查内容: 它不仅检查代码是否能正常运行而不崩溃,还会检查代码是否符合市场的“逻辑”。程序是否不小心翻转了符号?是否应该除以 100 却变成了乘以 100?
- 修复机制: 如果验证器发现了沉默错误(例如符号错误),它会将程序发回进行一轮修复,并明确指出错误所在,以便合成器进行修正。
5. “冲突仲裁者”(平局决胜者)
有时,市场会感到困惑,或者程序不够强健。在这种情况下,一个“委员会”会将市场的答案与标准的、非市场驱动的 AI 答案进行对比。如果两者不一致,一个特殊的“仲裁者”会创建一个第三种混合答案,结合两者的优点。
结果:为什么它有效
作者在 10 个涉及财务报告、复杂表格和图表的困难基准测试上测试了这个系统。
- 结果: MoCA-Agent 始终击败了其他顶尖的 AI 模型(包括像 GPT-4o 这样的大型模型以及专门的金融模型)。
- 秘诀: 它之所以变强,并不是因为它使用了更大的“大脑”,而是因为它阻止了 AI 生成那些自信但错误的数字。通过强制要求 AI 在进行数学运算之前,先对每一个微小的细节达成共识,它显著减少了错误。
局限性(细则说明)
论文诚实地说明了该系统目前还无法做到的事情:
- 成本高昂: 运行这个市场系统所需的计算机“思考次数”(API 调用)远多于简单的 AI 对话,这使得其运行成本大约是后者的 5 倍。
- 依赖英语: 该系统目前针对英语财务语言进行了调优。它在处理其他语言或非金融领域(如生物学)时可能会遇到困难。
- 单步视觉: 如果输入是一个图表图像,系统会使用一种工具来读取图像。如果该工具读错了标签,交易员们将没有机会再次对该标签进行投注;错误会直接溜过去。
总结: MoCA-Agent 就像一家财务审计事务所,在没有人对每一个数字签字确认之前,它不信任任何人的话。它用一种结构化的、基于证据的市场机制取代了“自由形式的聊天”,以确保最终的数学计算是真正正确的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。