CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA
该论文介绍了 CLAIR-Fin,这是一个由九个智能体组成的对抗性框架,它通过将查询分解为原子化断言,以进行严谨的、类型感知的验证和自适应辩论,从而通过增强跨模态金融问答,显著提高了忠实度并减少了幻觉,相比于现有基准模型表现更优。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探,但你的线索散落在三种截然不同的笔记本中:一本写满故事的手写日记、一份充满数字的电子表格,以及一本画满彩色图表的素描本。在人工智能的世界里,这就是计算机在尝试回答关于复杂财务报告的问题时所面临的情况。这些报告规模巨大,通常长达数百页,将文本、表格和图表混合在一起。问题在于,人工智能模型就像是那些虽然超级聪明但有时会白日做梦的学生,当它们必须同时阅读所有这些不同格式的内容时,往往会感到困惑。它们可能会把来自表格的一个数字与来自文本的一个故事混淆,或者可能会产生“幻觉”——编造出听起来很真实但实际上并不存在于文档中的事实。这在金融领域是一件大事,因为一个错误的数字或一个编造的故事都可能导致错误的决策。科学家们一直试图建立更好的方法让计算机检查自己的工作,但大多数方法要么平等地信任所有线索(即使在需要特定数字时,一张草图并不是一个好的线索),要么等到最后才检查故事是否合理,而到那时,已经太晚无法修正错误了。
于是,CLAIR-Fin 登场了,这是一个聪明的全新系统,旨在充当一个由九名侦探组成的超级组织化团队,共同对一份财务报告进行事实核查。CLAIR-Fin 并没有让一个 AI 试图一次性吞下整个文档,而是将每个问题分解成微小的、原子的“声明(claims)”——就像一个个独立的拼图碎片。例如,如果问题是“去年银行赚了多少钱?”,该系统不会只是猜测;它会将此拆分为更小的声明,如“年份是 2025 年”和“利润为 1.39 亿美元”。然后,它将这些微小的声明发送给专门的代理(agents)。有些代理是阅读文本的专家,有些擅长处理来自表格的数字,还有些则擅长解读图表。
这就是奇迹发生的地方:CLAIR-Fin 知道并非所有的线索都是平等的。它使用了一条名为“非对称证据权威(Asymmetric Evidence Authority)”的规则。这就像法庭上的法官,他知道如果你需要一个精确的数字,电子表格单元格是金标准;但如果你想知道某事发生的原因,书面故事才是最好的证据。系统会对数字信任电子表格,对原因信任故事,而不是将它们全部视为同等对待。如果证据不靠谱或缺失,系统不会强行猜测;它只会承认自己不知道并拒绝回答,这比那些只会胡编乱造的 AI 有了巨大的进步。
如果一个声明很棘手或证据存在冲突,系统会将其投入“自适应反驳循环(Adaptive Rebuttal Cycle)”。这就像是一个辩论俱乐部,两名 AI 律师——一名为声明辩护,另一名试图寻找漏洞——进行来回辩论。但聪明之处在于:他们只在必要时进行辩论。如果声明很简单,他们就会跳过辩论;如果很难,他们就会进行更多辩论。这节省了时间和精力。在最终答案被写出之前,还有一个“监管链(Chain-of-Custody)”检查,这就像一名保安,确保在研究人员与辩论者之间的交接过程中,证据没有被调换或篡改。最后,由一位“法官-审计员(Judge-Auditor)”给出最终裁决,并计算“幻觉风险指数(Hallucination Risk Index)”,这就像是天气预报,预测答案更有可能是一个晴朗的真相,还是一个风暴肆虐的谎言。
研究人员在基于孟加拉国银行真实财务报告的 500 个问题集上测试了这个新系统。他们发现,CLAIR-Fin 比旧方法更能讲真话。虽然标准的 AI 系统大约有 78% 的时间能掌握事实,但 CLAIR-Fin 将这一比例提高到了接近 89%。更令人印象深刻的是,当证据不足以回答某个问题时,该系统在 5.4% 的情况下选择了保持沉默,而不是强行给出一个错误的答案。这表明,通过将问题分解、针对不同任务信任正确的证据类型,并让 AI 代理仅在必要时进行辩论,我们可以构建出在处理复杂金融数据时更加可靠且诚实的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。