Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval
DS@GT 团队提出了一种用于多语言金融问答的语言路由检索增强流水线,该流水线结合了 BGE-M3 嵌入、加权倒数排名融合以及通过下一标记对数概率进行的直接选项评分,并证明了实现最优性能需要进行特定语言的模型选择,以及在某些语言中需谨慎避免使用思维链提示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个棘手的谜题,但你不仅仅是动用自己的大脑,你的身边还放着一架巨大的参考书库。这就是**检索增强生成(Retrieval-Augmented Generation, RAG)**的世界。把它想象成一个正在参加考试的学生,在回答问题之前可以查阅教科书中的事实。通常情况下,如果问题是用英语提问,计算机处理得很好,但当问题变成西班牙语、希腊语或印地语时,情况就会变得混乱。这个“图书馆”可能全是英文书,而其他语言的书籍却寥精简;而且即使学生找到了外语书籍,他们可能也看不懂。
这篇论文针对了一个非常具体且高风险的问题:金融认证考试。这些不仅仅是常识问答,它们是成为注册金融分析师或会计师的复杂测试,需要对金钱、法律和会计规则进行深度逻辑推理。作者提出的核心问题是:我们能否构建一个计算机系统,使其在五种不同语言(英语、西班牙语、希腊语、中文和印地语)的硬核金融考试中,表现得像处理英语一样出色? 这个答案至关重要,因为金融是全球性的,但大多数计算机大脑主要是在英语上训练的,这导致它们在处理其他语言的金融术语时存在巨大的鸿沟。
团队的大实验:一位聪明的多语言侦探
来自佐治亚理工学院的研究团队,称自己的团队为 DS@GT,构建了一个数字侦探系统来解决这些金融考试问题。他们的系统并没有仅仅靠猜测,而是遵循一个严格的三步流程,他们称之为“流水线(pipeline)”。
第一步:语言侦探
首先,系统会查看问题并询问:“这是什么语言?”这就像是一个在俱乐部门口检查身份证的保安。如果问题是希腊语,系统就知道需要从其图书馆的“希腊语板块”中提取书籍。如果图书馆中该语言的书籍很少(这在希腊语或印地语等较小语种中很常见),它会从“全球板块”中抓取可能具有相似概念的书籍,即使它们是其他语言。他们使用了一个名为 BGE-M3 的特殊工具,将问题的“含义”转化为一种通用的代码,以便系统能够跨越语言障碍找到相关的示例。
第二步:模型路由(为正确任务匹配“右脑”)
在这里,团队发现了一些令人惊讶的事实。他们并没有只使用一个巨大的计算机大脑来处理所有事情。他们发现,不同的计算机大脑更擅长处理不同的语言。
- 对于英语,他们使用了名为 Qwen2.5-14B 的模型。
- 对于希腊语,他们惊讶地发现,一个较小的模型 Llama-3.1-8B 竟然成为了超级明星,比更大的模型高出了约 19.5 个百分点!
- 对于中文、印地语和阿拉伯语,他们使用了 Qwen3-14B。
如果他们只是对所有人使用“最好的”模型,系统在英语和希腊语上的表现将会惨不忍睹。这就像是意识到虽然马拉松选手擅长长跑,但你不会想让他们去下国际象棋;你需要为每个任务配备不同的专家。
第三步:评分器(不再是猜谜游戏)
通常,当计算机回答问题时,它们会尝试“写出”答案,比如“答案是 C”。这经常导致错误,即计算机写了一长段话,却忘了说它选了哪个字母。DS@GT 团队使用了一种聪型的技巧,称为检索增强直接评分(Retrieval-Augmented Direct Scoring, RADS)。系统不再是“写出”答案,而是简单地检查数学概率:“‘A’作为下一个词的可能性有多大?‘B’呢?‘C’呢?”它会选择数学得分最高的那个字母。这就像是一场选择题考试,计算机不需要写论文,它只需要涂好正确的选项。这种方法消除了几乎所有的“解析失败”(即无法读取计算机自身答案的错误),在其他方法遇到困难的中文问题上实现了 100% 的成功率。
令人惊讶的发现
团队进行了数千次测试,并发现了一些打破常规 AI 思维的规则:
- 想太多反而有害: 对于大多数人来说,“思维链(Chain-of-Thought)”(要求 AI 逐步解释其推理过程)是有帮助的。但对于希腊语问题,这实际上破坏了表现。准确率从惊人的 90.7% 跌到了糟糕的 20.9%。事实证明,对于这些特定的希腊语问题(更多是关于分类事实而非解决数学问题),让 AI “大声思考”会让它感到困惑。它开始写故事,而不是选择正确的类别。
- “思考模式”陷阱: 模型 Qwen3 有一个默认设置,即在给出答案前会写一段“思考”部分。团队发现,如果保持这个设置,系统在处理阿拉伯语时,通过 RADS 选出正确字母的能力会崩溃到接近随机猜测的水平。他们必须手动关闭这个“思考模式”,系统才能正常工作。
- 翻译是一个陷阱: 他们尝试将其他语言的问题翻译成英语,解决问题后再翻译回来。结果是一场灾难。翻译丢失了重要的金融细节,得分比直接用原语言解决降低了近 20 个百分点。
- 数据很重要,但模型更重要: 对于印地语,向他们的图书馆添加更多本土印地语示例确实有帮助,但提升幅度很小(仅约 1 个百分点)。然而,他们的系统与顶尖商业 AI(Claude Opus 4.7)之间的差距仍然巨大(17 个百分点)。这表明,对于低资源语言,问题不仅在于图书馆里是否有更多的书,更在于计算机大脑本身需要在该特定语言的金融术语上进行更深层的训练。
最终成绩单
当团队提交他们的系统参加官方的 FinMMEval 2026 竞赛时,表现良好,在大多数语言中都进入了前 10 名。
- 阿拉伯语: 76.0%(第 10 名)
- 印地语: 73.5%(第 7 名)
- 英语: 69.5%(第 9 名)
- 中文: 64.5%(第 9 名)
虽然他们没有获得第一名(顶尖团队得分超过 90%),但他们的工作证明了一个至关重要的教训:并非一招走天下。要构建一个在全球范围内运作的智能金融 AI,你不能只使用一个模型和一种策略。你需要将不同的语言路由到不同的模型,根据任务选择不同的思考策略,并使用数学方式而非书写方式来评分。全球金融 AI 的未来不在于一个单一的超级大脑,而在于一个由专家组成的团队,每个人都说着正确的语言,并使用正确的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。