← 最新论文
🤖 machine learning

Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge

本技术报告详细介绍了一种在 ICML 2026 AI4Math SeePhys Pro 挑战赛中获得第一名的解决方案,该方案通过采用结合了用于弥合模态差异的视觉信息提取以及专注于可靠答案选择的多智能体辩论系统的两阶段框架,实现了从 0.643 到 0.802 的显著准确率提升。

原作者: Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个棘手的谜题,而线索被拆分在了一张书面便条和一幅神秘的图画之间。有时便条会告诉你一切;而有时,图画才隐藏着秘密,便条仅仅是一个干扰项。这就是“多模态”AI(能够阅读文本并观察图像的计算机)的日常生活。长期以来,这些计算机擅长阅读,但在“看透”隐藏在图表中的数学逻辑方面却表现得很糟糕。面对带有复杂图表的物理题时,它们会盯着看却感到困惑,漏掉文本中未提及的关键数字或形状。

为了解决这个问题,科学家们一直在尝试两种主要策略。第一种是“编排”(orchestration),这就像是雇佣一个专家团队而不是只用一个专家。你要求三个不同的聪明计算机来解决问题,让它们就答案进行辩论,然后选出胜者。第二种策略是“翻译”(translation)。由于计算机通常更擅长阅读文字而非观察图像,因此你会尝试将图像转化为一段计算机能够轻松阅读的超清晰描述。这篇论文提出了一个简单的问题:如果我们结合一个“辩论型计算机团队”和一个“超精准的翻译器”,我们是否最终能破解视觉物理问题的密码?更重要的是,这个团队中的哪一部分真正承担了主要的重任?

两阶段侦探小组

这篇论文的作者——来自 KAIST 和 summary.ai 的一个团队——参加了一场名为“SeePhys Pro”的高水平挑战赛。目标是解决大学水平的物理题,这些题目中的问题陈述和图表有时仅为文本,有时仅为图像,有时则是两者的混乱混合体。为了获胜,他们构建了一个两阶段流水线,我们可以将其视为一个拥有两个截然不同职责的“侦探小组”:翻译官辩论俱乐部

第一阶段:翻译官(弥合差距)
第一个工作是确保计算机能够真正“看到”问题。在过去,如果一个物理问题仅仅是一张图片,计算机只会盯着它瞎猜。这个团队意识到,计算机需要将图片翻译成它热爱的语言:文本。但不仅仅是任何文本!他们没有仅仅写下一句简单的句子,比如“这里有一个球”。那太模糊了。

相反,他们构建了一个复杂的翻译器,将图像转化为三样东西:

  1. 一段清晰的故事: 对正在发生的事情进行散文式的描述。
  2. 一个结构化地图 (SVG): 一段数字绘图代码,用于保留精确的几何形状、角度和连接关系,这样计算机就不会搞错形状。
  3. 一个锐化器: 对于最难的问题(即文本和图片挤在一起形成一张图像时),他们使用了一个“裁剪器”来完美地切割图像,从而锐化图表,并使用 OCR(光学字符识别)来读取图中微小的数字。

把这一阶段想象成一个人类翻译员,他不仅翻译文字,还重新绘制地图,以免旅行者迷路。论文发现,这种“翻译”是解决最难问题的灵丹妙药。当问题完全包含在图像中时(第4级),仅仅通过阅读原始图像,计算机只能答对 54% 的题目。但一旦他们将该图像翻译成清晰的文本描述和结构化地图,准确率便跃升至 77.5%。问题在图像中被“锁定”得越深,这种翻译的价值就越大。

第二阶段:辩论俱乐部(编排)
一旦问题被翻译成清晰的文本,它就会进入“辩论俱乐部”。在这里,三个不同的超级智能 AI 模型(来自不同的公司,因此会犯不同类型的错误)会独立尝试解决问题。

  • 求解器 1 (GPT-5.5)
  • 求解器 2 (Gemini-3.1-Pro)
  • 求解器 3 (Claude-Opus-4.8)

在以往的许多尝试中,人们认为这些模型会通过反复争论来互相纠正逻辑,直到得出真相。作者测试了这一点,但他们发现了一个令人惊讶的转折:辩论本身并不是主角。

相反,真正的胜利来自于一个聪明的“裁判”(称为规范化器/Canonicalizer),它会倾听三个答案,并根据答案的“数值”而非仅仅是文字来挑选最佳答案。例如,如果两个模型说“4 米”,而一个模型说“4.00m”,裁判知道它们是相同的,并会选择多数派。如果它们产生分歧,裁判不会让它们无休止地争论;它会检查推理是否可靠。如果一个模型自信地给出了错误答案,裁判会“屏蔽”(隐藏)该错误的推理过程,以免干扰其他模型。

论文明确排除了需要一个“超昂贵”的仲裁者来打破僵局的想法。他们尝试使用一个庞大的、高级的模型来决定当三个求解器产生分歧时谁是对的,但这并没有提高分数,反而增加了成本。那个简单的、具备数值感知能力的裁判做得同样好,甚至更好。

主要发现

团队的分析揭示了两个改变他们研究方法的关键教训:

  1. 翻译是视觉问题的核心: 他们的“翻译”阶段的价值完全取决于问题中有多少内容隐藏在图像中。

    • 如果问题只是文本(第1级),翻译器不起作用,且准确率本就很自然地处于高位。
    • 如果问题是混合型的(第2-3级),翻译器会有所帮助。
    • 如果问题完全是图像(第4级),翻译器则是从失败走向胜利的关键。论文表明,随着“模态差距”(文本与图像之间的差异)变大,翻译的价值也随之剧增。
  2. 选择优于辩论: 在推理方面,团队发现提升并不来自于模型的相互争论,而是来自于可靠的选择。当两个模型达成一致时,它们在 83% 的情况下是正确的。该系统的运作方式是信任共识,并且只在少数出现分歧的情况下投入额外的时间。所谓的“辩论轮次”并没有带来新的正确答案,它们只是帮助过滤掉了错误的答案。

结果:胜利巡游

通过结合一个超精准的翻译器和一个聪明的、具备数值感知的选择系统,该团队碾压了竞争对手。

  • 他们最初使用单个 AI 模型的基准分数为 0.643(约 64% 正确)。
  • 他们的两阶段系统将这一分数提升到了公开测试中的 0.802(约 80% 正确)。
  • 在最后的秘密“私有”排行榜上,他们取得了 0.743 的成绩,夺得了第一名

有趣的是,对于最难的第 5 级(涉及现实世界物体的照片而非干净的图表),团队实际上撤销了辩论俱乐部。他们发现,三个模型的团队会被杂乱的照片搞混,并针对错误的东西进行争论。切换回单个专注的求解器反而将他们在该特定等级的分数提高到了 0.933

为什么这很重要

这篇论文告诉我们,在 AI 世界中,并非越大越好。如果你有一个好的流程,你不需要一个价值数十亿美元的“超级大脑”来解决问题。关键在于意识到,计算机需要将图片翻译成它能理解的语言(文本和结构化地图),并且需要一个聪明的裁判来挑选最佳答案,这比一场漫长且嘈杂的争论更为重要。

作者指出,解决视觉问题的未来不仅仅是让模型变得更聪明,而是建立更好的“流水线”,将世界翻译成 AI 真正可以进行推理的形式,然后使用简单、廉价且可靠的方法来挑选出正确的答案。他们不仅赢得了一场比赛;他们还向我们展示了,有时,看到答案最好的方式不是盯着图片看,而是开始阅读地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →