FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering
FAU 团队通过优先考虑鲁棒的推理工程(例如直接候选评分、分数融合和严格的输出控制)而非针对特定任务的模型训练,以增强多语言视觉推理和答案格式化能力,从而在 ImageCLEF 2026 的视觉多选题(Visual MCQ)中获得第三名,并在视觉开放式问答(Visual OpenQA)中获得第一名。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正坐在一场高风险的考试考场中,但你的考卷不仅仅是阅读页面上的文字,而是一个由密集的教科书、复杂的图表、涂鸦的公式以及六种不同语言的图表组成的混乱拼贴画。你的任务是观察这个视觉上的混乱景象,并回答关于它的棘手问题。这就是“多模态推理”(Multimodal Reasoning)的世界,在这个领域,计算机试图模仿人类学生,既能“看到”图像,又能“阅读”其中的文本。长期以来,一个核心问题一直是:“计算机的大脑需要有多聪明才能通过考试?”但这里有一个陷阱。即使一个超级聪明的计算机完美理解了数学和科学,如果它话太多、使用了错误的语言,或者用一种老师的评分机器无法读取的混乱格式来写答案,它仍然会不及格。这就像是一个天才学生写了一篇精彩的论文,却忘了在横线上写下自己的名字,导致得了零分。
这篇论文讲述了一个来自德国(FAU)的团队参加名为 ImageCLEF 2026 竞赛的故事,旨在解决这个问题的。他们不仅构建了一个更聪明的“大脑”,还构建了一个更严格的“老师”。他们的主要发现是:你如何要求计算机回答,与计算机本身同样重要。他们发现,对于多选题,最好阻止计算机去“写”答案,而是让它像裁判一样为选项“打分”。对于开放式问题,他们学到计算机需要被强制保持简洁和干净,在提交最终结果之前剥离掉所有“大声思考”的过程。他们还尝试了一些流行的技巧,比如给计算机一份文本参考表(OCR)或教它新知识(微调),但令人惊讶的是,这些技巧反而让计算机的表现变差了。通过专注于严格的规则和清理答案,他们的系统爬上了排行榜顶端,证明了少许的工程纪律可以将一个强大但混乱的 AI 转变为可靠的应试者。
挑战:视觉考试
比赛有两种主要的题目类型。第一种是视觉多项选择题(Visual MCQ)。想象一个保加利亚语的生物问题,带有一个数据表和五个标记为 A 到 E 的选项。计算机必须选出正确的字母。第二种是视觉开放式问答(Visual OpenQA)。在这里,没有选项。计算机必须观察一个图表(也许是一个经济学图表),并用与问题相同的语言写出一个简短、直接的答案。
棘手之处在于,这些图像充满了“密集”的信息。它们不仅仅是猫的照片;它们是包含公式、单位和微小文本的科学论文页面。如果计算机被布局搞混,或者在只需要一个数字时却写了一长串解释,它就会丢分。
策略:“评分,而非书写”的技巧
对于多选题部分,团队意识到,让计算机写下一句类似“答案是 A,因为……”的话是非常危险的。计算机可能会选对字母,但会在周围包裹过多的额外文本,从而干扰评分系统。
相反,他们改变了游戏规则。他们要求计算机观察选项 A、B、C、D 和 E,并简单地为每一个选项给出一个“分数”,以此判断其正确的可能性。把它想象成一名体育裁判给体操运动员的动作打分(例如 9.5 分),而不是写一段关于它的文字。计算机不需要生成文本;它只需要计算哪个字母的分数最高。这使得答案变得极其干净且易于组合。如果他们用三个不同的计算机大脑进行测试,他们可以提取这三个大脑的分数,取其平均值,然后选出获胜者。这种“分数融合”(score fusion)帮助他们获得了 0.7108 的极高准确率,位列总榜第三名。
清理小组:驯服爱说话的 AI
对于开放式问题,情况恰恰相反。计算机太爱说话了。它们喜欢解释自己的推理过程,说“这是答案”,或者使用像 <answer> 这样的复杂 XML 标签。然而,评分系统只想要原始答案。
团队将此视为一名严格的编辑。他们使用了一种“简洁提示词”(concise prompt),告诉计算机:“停止大声思考。只需给我答案。”然后,他们运行一套“清理程序”(一组规则)来删除任何多余的词汇、推理痕迹或格式错误。他们还结合了来自多个不同计算机模型的答案。如果一个模型说“50 kg”,而另一个模型说“50 kilograms”,系统会自动识别出它们是同一个意思,并挑选出最好的一个。这种细致的清理和组合帮助他们在开放式类别中以 0.6488 的得分(通过名为 COMET 的指标衡量)夺得了第一名。
令人意外的“禁区”:哪些做法不起作用
团队尝试了两件许多人认为会有所帮助、但实际上却让分数下降的事情。
- 参考表 (OCR): 他们尝试利用工具(使用 OCR)为计算机提供图像的文本转录,以帮助它阅读文本。但这产生了适得其反的效果。转录文本经常包含拼写错误、破碎的公式或错误的单词顺序。这就像是给一名学生一份充满错误的参考资料;它比图像本身更让计算机感到困惑。
- 速成班 (微调): 他们尝试使用 LoRA 微调方法,针对考试问题专门“教导”计算机。他们原以为这会让计算机成为专家。然而,这反而让计算机表现得更差。论文指出,计算机本身已经足够聪明,能够阅读图像,而试图在这样一个规模较小且杂乱的数据集上对其进行重新训练,反而破坏了它原有的自然能力。
启示
这篇论文传达的重大教训不在于发明了一个新的、超智能的大脑,而在于推理工程(inference engineering)——这是一个高级说法,意指“我们如何要求计算机完成工作”。作者发现,一个强大的计算机模型,如果被赋予严格的规则、干净的输入和一个良好的清理过程,其表现可以超越一个虽然稍聪明但允许混乱的模型。
他们表明,你不一定非要让 AI 变得更大或训练得更辛苦。有时,你只需要告诉它闭嘴,选出正确的字母,并提交一份干净的答案表。通过专注于这些实际的细节,他们将强大的视觉语言模型转化为了可靠的竞赛赢家,证明了有时解决问题的最佳方式是管理输出,而不只是升级引擎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。