Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
本文表明,对于小型多语言视觉-语言模型而言,测试时扩展收益主要由确保提示词的可解析性和充足的解码预算所驱动,而非复杂的搜索或验证机制,且底层策略模型是实现视觉多项选择基准测试达到最先进性能的最显著因素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个棘手的、多语言的谜题,其中的线索隐藏在图片中。你有一支由小型智能机器人(被称为“视觉-语言模型”)组成的团队来协助你。长期以来,人们一直认为解决这些谜题的秘诀是构建一台超级复杂的机器,能够检查机器人思考的每一个步骤,或者让机器人不断重写自己的答案直到完美。
但这份由阿姆斯特丹大学研究人员为 ImageCLEF 2026 竞赛编写的论文却说:“先别急!秘诀不在于精密的机器,而在于给机器人更多的时间来完成它们的句子。”
重大发现:更多的词汇,更少的思考
研究人员在一组大规模考试题目(11 种语言,20 个学科)上测试了各种不同的策略,以观察究竟什么能帮助这些小型机器人更好地进行推理。他们发现,最重要的并不是搜索方法有多“聪明”,而是允许机器人说话的时长。
把它想象成一个学生在参加考试。
- 旧方法: 你告诉学生,“仔细思考,检查你的作业,并写一篇完美的论文”,但你只给了他们 1,000 个字 的空间。他们可能在脑海中理清了正确的思路,但在写下最终选项(A、B、C、D 或 E)之前就用完了空间。他们推理正确,却因为没能写出答案而考试失败。
- 新方法: 你告诉学生,“尽管写下你的想法,但你可以使用多达 2,048 个字。” 突然间,他们有了足够的空间来完成故事并写下答案字母。
研究人员对这一点进行了仔细测量。当他们将字数限制从 1,000 增加到 2,048 个 token 时,准确率提升了 3.7 个百分点。这是一个巨大的胜利!但当他们尝试通过让机器人生成 16 条不同的思维链而不是 8 条来获取更多答案时,得分仅上升了微小的 0.15 个百分点。这就像要求一个学生把同一篇论文写 16 遍而不是 1 遍;如果他们原本就卡在字数限制上,这样做并没什么帮助。
哪些方法行不通(那些失败的“酷炫”点子)
研究人员尝试了一些听起来应该很管用的复杂技巧,但数据表明它们并不奏效。
- “步步指导”教练: 他们尝试使用一种特殊的“过程奖励模型”(PRM)来充当教练,检查机器人推理的每一步,并像束搜索(beam search)一样引导它。他们认为这会比让机器人自由猜测更好。结果: 它实际上比简单的方法表现更差,得分下降了 0.39 个百分点,同时消耗了 8.7 倍 的计算能力。事实证明,这个教练被图片搞糊涂了,无法将机器人带回正轨。
- “裁判”机器人: 他们尝试添加第二个机器人来充当裁判,阅读所有答案并选出最好的一个。他们尝试了两种类型:一种是经过训练的评论家,另一种是单纯的智能生成模型。结果: 两者都没有击败简单的“多数投票法”(即选择出现次数最多的答案)。事实上,在更智能的机器人上,裁判反而让情况变得稍微糟糕了。论文指出,这是因为当答案非常接近时,裁判无法分辨正确答案和错误答案的区别。
- 自我修正: 他们观察了让机器人修复自身错误是否有帮助。结果: 没有。在这种规模下,让机器人重写自己的答案往往会让效果变差。
真正的英雄:机器人本身
最大的提升并非来自某种新策略,而是来自于更换了机器人。当他们将模型从旧模型(Qwen2.5-VL-7B)切换到更新、更小的模型(Qwen3.5-4B)时,得分跃升了 11.4 个百分点。这表明,拥有一个更聪明的“大脑”(策略模型)比拥有一个精妙的“思考过程”(搜索方法)重要得多。
“修复”小技巧
这里有一个小故障:有时即使有足够的字数,机器人写出了精彩的解释,却忘了写出最后的字母(A、B、C 等)。研究人员发现了一个简单的“引导修复”技巧:如果机器人没有写字母,他们就强制它在单个 token 中说出“Answer: [A/B/C/D/E]”。这个方法解决了剩余 2.67% 失败的问题,有效地弥补了差距。
最终成绩
通过结合更新的机器人(Qwen3.5-4B)、给予其慷慨的字数限制(2,048 个 token)、要求 16 次尝试以及使用简单的“修复”技巧,该团队达到了 84.1% 的最终测试准确率。这使他们在排行榜上取得了第一名。
核心启示
这里的主要教训是,对于小型视觉-语言模型,工程细节比复杂的算法更重要。如果你给模型足够的空间来完成它的思考(token 预算),并使用一个迫使其做出承诺的提示词,你会获得比试图用复杂的搜索树或裁判来“智斗”它更好的结果。论文表明,在拥有更好的模型之前,最好的策略就是让模型多说话并修复其格式,而不是试图用复杂的搜索算法去超越它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。