← 最新论文
💬 NLP

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

该论文介绍了 CURV,这是一个与 CCQA 数据集配对的课程学习框架,它通过训练多模态模型执行内在的多步视觉落地推理,增强了图表问答能力,从而在各种基准测试中实现了显著的性能提升。

原作者: Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个复杂的拼图,但你不仅要看盒子上的图案,还得在拼凑的过程中逐渐理清图像。这就是多模态大语言模型(MLLMs)——这些能够同时阅读文本和观察图像的超级聪明计算机程序——每天面临的挣扎。目前,这些程序就像是那些能完美阅读数学教科书,但在被要求解决白板上的问题时却会感到困惑的天才学生,因为它们无法精准地聚焦在正确的数字上。它们经常把“所见”与“所想”混淆,导致给出的答案听起来逻辑通顺,但由于读错了图表或遗漏了微小的细节而完全错误。科学家们曾试图通过给计算机提供“参考资料”或要求它们大声说出解题步骤(一种被称为“思维链”的方法)来修复这个问题,但计算机仍然难以将它们的思考与视觉证据在实时状态下直接联系起来。它们需要学会如何像人类一样,在一次流畅的动作中完成观察、思考和再次观察。

于是,CURV 诞生了,这是一种旨在教导这些 AI 模型成为更优秀“视觉侦探”的新型训练方法。把 CURV 想象成一个用于学习的“视频游戏关卡系统”。它不是直接把计算机扔进最难的终极 Boss 战,而是让它从“第一关”开始:学习阅读简单的图表并指向正确的数字。随着能力的提升,它会解锁“第二关”,此时它必须结合两部分信息;最后是“第三关”,它需要同时处理多个图表。其秘诀在于,在每一个步骤中,模型都被迫物理性地指向它正在讨论的那部分图像。这就像教孩子做数学题时,在让他们说出“五”之前,先让他们触摸桌上的苹果。

CURV 背后的研究人员发现,这种循序渐进的“先看后想”式训练效果显著。他们创建了一个名为 CCQA(课程图表问答)的海量新数据集作为训练场。这个数据集构建得像一把梯子,问题难度循序渐进,从简单的“这是哪个数字?”到复杂的“比较这两张图表并告诉我它们的差异”。通过在这把“梯子”上进行训练,模型学会了将推理过程内化为基于实际所见的行为。结果令人印象深刻:使用 CURV 训练的模型在训练测试中的准确率提升了高达 20.50%。更重要的是,它们不仅在练习题上表现出色,在面对从未见过的真实世界图表时也变得更强,准确率提升了高达 12.30%,甚至在其他类型的视觉谜题(如数学题)上也提升了高达 10.20%

该论文指出,成功的关键不在于仅仅给 AI 更多的数据,而在于改变其学习的方式。研究人员认为,以往的方法之所以失败,是因为它们将“观察”和“思考”视为两个独立的任务。CURV 证明了通过将两者交织在一起——迫使模型不断移动视觉焦点以匹配其逻辑步骤——可以构建出一个更强大、更可靠的图表理解大脑。然而,作者也注意到一个有趣的现象:虽然在“训练”阶段强制模型进行“指向”会让它变得更聪明,但在最终“测试”阶段强制它大声“指向”有时反而会让它出错,这可能是因为它被自己的指向动作搞混了。这表明,最好的方法是教模型将观察与思考结合在一起,直到它成为一种自然习惯,从而不再需要停下来通过“指向”来获得正确答案。最终,CURV 展示了如果教导 AI 将大问题分解为细小的、视觉化的步骤,它就能像人类一样理解世界的数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →