想象一下你正在尝试解决一个棘手的谜题,比如弄清楚一幅绘画视频中,那杯水到底在做什么。如果你只问一次标准的 AI(视觉语言模型),它可能会猜:“也许艺术家把那里当作存放画笔的地方?”它看起来很自信,但其实错了。如果你再问它一次,它可能会猜:“也许它是用来搁置画笔的?”它仍在猜测,而且它的答案一直在变化。这就是这篇论文所称的**不稳定推理(unstable reasoning)**问题。
来自亚利桑那州立大学和 NewsBreak 的作者们开发了一种名为 CASHEW(以及更智能的版本 CASHEW-RL)的解决方案来解决这个问题。以下是其工作原理,使用简单的类比进行说明:
1. 问题所在:“孤独的思考者”
目前的 AI 模型就像是一个人在黑暗的房间里试图解开一个谜题。他们可能会被自己的脚绊倒(犯错),并因为看不清全貌而一直朝着错误的方向走。他们经常会“幻觉”(hallucinate),即凭空捏造不存在的事实,比如说一个杯子是用来存放物品的,而实际上它是用来清洗的。
2. 解决方案:“学习小组”(CASHEW)
CASHEW 不再让 AI 独自思考,而是将 AI 变成了一个学习小组。
- 过程: 当 AI 接收到一个问题时,它不仅仅给出一个答案。它会生成一整群不同的“思考路径”(轨迹)。想象一下房间里有 8 个不同的学生,每个人都在尝试独立解开这个谜题。
- 现实检查(视觉验证): 这是核心秘诀。在小组达成一致答案之前,一位“裁判”(视觉验证工具)会根据实际的图像或视频来检查他们的工作。如果一个学生说:“这个杯子是用来存放东西的,”裁判会观察视频并说:“不对,我没看到存放架。我看到的是艺术家在用它清洗画笔。”
- 综合: 然后,AI 会提取所有 8 名学生想法中的精华部分,利用裁判的笔记过滤掉谎言(幻觉),并将它们组合成一个超级准确、基于证据的答案。
这就像是将一场混乱的头脑风暴转化为一份经过事实核查的精炼报告。
3. 升级版:“内化的专家”(CASHEW-RL)
第一个版本(CASHEW)很棒,但它要求计算机每次回答问题时都要运行“学习小组”的过程,这会很慢。
作者还创建了 CASHEW-RL。你可以把这看作是把那个学习小组的过程,教给 AI,让它自己成为小组组长。
- 他们使用一种特殊的奖励系统(类似于视频游戏得分)来训练 AI,该系统会针对以下几点给予分数:
- 得到正确答案。
- 引用正确的视觉证据(例如指向那个杯子)。
- 不在简单问题上浪费时间(保持高效)。
- 经过这种训练后,AI 学会了在自己的大脑内部,更快速、更高效地完成“小组思考”和“事实核查”。
他们发现了什么?
论文在涉及图像和视频的 13 个不同基准测试上进行了测试。结果就像是为 AI 推理找到了一根魔杖:
- 准确率大幅提升: 在一个名为 ScienceQA 的科学测试中,AI 的得分跃升了 26.2 个百分点。在名为 EgoSchema 的视频推理测试中,得分跃升了 9.1 个百分点。
- 减少幻觉: AI 不再捏造事实。它开始紧扣图像中实际能看到的内容。
- 胜过竞争对手: 与其他试图修复 AI 推理的方法(例如仅仅将同一个问题询问 AI 8 次并选取出现次数最多的答案)相比,CASHEW 每次都胜出了。
总结
这篇论文声称,通过强制 AI 进行小组思考、根据视觉证据检查其工作以及从错误中学习,我们可以让它变得更加可靠。它让 AI 停止自信地瞎猜,并引导它走向严谨、基于证据的推理之路。
技术摘要:CASHEW —— 通过迭代轨迹聚合稳定多模态推理
1. 问题陈述
视觉语言模型(VLMs)在多模态理解和推理任务中取得了显著成功。然而,它们的多步推理过程仍然脆弱且不稳定。主要问题包括:
- 不稳定性: 对同一输入进行重复采样往往会导致发散的推理轨迹和不一致的最终预测。
- 幻觉: 模型容易产生视觉幻觉,即推理步骤并非基于实际视觉证据。
- 当前测试时缩放(Test-Time Scaling)的局限性: 现有方法通常遵循“采样并选择”的范式,生成多个独立的链条,并丢弃被拒绝轨迹中的部分见解。此外,如果缺乏明确的落地(grounding)机制,仅仅增加推理长度或采样次数可能会放大早期的感知错误,而非纠正它们,导致模型虽然“想得更久”,但并没有“想得更好”。
2. 方法论
本文提出了两种互补的方法来解决这些局限性:CASHEW(一种推理框架)和 CASHEW-RL(一种学习型变体)。
CASHEW:迭代聚合框架
CASHEW 将推理视为一个进化过程,其中候选轨迹群体被迭代地合成与精炼。它分为四个阶段:
- 群体初始化: 基础 VLM 生成初始的 N 个候选推理轨迹。
- 子集采样: 在每次迭代中,随机采样一组同伴轨迹作为参考候选,以引入多样性并防止坍缩为单一的推理模式。
- 视觉验证: 在聚合之前,使用轻量级的视觉-文本落地模块(通过 Grounding DINO 实现)将物体级和属性级的声明与视觉输入进行验证。只有经过验证的证据才会被保留,用以指导后续步骤。
- 落地聚合: 模型合成采样的轨迹及其经过验证的视觉证据,以生成更新的、更高质量的推理轨迹。该过程重复进行 T 次迭代,最终形成一个整合后的轨迹。
CASHEW-RL:通过 GSPO 实现的学习型聚合
CASHEW-RL 通过两阶段后训练过程将聚合行为内化到单个模型中:
- 监督微调(SFT): 模型在包含三个组成部分的结构化聚合格式上进行训练:推理痕迹(
<thought>)、一组经过验证的视觉键(<visual_keys>)以及最终答案(<answer>)。这建立了参考策略(πref),并教会模型如何阐述证据并格式化输出。
- 通过 GSPO 进行强化学习(RL): 模型使用一个平衡了三个目标的复合奖励函数进行优化:
- 答案正确性 (Racc): 与标准答案精确匹配。
- 证据选择质量 (Rkey): 采用平衡的精确率-召回率公式,鼓励选择相关的视觉键,同时避免无节制的扩散。
- 难度感知长度惩罚 (Rlen): 一种自适应惩罚机制,在简单任务(观察到高解决率的任务)中抑制过度冗长,同时在困难任务中允许灵活性。
训练采用了基于课程的学习方式,混合了离线教师生成的轨迹和在线策略轨迹,逐渐增加自生成数据的比例,以提高鲁棒性并减少分布偏移。
3. 核心贡献
- CASHEW: 一种即插即用的推理时框架,通过迭代聚合候选轨迹并结合显式视觉验证,使多模态推理更加稳定,有效地过滤了幻觉并将推理锚定在证据之上。
- CASHEW-RL: 一种学习型变体,通过 GSPO 和复合奖励将轨迹聚合行为内化,使模型能够执行稳健的、具有视觉落地的聚合,并对推理投入进行自适应控制。
- 实证验证: 在多种不同模型骨干网络和模态上展示了持续的性能提升。
4. 实验结果
该方法在涵盖图像理解、视频理解和视频推理的 13 个基准测试中进行了评估。
- 性能提升:
- 图像基准测试: CASHEW-RL 取得了显著提升,包括在 ScienceQA(Qwen3-VL-4B)上提升了 26.2 个百分点,以及在 EgoSchema(InternVL3.5-8B)上提升了 9.1 个百分点。
- 视频基准测试: 在 Video-MME、LongVideoBench 和 MVBench 中均观察到一致的增益。例如,CASHEW-RL 使 InternVL3.5-8B 的 EgoSchema 分数提升了 9.1 点。
- 与 SOTA 对比: CASHEW 在所有指标上都优于现有的测试时缩放基线(Self-Consistency, Self-Selector, 和 Self-Synthesizer)。值得注意的是,在 MME 基准测试中,它在感知和认知得分上分别超过最强的基线(Self-Synthesizer)48.2 和 82.6 分。
- 消融实验: 移除视觉落地模块(Grounding DINO)后,虽然仍比基础 VLM 有所提升,但这表明迭代聚合是性能提升的主要驱动力,而视觉落地进一步增强了可靠性。
- 效率: CASHEW-RL 以更少的聚合迭代次数达到了与更深层 CASHEW 配置相当的性能,表明其聚合效率有所提高。
5. 重要性与主张
本文声称 CASHEW 和 CASHEW-RL 为多模态推理的不稳定性提供了稳健的解决方案。通过从“采样并选择”范式转向“迭代聚合”范式,这些方法确保了推理共识锚定在视觉证据之上。作者强调,我们的方法允许模型“共同思考”而不仅仅是“思考更久”,从而有效地减轻了幻觉并提高了一致性。通过视觉验证和通过 GSPO 实现的自适应推理投入,模型能够生成不仅正确而且基于最少且充分视觉证据的答案。
6. 局限性
作者承认,目前的工作使用了固定的聚合预算以实现受控对比,这对于那些可能不需要广泛聚合的资源受限应用场景来说可能不是最优的。虽然 CASHEW-RL 通过内化聚合行为部分解决了这个问题,但对自适应预算分配的系统性研究被确定为未来的工作方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。