← 最新论文
💬 NLP

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

该论文指出全模态大模型在跨模态协同推理中因缺乏细粒度指代对齐能力而存在缺陷,为此提出了“跨模态指代对齐”问题定义及新数据集 CrossOmni,并通过无训练提示学习和基于 SFT+GRPO 的强化学习策略成功提升了模型在跨模态推理任务中的表现。

原作者: Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的“全能人工智能”(Omni-LLMs)做了一次深度体检,发现了一个它们虽然很聪明,但经常犯错的“隐形毛病”,并开出了两剂良药。

我们可以把这篇论文的故事拆解成三个部分:发现了什么病怎么确诊的、以及怎么治好的

1. 发现了什么病?——“指鹿为马”的跨模态失忆症

想象一下,你有一个超级聪明的机器人助手,它既能视频,又能声音,还能文字。

  • 如果你只给它看一段视频,它能准确说出里面的人在做什么(单模态能力很强)。
  • 如果你只给它听一段录音,它能听出说话人的情绪(单模态能力也很强)。

但是,当你把这三样东西混在一起,问它一个需要“串联”信息的问题时,它就晕了。

举个生活中的例子

视频里有一个穿红衣服的男人在说话;
字幕里写着:"那个男人叫张三,他是个医生”;
录音里传来一个粗犷的男声说:“我累了”。

如果你问机器人:“那个粗犷声音的人,他的职业是什么?”

  • 普通机器人可能会想:“哦,视频里有个穿红衣服的人,字幕里有个叫张三的医生。那答案肯定是医生吧!”(它把“穿红衣服的人”和“粗犷声音的人”搞混了,或者根本没把声音和字幕里的“张三”对应起来)。
  • 论文指出的问题:现在的 AI 就像是一个记性不好且缺乏“连线”能力的侦探。它能看清画面,能听清声音,能读懂字,但它不知道画面里的“张三”、声音里的“张三”和字幕里的“张三”其实是同一个人。这种把不同感官里的“同一个人/物”认出来的能力,论文称之为跨模态共指对齐(Cross-Modal Coreference Alignment)。

2. 怎么确诊的?——造了一个“找茬”题库

为了证明这个病确实存在,作者们造了一个叫 CROSSOMNI 的超级题库。

  • 以前的题库:就像问“视频里发生了什么?”,AI 只要把看到的、听到的、读到的信息大杂烩一下就能答对。
  • CROSSOMNI 题库:就像玩**“连连看”**。
    • 题目会故意设陷阱:比如“请根据字幕里提到的‘出生年份’,去视频里找出那个人的声音特点”。
    • 这要求 AI 必须先在字幕里找到“张三”,然后在视频里定位到“张三”的脸,最后去听“张三”的声音。少一步,或者把“张三”和“李四”搞混,就全错了。

测试结果很扎心
作者测试了 13 种最先进的全能 AI 模型,发现它们在“单模态”(只看、只听、只读)时表现很好,但一旦需要跨模态连线(比如从声音找文字,从视频找声音),成绩就断崖式下跌。这说明它们缺的不是“眼睛”或“耳朵”,而是**“大脑里的连线逻辑”**。

3. 怎么治好的?——两剂“思维训练”良药

既然病根是“缺乏跨模态的连线思维”,作者就设计了两种方法来训练 AI,教它如何**“像侦探一样思考”**。

第一剂药:免费“思维示范”(In-Context Learning, ICL)

  • 比喻:就像教小孩做题。以前是直接问“答案是什么?”,现在是在问之前,先给小孩看一个**“解题示范”**:“你看,我们要先找到声音是谁,再去找他的资料,最后才能回答……"
  • 效果:不需要重新训练模型,只需要在提问时加上这种“一步步思考”的示范,AI 的成绩就提升了 21%。这证明了只要给个正确的“思考路径”,AI 就能学会。

第二剂药:强化“肌肉记忆”(SFT + GRPO)

  • 比喻:这就像给 AI 报了一个**“特训营”**。
    1. SFT(监督微调):老师(人类)手把手教 AI 做几道题,告诉它:“看,这里要先找声音,再找文字,不能乱猜。”
    2. GRPO(强化学习):这是更高级的。AI 自己做题,如果它**“思考过程”是对的(比如它真的先定位了人,再查了资料),就给它发糖果(奖励)**;如果它只是瞎蒙或者逻辑跳跃,就扣糖果。
  • 效果:经过这种“特训”,AI 不仅在这个“连连看”题库里变强了,连以前没见过的其他复杂任务也做得更好了。这说明它真的学会了“跨模态思考”的本领,而不是死记硬背。

总结:这篇论文的核心启示

这篇论文告诉我们,未来的 AI 想要变得更聪明,不能只靠**“堆数据”(看更多的书、听更多的歌、看更多的视频),更重要的是要教会它们“如何建立联系”**。

  • 以前的 AI:像一个博学的图书管理员,知道书里有什么,但不知道书 A 里的人和书 B 里的人其实是同一个人。
  • 未来的 AI:应该像一个神探,能敏锐地捕捉到不同线索(声音、画面、文字)之间的微妙联系,把碎片拼成完整的真相。

一句话概括
现在的 AI 很博学,但缺乏“串联”能力;作者通过造了一个专门的“连连看”题库,发现并证明了这一点,然后教给 AI 一套**“先找线索、再对号入座”**的思考方法,让它在处理复杂的多媒体任务时,终于不再“指鹿为马”了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →