← 最新论文
💻 computer science

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

本文提出了 Inst-IT 框架,通过构建诊断基准、大规模指令微调数据集及连续训练范式,利用显式视觉提示指令微调显著提升了大语言模型在实例级理解及通用图文视频理解方面的能力。

原作者: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Inst-IT 的新方法,旨在让大型多模态模型(LMMs,也就是能看懂图和视频的 AI)变得更“眼尖”,能更精准地理解画面中的具体细节,而不仅仅是看个大概。

我们可以用几个生动的比喻来理解这项研究:

1. 现状:AI 是个“模糊的观察者”

想象一下,你给一个 AI 看一段视频,问它:“那个穿红衣服的人后来去哪了?”
目前的很多 AI 模型就像是一个站在远处看热闹的路人。它能告诉你:“哦,视频里有一群人,有人在走动,有人在笑。”它能理解整体氛围(Holistic level),但一旦你问起具体的某个人、某件物体(Instance-level),它就开始“犯迷糊”了,甚至可能把穿红衣服的人记成穿蓝衣服的,或者根本找不到那个人。

这就好比让你在一场喧闹的婚礼上,只凭记忆描述“那个戴眼镜的新郎在交换戒指时说了什么”,路人甲(普通 AI)可能只会说“他们交换了戒指”,但说不出细节。

2. 核心问题:缺乏“特写镜头”

现有的 AI 训练数据大多像广角镜头,拍的是整个场景的大全景,告诉 AI“这里有一辆车,那里有棵树”。但人类在交流时,往往更关心特写镜头:比如“那辆车的车牌号是多少?”或者“那棵树上的鸟是什么品种?”
以前的训练数据缺乏这种针对“具体个体”的精细标注,导致 AI 虽然博学,但在细节上很“粗糙”。

3. 解决方案:Inst-IT —— 给 AI 戴上“指路标”

为了解决这个问题,作者团队提出了 Inst-IT。你可以把它想象成给 AI 配备了一套超级指路系统

  • 视觉提示(Visual Prompts):
    在训练时,他们不再直接把原始图片丢给 AI,而是给图片里的每个物体都贴上了一个数字标签(比如给猫贴个"1",给狗贴个"2")。这就像在混乱的派对上,给每个人发了一张带有编号的胸牌。

    • 比喻: 以前 AI 看视频是看“一群人”,现在 AI 看视频是看"1 号先生、2 号女士、3 号小孩”。这大大降低了 AI 的注意力分散,让它能精准锁定目标。
  • 数据工厂(Inst-IT Dataset):
    他们利用强大的 AI(GPT-4o)自动生成了一个巨大的新数据库。这个数据库不仅告诉 AI“这是什么”,还详细描述了:

    • 个体描述: "1 号”穿着什么衣服,手里拿着什么。
    • 时间变化: 从第 1 帧到第 2 帧,"1 号”从站着变成了弯腰。
    • 互动关系: "1 号”把球传给了"2 号”。
      这就像给 AI 准备了一本超级详细的侦探笔记,而不是简单的风景照。
  • 持续训练(Continuous Instruction Tuning):
    他们让 AI 反复阅读这些带有“数字标签”的笔记,就像让学生反复做“找茬”和“细节描述”的练习题,直到它养成关注细节的习惯。

4. 成果:从“大概知道”到“门儿清”

经过这种特训后,AI 的表现有了质的飞跃:

  • 在 Inst-IT 测试中: 它现在能准确回答“那个穿红衣服的人在视频第 3 秒做了什么?”这种以前很难的问题。
  • 通用能力也变强了: 有趣的是,这种对细节的专注并没有让它变笨,反而让它看普通的图和视频也更聪明了。就像一个人练好了“观察细节”的功夫,看地图、读说明书(通用任务)也变得更厉害了。

总结

Inst-IT 就像是给 AI 装上了一副高倍显微镜和一套精准的导航系统。它不再满足于“看个大概”,而是学会了像人类一样,能够指着画面里的具体某个人或某样东西说:“我知道它是谁,它刚才做了什么,它和旁边的人有什么关系。”

这项研究让 AI 从“只会看热闹的路人”,进化成了“能看懂门道的侦探”,这对于未来让 AI 更好地辅助人类(比如监控安全、医疗分析、视频剪辑)具有非常重要的意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →