← 最新论文
💻 computer science

Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search

该论文介绍了 Seg-ReSearch,这是一种通过将交替推理与外部搜索相结合,来克服多模态大语言模型冻结知识局限性的新颖分割范式,并通过一个新的基准测试(OK-VOS)以及一种在开放世界分割任务上达到最先进性能的分层奖励训练策略进行了验证。

原作者: Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题:“冻结的大脑”

想象你有一个非常聪明的机器人助手,它非常擅长观察图片和视频。它可以告诉你:“那是条狗,”或者“那是辆红色的车。”然而,这个机器人有一个**“冻结的大脑”**。它的知识在它被制造出来的那一天就被锁定了。

如果你问它:“昨晚谁获奖了?”或者“帮我找找昨天刚上市的新玩具,”机器人就卡壳了。它不知道在它大脑被冻结之后发生了什么。这就像一个图书管理员,他手里的书只印刷到2024年;如果你问关于2025年的事件,他们无法提供帮助,即使他们非常聪明。

目前的AI模型就是这样的图书管理员。它们擅长推理,但无法通过查阅新信息来解决问题。

解决方案:Seg-ReSearch(带着手机的侦探)

作者创建了一个名为 Seg-ReSearch 的新系统。不要把这个系统看作图书管理员,而要把它看作一个带着智能手机的侦探

当你给这个侦探一个复杂的任务时——比如“找到在特定人物上太空的那天主持节目的艺人”——侦探不会仅仅靠猜测。相反,他们遵循一个动态的过程:

  1. 思考: “我不知道那个人上太空的具体日期。我需要查一下。”
  2. 搜索: 他们使用手机(互联网)来查找日期。
  3. 再次思考: “好了,现在我知道日期了。我需要找出那天是谁主持了节目。”
  4. 再次搜索: 他们查找主持人名单。
  5. 发现: “啊哈!是 Ariana Grande。现在,让我看看视频找到她的脸。”
  6. 指向: 他们在视频中圈出那个人。

这种“交替进行”的过程意味着 AI 会暂停思考去搜索网页,阅读所找到的信息,然后继续思考。它打破了“冻结大脑”的限制。

挑战:教导侦探如何更好地搜索

你可能会想:“就让 AI 随心所欲地搜索网络吧。”但研究人员发现了一个棘手的问题:你如何教 AI 进行“正确”的搜索?

如果你只在 AI 得到最终正确答案时才奖励它(就像只在学期结束时才给学生打分),AI 就会变得懒惰。它可能会跳过辛苦的搜索过程,直接靠猜来碰运气。

如果你为 AI 的每一步操作都给予奖励(就像为写的每一个句子都给分),AI 可能会陷入死循环,为了刷分而去搜索一些毫无意义的东西,而没有真正解决问题。

解决方法:“层级化奖励”(教练的策略)
作者设计了一种特殊的评分系统(奖励机制)来训练 AI,就像教练训练运动员一样:

  • 初始引导(起跑线): 教练会仅仅因为 AI 迈出了“正确的第一步”就给予小额奖励。这确保了 AI 朝着正确的方向开始,而不是强迫它必须完全模仿教练的第一步动作。
  • 递减的过程奖励(马拉松配速): 在 AI 搜索的过程中,它会获得积分,但随着搜索次数的增加,积分会逐渐减少。这鼓励 AI 搜索足够的信息来找到答案,但也防止它为了刷分而无休止地搜索下去。这教会了 AI 如何保持高效。
  • 结果奖励(终点线): 最后,只有当 AI 正确识别并圈出视频中的目标物体时,它才会获得巨大的奖励。

这种平衡教会了 AI 成为一名聪明、高效的侦探,而不是一个懒惰的猜谜者或强迫症式的搜索者。

新的测试:OK-VOS

为了证明他们的系统有效,研究人员构建了一个新的测试,称为 OK-VOS(外部知识视频目标分割)。

想象一个如果不通过谷歌搜索就无法回答的视频问答:

  • 问题: “找到视频中获得‘最佳新人奖’的人,但前提是他们在2025年获奖。”
  • 旧的 AI: “我不知道那是谁。我的训练数据截止到2024年。”
  • Seg-ReSearch: “让我查查新闻……好了,我找到了获奖者。现在让我去视频里找到他们。”

结果显示,Seg-ReSearch 彻底碾压了竞争对手。当其他模型在这些“外部知识”问题面前挣扎甚至完全失败时,Seg-ReSearch 利用其“搜索-推理”循环找到了答案,并准确地指向了正确的人或物体。

总结

Seg-ReSearch 是一种让 AI 观察视频的新方式。它不再仅仅依赖于过去记忆中的知识,而是学会了思考、搜索网络、再次思考、再次搜索,直到找到答案。它使用了一种特殊的训练方法,以确保 AI 是在进行智能搜索,而非随机搜索。这使得它能够处理关于新事件、新产品以及那些在 AI 构建时无法预见的特定事实的现实世界问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →