← 最新论文
🤖 AI

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

本文介绍了 JoyAI-VL-Interaction,这是一个 8B 规模的开源视觉语言模型,它从传统的轮次制响应转向了实时、自主的交互,通过持续监测视觉输入来决定何时说话或委派任务,并配备了一套完整的可部署系统和训练方案,在人类评估中优于现有的视频通话助手。

原作者: Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, Shuai Xie, Shuhuan Gu, Haoyang Huang, Qingyi Si, Nan Duan, Jiaqi Wang

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, Shuai Xie, Shuhuan Gu, Haoyang Huang, Qingyi Si, Nan Duan, Jiaqi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在观看一场现场体育赛事。现在的多数 AI 助手就像是一个反应极快但非常害羞的裁判。它们坐在场边,等待你吹响哨子(提问)才会开口说话。即使球员受伤或进球了,AI 也会保持沉默,直到你大喊:“你看到了吗?”等到了你开口询问时,那一瞬间早已逝去。

JoyAI-VL-Interaction 则不同。它就像一个坐在你身边的聪明且积极主动的教练。它不会等待你开口,它会观察比赛,如果它看到了一些重要的事——比如起火了、球员摔倒了或者出现了有趣的时刻——它会立即开口。它会自主决定何时说话、何时保持沉默,以及何时请一位“高智商”专家来帮忙。

以下是这篇论文如何通过简单的概念来解释这种全新的思维方式:

1. 问题所在:“回合制”陷阱

现在的多数 AI 工作起来就像打网球。你回球(提问),AI 回球(给出答案)。然后它等待你再次回球。

  • 问题在于: 现实世界并不会等待回合。火灾发生了,婴儿正向热炉靠近,或者你想买的产品在屏幕上闪过。如果 AI 还在等待你去询问,它就会完全错过那个瞬间。
  • 论文的观点: 目前的“实时”视频助手(如豆包或 Gemini 应用中的助手)本质上仍然是在秘密地打网球。它们只是每隔几秒钟问自己一次:“我该检查一下屏幕吗?”如果在两次检查之间的间隙错过了瞬间,它们就永远错过了。

2. 解决方案:“观察并行动”的教练

作者构建了一种全新的 AI,它是始终在观察的。它不再等待回合,而是每一秒都在做决策:

  • 保持沉默: 如果没有发生有趣的事情,它会保持安静,以免打扰你。
  • 开口说话: 如果它看到了重要的事情(比如火灾或场景的变化),它会立即发言。
  • 委派任务: 如果它看到了难以立即解决的任务(比如根据手机屏幕编写复杂的计算机代码),它会说:“稍等,让我请教一下专家,”然后将任务发送给后台计算机,同时继续盯着视频。

3. 如何学习:教会 AI “感知”时间

你不能只教 AI 如何说话,你必须教会它何时说话。

  • 训练过程: 研究人员创建了一个庞大的数据集,让 AI 在观看视频的过程中进行练习,逐秒决定是说话还是保持沉默。
  • 类比: 想象你在训练一只狗。你不仅仅是教它“坐下”,你还要教它只有在门铃响起时才坐下,而在邮递员走过时保持安静。这个 AI 学会了在无事发生时“坐下”(保持沉默),并在事件发生时精准地“吠叫”(说话)。
  • 结果: 这个 AI 学会了“主动性”。它不需要你告诉它去看,它只是观察并做出反应。

4. 系统:一套完整的工具包

论文不仅发布了“大脑”,还发布了整个“身体”,以便任何人都能进行构建。

  • 眼睛: 它可以连接到任何摄像头、直播流或监控画面。
  • 声音: 它使用标准工具将想法转化为语音(或文本)。
  • 记忆: 它拥有特殊的记忆系统,可以让它记住数小时前发生的事情,而不会产生混乱或耗尽空间。
  • “委派”按钮: 如果任务太难,它会将任务交给强大的后台计算机,同时继续观察视频并等待答案。

5. 证明:击败巨头

作者使用他们 80 亿参数的模型(相对较小且高效)与 豆包Gemini(使用更大型、更强大模型)中的视频通话助手进行了对比测试。

  • 测试内容: 他们向这两个系统展示了 58 种不同的现实生活场景,例如发现火灾、计数物体或实时翻译字幕。
  • 得分: JoyAI 在面对豆包时胜率达 77.6%,在面对 Gemini 时胜率达 87.9%
  • 原因: 大型模型因为在等待“回合”而反应太慢。JoyAI 察觉到事件并立即发言。在“火灾检测”测试中,JoyAI 的胜率是 100%,而其他系统要么反应太迟,要么根本没注意到。

6. “神奇”的惊喜

最令人惊讶的部分是,AI 发展出了研究人员并未明确教授过的技能。

  • 例子: AI 虽然接受的是观察视频的训练,但它通过观察屏幕变化,学会了如何引导用户使用购物 App。它还学会了通过幻灯片进行即兴演讲。
  • 论文观点: 这表明该 AI 不仅仅是在背诵答案,它正在学习一种通用的“观察与交互”能力,并能将其应用于从未见过的全新场景。

总结

论文认为,我们不应再把 AI 当作一个等待指令的工具,而应将其视为一个存在于世界中的伙伴。通过发布模型、训练数据和完整的系统代码,作者希望帮助世界从“询问并等待”转向“观察并行动”,使 AI 成为一个能在你开口之前就察觉到事物的真正伴侣。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →