← 最新论文
💻 computer science

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

本文介绍了 InteracVid,这是首个开源的大规模数据集,包含从直播视频中提取的超过 454,000 个“上下文-查询-响应”三元组,它提供了训练多模态模型以针对外部用户刺激生成自然、因果相关的视听响应所需的关键交互结构化监督。

原作者: Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人成为终极的对话伙伴。到目前为止,我们大多只是在教机器人通过文本进行交流,就像一个非常聪明的聊天机器人。但现实生活不仅仅是屏幕上的文字;它是一种全感官的体验。当你问一个朋友问题时,他们不仅仅是用一句话来回答;他们可能会挑一下眉毛、笑一下、挥挥手,甚至拿起一个物体展示给你看。这篇论文处于**多模态人工智能(multimodal AI)**的世界中,这是构建能够同时看、听、说计算机的专业术语。面临的巨大挑战在于,虽然我们已经有了出色的工具让机器人去“描述”事物(比如“一只猫坐在垫子上”),但我们还没有足够的训练数据来教会它们如何实时针对特定的人提出的问题做出“反应”,并展现出正确的面部表情、手势和声音。这就像是读剧本与在搭档面前即兴表演场景之间的区别。

于是,由清华大学研究人员创建的一个名为 InteracVid 的大规模新数据集应运而生,它就像一个巨大的“现实生活反应”图书馆。该数据集并非仅仅描述视频,而是捕捉了主播(正在进行直播视频的人)听到观众提问后,立即以微笑、手势或口头回答做出反应的精确瞬间。研究人员抓取了超过 59,000 段直播视频,并从中提取了超过 454,000 个这种完美的“提问与反应”时刻。他们发现,在现实环境中,主播会对从“这是什么游戏?”到“你的背疼吗?”等各种问题做出全身性的、视听结合的反应。

团队构建了一个巧妙的两步系统,将这些杂乱的数据转化为训练工具。首先,他们利用人工智能来识别长视频中的哪些部分是针对聊天评论的真实反应,哪些部分只是主播在自言自语。对于缺失聊天记录的视频,他们利用人工智能根据主播的反应来推测可能的问题是什么,从而创建一个仍然与真实视频相匹配的“重建”问题。最终,他们得到了一个包含 39,000 对真实问答和 414,000 对重建问答的数据集,涵盖了从烹饪节目到游戏环节的所有内容。

当他们在新一代 AI 模型上测试这个数据集时,结果既令人振奋又充满细微差别。他们发现,仅仅将这种“交互数据”喂给 AI,就能显著提高其生成看起来和听起来都像真人做出反应的视频的能力。具体而言,在 InteracVid 上进行微调可以显著提升视频生成器的输出质量,使唇形同步和手势变得更加自然。然而,研究人员也发现了一个瓶颈:最难的部分不在于让视频看起来好看,而在于首先弄清楚“该说什么或做什么”。即使拥有最好的视频生成器,如果 AI 没能正确理解用户的提问,其反应也会偏离主题。他们的实验表明,虽然我们现在可以教会机器人如何很好地“表演”一次反应,但教会它们如何“规划”正确的反应仍然是最大的障碍。论文总结道,InteracVid 是至关重要的第一步,它提供了构建 AI 数字人所需的、关于人类互动的“地面真值(ground truth)”,让这些数字人不仅看起来真实,而且能让你感觉到他们真的在倾听并回应你。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →