← 最新论文
💻 computer science

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 是一个升级版的开源框架,它优先考虑生产就绪性和系统工程,以提供商业级、稳定且身份一致的长视频生成,并具备加速推理能力,在多种场景下超越了领先的闭源系统。

原作者: Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想创建一个能像真人一样说话、唱歌和表演的数字角色,但你手中只有一张他们的照片和一段他们的语音录音。长期以来,让这些角色在几秒钟以上的时间里保持“真实”感,就像在狂风中试图平衡一座纸牌屋:它们可能瞬间看起来不错,但随后面部会出现 glitches,嘴唇与语音不同步,或者身体开始出现奇怪的移动。

美团 LongCat 团队发布的 LongCat-Video-Avatar 1.5 论文是一份技术报告,介绍了一种构建这些数字角色的全新开源“配方”。他们并非发明一种全新的魔法,而是专注于完善工程技术,使结果足以稳定地应用于现实场景(如电影、新闻或客户服务)。

以下是他们实现这一目标的方法,辅以简单的类比进行说明:

1. “耳朵”升级:Whisper Large

在旧版本中,模型使用标准的“耳朵”(一种名为 Wav2Vec2 的音频编码器)来聆听语音。这尚可,但有时会遗漏语音的细微差别。

  • 升级:他们将其替换为功能更强大的音频系统 Whisper Large
  • 类比:想象旧耳朵就像有人在嘈杂房间里戴着耳塞听歌。而新的 Whisper Large 则像是在安静的录音棚里戴上了高端降噪耳机。它能捕捉到声音的每一个细微细节,从而使角色的嘴唇能够以完美的精度移动,即使在长视频中也能与声音精确匹配。

2. 数据的“健身房”:训练集的精心策划

你不能仅仅通过向数字演员展示随机视频来训练它们。如果你展示的视频包含模糊的脸部、有人举着牌子,或者两个人同时说话,模型就会感到困惑。

  • 解决方案:他们建立了一个严格的“数据健身房”。他们并非简单地将数千个视频 dumped 进系统,而是像图书管理员整理图书馆一样对它们进行分类:
    • 静默数据:他们教导模型当没有人说话时该做什么(例如眨眼、呼吸、环顾四周),这样当音频停止时,角色就不会冻结或显得怪异。
    • 情感数据:他们特意向模型输入了人们展示不同情绪(大笑、哭泣、反应)的视频,这样角色就不会看起来像是一个正在朗读剧本的机器人。
    • 多人数据:他们教导模型如何处理两个人交谈的场景。他们使用了一种特殊技巧(给背景角色提供“静默”音轨),这样只有应该说话的人才会动嘴,而其他人则保持静止。

3. “教练”(RLHF):从人类反馈中学习

即使拥有良好的数据,模型仍可能犯一些小错误,比如手部看起来略微扭曲,或者面部移动不自然。

  • 方法:他们使用了一种称为 组相对策略优化 (GRPO) 的技术。
  • 类比:想象一位舞蹈教练正在观察一名学生。教练不仅仅是说“做得好”或“做得差”,而是将学生的舞蹈与一组其他舞者进行比较,然后说:“你的手臂动作比平均水平好 10%,但你的步法差 5%。”模型从这些比较中学习,逐帧微调其动作,确保手部看起来真实,身体移动自然。

4. “涡轮模式”:提升速度

通常,高质量的视频生成非常缓慢。这就像烤蛋糕,你必须在一小时内每 5 分钟检查一次烤箱。

  • 创新:他们使用了一种称为 蒸馏 (Distillation) 的技术来压缩该过程。
  • 类比:他们教导模型用 8 步 完成烤蛋糕,而不是通常的 50 步。这就像训练一名跑步者用 8 大步跑完全程,而不是用 50 个缓慢的小步。结果是生成的视频质量一样好,但速度快得多,使其适用于实时应用。

5. 结果:表现如何?

该团队将他们的新模型与目前市场上最好的“黑盒”(秘密、付费)系统进行了测试,例如 HeyGenKling Avatar

  • 结论:在包含 500 多种不同场景(包括说话头像、唱歌、动漫风格,甚至动物)的盲测中,LongCat-Video-Avatar 1.5 经常被评定为 优于或等同于 这些昂贵的商业系统。
  • 关键胜利
    • 唇形同步:嘴部动作与音频完美匹配。
    • 稳定性:角色在长视频中不会闪烁或改变面部。
    • 身份一致性:角色从头到尾看起来是同一个人。
    • 复杂性:它能处理棘手的情况,例如一个人拿着吉他,或者两个人交谈,而背景角色不会意外地动嘴。

总结

LongCat-Video-Avatar 1.5 本质上是一个“生产就绪”的工具包。它将 AI 视频生成杂乱无章的实验性质,通过更好的“耳朵”(Whisper)、更好的训练数据(静默/情感/多人)、严格的“教练”(RLHF)以及速度提升(蒸馏)进行了打磨。其目标不仅仅是制作一个酷炫的演示,而是构建一个足够可靠、可用于真实商业业务的系统,并且他们证明了其效果与当今可用的顶级付费工具一样好(甚至更好)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →