LongCat-Video-Avatar 1.5 Technical Report
LongCat-Video-Avatar 1.5 は、生産準備性と体系的なエンジニアリングを優先し、推論の高速化を実現して商用グレードの安定したアイデンティティ一貫性のある長動画生成を提供し、多様なシナリオにおいて最先端のクローズドソースシステムを上回る、アップグレードされたオープンソースフレームワークです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが、写真 1 枚と音声録音 1 つしか持っていないのに、まるで実在する人間のように話し、歌い、演技ができるデジタルキャラクターを作りたいと想像してみてください。長らく、これらのキャラクターを数秒以上「リアル」に見せ続けることは、強風の中でトランプの家をバランスさせるようなものでした。一瞬は良く見えても、すぐに顔がグリッチを起こしたり、口元が言葉と合わなくなったり、体が不自然に動き出したりするのです。
Meituan LongCat チームによる「LongCat-Video-Avatar 1.5」論文は、これらのデジタルキャラクターを構築するための新しいオープンソースの「レシピ」に関する技術報告書です。彼らは全く新しい種類の魔法を考案するのではなく、映画、ニュース、カスタマーサービスなどの実世界での利用に耐えうる安定した結果を生み出すためのエンジニアリングを完璧にすることに焦点を当てました。
以下に、彼らがどのように行ったかを、簡単な比喩を用いて説明します。
1. 「耳」のアップグレード:Whisper Large
旧バージョンでは、モデルは音声エンコーダである Wav2Vec2 という標準的な「耳」を使って声を聞いていました。それはそれなりに機能していましたが、発話の微妙なニュアンスを見逃すことがありました。
- アップグレード: これを、はるかに強力な音声システムであるWhisper Largeに交換しました。
- 比喩: 古い耳は、ノイズの多い部屋で耳栓をして歌を聞いているようなものです。新しい Whisper Large は、静かなスタジオでハイエンドのノイズキャンセリングヘッドフォンを装着しているようなものです。これにより、声のあらゆる微細な细节を聞き取り、長い動画であってもキャラクターの口元が音と完全に一致し、完璧な精度で動くことを可能にします。
2. データのための「ジム」:トレーニングセットのキュレーション
デジタル俳優を教える際、無作為な動画をただ見せるだけでは不十分です。ぼやけた顔の動画、看板を持っている人、あるいは二人が同時に話している動画を見せると、モデルは混乱します。
- 対策: 彼らは厳格な「データジム」を構築しました。単に何千もの動画をシステムに放り込んだのではなく、図書館司書が図書館を整理するように、それらを分類しました。
- 沈黙データ: 誰も話していないとき(瞬き、呼吸、周囲を見渡すなど)に何をすべきかをモデルに教えました。これにより、音声が止まったときにキャラクターが凍りついたり不自然に見えたりすることを防ぎます。
- 感情データ: 笑ったり泣いたり、反応したりする人々の動画をモデルに特別に与え、キャラクターが単に台本を読んでいるロボットのように見えるのを防ぎました。
- 複数人データ: 二人が話しているシーンの扱い方をモデルに教えました。背景にいるキャラクターに「沈黙」の音声トラックを与えるという特別なトリックを使用し、話すはずの人物だけが口を動かし、他の人々は静止したままになるようにしました。
3. 「コーチ」(RLHF):人間のフィードバックからの学習
良いデータがあっても、モデルは依然として、手が少しねじれているように見える、あるいは顔が不自然に動くなどの小さな間違いを犯す可能性があります。
- 手法: 彼らはGroup-Relative Policy Optimization (GRPO) という手法を使用しました。
- 比喩: ダンスインストラクターが生徒を見ている状況を想像してください。「よくやった」や「ダメだ」と言うのではなく、インストラクターは生徒のダンスを他のダンサーのグループと比較して、「あなたの腕の動きは平均より 10% 優れているが、足さばきは 5% 劣っている」と言います。モデルはこの比較から学び、フレームごとに動きを微調整し、手がリアルに見え、体が自然に動くことを保証します。
4. 「ターボモード」:高速化
通常、高品質な動画生成は遅いです。1 時間おきに 5 分ごとにオーブンをチェックしながらケーキを焼くようなものです。
- イノベーション: 彼らは蒸留(Distillation) という手法を用いてプロセスを圧縮しました。
- 比喩: 彼らはモデルに、通常の 50 段階ではなく8 段階でケーキを焼くことを教えました。まるで、ランナーに 50 回の小さな遅いステップではなく、8 回の大きなストライドでレース全体をスプリントするように訓練するようです。その結果、同じくらい良く見える動画が、はるかに高速に生成され、リアルタイムでの利用が可能になります。
5. 結果:比較はどうだったか
チームは、彼らの新しいモデルを、HeyGenやKling Avatarのような現在市場に出ている最高峰の「クローズドボックス(秘密の、有料)」システムと比較してテストしました。
- 結論: 500 以上の異なるシナリオ(トークヘッド、歌唱、アニメスタイル、さらには動物を含む)を用いたブラインドテストにおいて、LongCat-Video-Avatar 1.5 は、これらの高価な商用システムと同等かそれ以上と評価されることが多かったです。
- 主要な勝利:
- リップシンク: 口の動きが音声と完璧に一致しました。
- 安定性: 長い動画の間、キャラクターは点滅したり顔が変わったりしませんでした。
- 同一性: 初めから終わりまで、キャラクターは同じ人物のように見えました。
- 複雑さ: 人がギターを持っている状況や二人が話している状況など、難しい状況でも、背景のキャラクターが誤って口を動かすことなく処理しました。
まとめ
LongCat-Video-Avatar 1.5 は、本質的に「生産準備完了」のツールキットです。AI 動画生成の散漫で実験的な性質を、より優れた耳(Whisper)、より優れたトレーニングデータ(沈黙/感情/複数人)、厳格なコーチ(RLHF)、そして速度向上(蒸留)によって磨き上げました。目標は単にクールなデモを作ることではなく、実ビジネスで信頼性を持って使用できるシステムを構築することでした。そして、彼らはそれが今日利用可能なトップの有料ツールと同等か、それ以上であることを証明しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。