← 最新の論文
🤖 AI

TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation

TokenTrimは、モデルのアーキテクチャや学習プロセスを変更することなく、不安定な潜在トークンを特定して再利用される前の段階で削除する推論時の手法を導入することで、自己回帰的な長尺ビデオ生成における時間的ドリフトに対処し、長期的な一貫性を向上させます。

原著者: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

公開日 2026-02-03
📖 1 分で読めます☕ さくっと読める

原著者: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは友人にとても長い物語を話そうとしていると想像してください。しかし、一度に一文しか話すことができません。物語を続けられるようにするには、次の文章が意味を成すように、今言ったことをすべて覚えておく必要があります。

問題:「悪い記憶」効果
AIビデオ生成の世界では、コンピュータもこれと似たことを行います。コンピュータはビデオを短いクリップ(文章のようなもの)として作成し、次に生成するための参照として、直前に作ったものを使用します。これは「自己回帰的(autoregressive)」な生成と呼ばれます。

この論文は、このプロセスにおける重大な欠陥を**「時間的ドリフト(temporal drift)」**として特定しています。あなたが白いトラックについての物語を話している場面を想像してみてください。

  1. あなたは「白いトラックが走っている」と言います。
  2. AIが2番目のクリップで小さなミスを犯します。例えば、トラックが少しグレーに見えてしまいます。
  3. 3番目のクリップで、AIはその「グレーのトラック」を参照するため、トラックをさらに暗くしてしまいます。
  4. 10番目のクリップまでに、トラックは黒くなります。そして20番目のクリップまでには、それは牛に変わってしまうかもしれません。

AIの脳の力が足りなくなっているわけではありません。単に自分自身のミスを再利用しているのです。新しいクリップを生成するたびに、AIはコンテキスト(文脈)を得るために前のクリップを見返します。もしそれらの前のクリップに「汚染された」情報(例:グレーのトラック)が含まれていると、AIはその汚染を真実として扱い、それを次へと引き継いでしまい、エラーを悪化させていきます。そして、ビデオが崩壊するまでエラーが雪だるま式に増えていくのです。

解決策:TokenTrim(「エディター」)
著者らは、新しい手法であるTokenTrimを提案しています。AIが使用するビデオデータを、付箋の束(「トークン」と呼ばれます)だと考えてください。いくつかの付箋には正しい情報が書かれていますが、他の付箋には「汚染された」あるいは不安定な情報が書かれています。

TokenTrimは、AIが次のステップで使用する前に、その付箋をチェックする賢いエディター(編集者)のように機能します。仕組みを簡単な言葉で説明すると以下の通りです。

  1. チェック: AIが次のクリップを作り始める前に、TokenTrimは、これから作ろうとしている新しいクリップの「要約」と、今完了したばかりのクリップの「要約」を比較します。
  2. アラーム: もしビデオの特定の部分(特定の「トークン」や付箋)が、それ以前のものと比べて著しく異なっていたり、不安定であったりする場合、システムはそれをフラグ立てします。それは、「白いトラック」という付箋が突然「紫色のゾウ」になっていることに気づくようなものです。
  3. プルーニング(枝刈り): その悪い付箋を使う代わりに、TokenTrimはそれを捨てます(プルーニングします)。つまり、汚染された情報をAIのメモリバンクから削除します。
  4. リトライ(再試行): そしてAIは、その悪い付箋なしで新しいクリップを生成することを強制されます。AIは、残された安定した付箋に頼って、次に何をすべきかを判断しなければなりません。

結果
「悪い記憶(不安定なトークン)」が次のステップを毒してしまう前に積極的に削除することで、ビデオの整合性が保たれます。トラックは白いまま、人物の顔は溶けず、背景も歪むことなく、ビデオが長時間再生されても一貫性を保つことができます。

論文の重要なポイント:

  • 再学習は不要: これはAIに新しい学習方法を教えることではありません。AIがすでに動いている最中に使える「プラグアンドプレイ」のツールです。モデルを再学習させたり、コードを変更したりする必要はありません。
  • 高速である: このプロセスは、ビデオ制作に追加の時間をほとんどかけません。素早いチェックと素早い削除です。
  • 既存の技術と互換性がある: 著者らは、このToken-Trimを2つの人気のあるビデオ生成手法(Rolling ForcingとSelf Forcing)でテストし、TokenTrimを加えることで、ビデオが崩壊することなく、はるかに高品質で長く持続することを示しました。
  • 「最初のクリップ」のテクニック: 著者らはまた、最初のクリップに対してのみ特別なテクニックを使用することが、安定した土台を作るのに役立ち、プロセス全体をよりスムーズにすることを発見しました。

まとめ
長いビデオ生成が失敗するのは、通常、AIが自分自身のエラーを再利用し続けてしまうからです。TokenTrimは、品質管理フィルターとして機能することでこれを解決します。それはAIのメモリ内のエラーを特定し、それを削除し、クリーンなデータでAIをやり直させるのです。これにより、「間違いの雪だるま式増加」を止め、ビデオをよりリアルで一貫した状態で長く維持することができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →