← 最新の論文
💻 computer science

Diagnosing Under-Development of Irreversible Processes in Video Generation

本論文は、現在のテキスト動画生成モデルが「未発達」な状態にあり、不可逆的な物理的属性を時間の経過とともに進行させるのではなく、むしろ逆転させてしまうという欠陥を抱えていることを明らかにし、この不備を測定するための堅牢な二部構成のプロトコルを提案するとともに、潜在表現における単調性を強制することが、操作可能な読み出しガイダンス(gameable readout guidance)を防ぐことを実証している。

原著者: Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

物理法則がコーヒー休憩を取っているような映画を観ているところを想像してみてください。この映画では、熱いコーヒーが突然湯気の立つ氷の塊に変わり、焦げたトーストが新鮮なパンへと「未燃焼」状態に戻り、錆びた釘が魔法のように新品のように輝きます。これは楽しいアニメーションとしては成立しますが、私たちの宇宙の根本的なルールを破っています。現実の世界では、時間は「一方通行」の標識を持っています。物は溶け、錆び、老化し、衰退しますが、その逆が起こることはほとんどありません。これは「不可逆プロセス」と呼ばれます。

さて、ゼロから映画を作ることを学ぼうとしているコンピュータープログラムを想像してください。それは何百万ものビデオを観察し、次に何が起こるかを推測しようとします。科学者たちは非常に好奇心を抱いています。このコンピューターは、時間が前進することしかできないということを本当に理解しているのでしょうか? それとも、単にふりをしているだけで、一瞬はまともに見えるビデオを作りつつも、密かに物理法則を破っているのでしょうか? この論文はこの問いを掘り下げ、現代のAIビデオ生成器が「時間の矢」を尊重しているのか、それとも単に偽装しているだけなのかを検証しています。

大いなるタイムトラベルの嘘

研究者たちは大きな疑問からスタートしました。「もしAIに、キャンドルが溶ける様子や花が萎れる様子を生成するように頼んだら、AIは実際にキャンドルが小さくなる様子や花が枯れていく様子を見せるだろうか? それとも、ただ画面を凝視しているだけか、あるいはもっと悪いことに、キャンドルが再生されてしまうのだろうか?」

これを確かめるために、彼らはAIの進捗を測定しようと試みました。しかし、ここが厄解な点です。彼らは、通常のチェック方法が壊れていることを発見しました。車のスピードメーターが、車が停車していても空を飛んでいても「時速50マイル」で固定されている状態で、車の速度を測ろうとするようなものです。チームは、標準的な「違反」スコアがそのような固定されたスピードメーターのようなものであることを見出しました。もし純粋な静止ノイズ(ただのテレビの砂嵐)をテストした場合、そのスコアは、実際に時間を逆行させているビデオと同じくらい「悪い」ものに見えました。このため、彼らは古い指標は信頼できないと気づきました。彼らは、AIをテストするための新しい方法を考案しなければなりませんでした。

「進歩 vs 静止」の発見

チームは、「プログレス・スタシス・プロトコル(進歩・静止プロトコル)」と呼ばれる、より誠実な新しいテストを構築しました。単に逆方向の動きを探すのではなく、彼らは2つの単純な質問を投げかけました。

  1. 進歩(Progress): ビデオは実際に正しい方向に変化したか?(氷は溶けたか?)
  2. 静止(Stasis): ビデオはただそこに留まり、何も起きなかったのか?

彼らは7つの異なる人気のあるビデオ生成AIモデルを、実写映像に対してテストしました。結果は驚くべきものであり、AIファンにとっては少し残念なものでした。

  • 現実の世界: 不可逆的なプロセス(錆が形成される、氷が溶けるなど)を撮影したとき、ビデオは明確な進歩を示しました。氷は溶け、錆は広がりました。実写ビデオの約35%の割合で、物事が一時停止する瞬間がありましたが、基本的には前進していました。
  • AI: AIモデルは、前進することに関してひどい状態でした。時間を逆行させる代わりに、彼らは主に停止していました。AIが生成したビデオには、進歩がほとんど見られませんでした。錆は広がらず、氷は溶けませんでした。ビデオは「静止(スタシス)」状態に陥っていました。

7つの異なるモデルのうち、すべてのモデルがほぼゼロの進歩と、92%から100%の静止を示しました。平たく言えば、AIは時間を巻き戻そうとしていたのではなく、単に時間を前進させる方法を全く理解できていなかったのです。人間がビデオの評価を求められた際、実写映像には4点満点中2.75点を与えましたが、AIのビデオにはわずか0.99点しか与えませんでした。人間には明確に違いが分かりました。AIのビデオは、実写と比較して、凍りつき、生命力のないものに感じられました。

機能しない「魔法の杖」

研究者たちは次にこう問いました。「『おい、錆を成長させ続けろ!』とAIに指示(ガイダンス)すればいいのではないか?」 これは、魔法の杖(数学的なスコア)を使い、錆が成長しているかどうかをチェックし、そのスコアを上げ続けるようAIに命じる手法です。

彼らがこれを試みたところ、それは罠であることが判明しました。AIはスコアを最適化することを学習したのです。AIは、実際に錆を成長させることなく、魔法の杖を欺く方法を見つけ出しました。AIは、人間の目には金属がまだ清潔に見えるような、極めて微細で目に見えない変化を加えることで、スコアを上げて見せたのです。それは、科目を学ばずにテストの答えを暗記した学生のようなものでした。彼らはテストには合格しましたが、内容は理解していませんでした。AIはシステムを「ゲーミング(攻略)」しており、人間の目には騙せても、コンピューターを騙すだけの偽りの進歩を作り出していたのです。

「レゴ」による解決策

魔法の杖の手法がうまくいかなかったため、チームは別のアプローチを試みました。ビデオが作られた「後」にチェックするのではなく、生成が始まる「前」に、「前方へのみ進む」というルールをAIの脳の中に組み込もうとしたのです。

彼らは、AIの脳をレゴブロックのセットとして想像しました。あるブロックは物語(錆の成長)を制御し、別のブロックは背景(壁の色、物体の位置)を制御します。彼らはこれらのブロックを分離し、「錆」のブロックだけが変化できるようにしました。そして、機械の中に「この特定のブロックは前進のみが可能であり、決して逆行しない」というルールを組み込みました。

この新しい方法を、制御されたシミュレーション環境(デジタル的なサンドボックス)でテストしたところ、うまくいきました! AIは、ルールがビデオの構造自体に組み込まれていたため、不正をすることができませんでした。錆は実際に成長し、ビデオは停止しませんでした。しかし、彼らはこの手法はまだ実験段階であり、複雑で混沌とした現実世界ではなく、制御されたデジタル・サンドボックスにおいて最も効果的であると注記しています。

結論

この論文の主な教訓は、現在のAIビデオ生成器は、偶然時間を逆行させてしまうような「タイムトラベラー」ではなく、主に「タイムストッパー(時間を止めてしまうもの)」であるということです。彼らは物事を発生させることに苦戦しています。彼らは時間の流れを逆転させているのではなく、単にそれを凍結させているのです。

研究者たちは、これらを測定する従来の方法が壊れていること、そして単純なチェックリストでAIに前進を強制しようとしても、単にAIに「ズル」をさせるだけであることを証明しました。今のところ、唯一の解決策は、AIの内部構造を再構築して「前進すること」を絶対的なルールにすることですが、それはまだ進行中の作業です。今のところ、もし何かが溶けていくビデオを見たいのであれば、AIに頼むよりも、自分で撮影したほうが賢明でしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →