← 最新の論文
🤖 machine learning

Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates

Human-JEPAは、アンカー付き予測を通じてビデオで学習された人間中心のビジョンモデルであり、既存の特化型モデルよりも大幅に少ないパラメータ数で、静的な知覚と未来の予測の両方において最先端の性能を同時に達成し、動きの理解やモデル崩壊に関する従来の限界を克服している。

原著者: Hui Wei, Licai Sun, Guoying Zhao

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Hui Wei, Licai Sun, Guoying Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人間の視覚は、二つのエンジンを備えた仕組みである。それは単に「今」起きていることを記録するだけでなく、次に何が起こるかを常にシミュレーションしている。誰かがコップに手を伸ばすのを見るとき、脳は同時にその人物を特定し、姿勢を追跡し、手が到着する前に、まさにどこに着地するかを正確に予測する。数十年にわたり、人工知能はこの方程式の後半部分を再現することに苦心してきた。機械は、人物の顔や服装、ポーズを識別するといった、一枚の静止画を分析することには非常に長けてようになったが、時間の流れに対しては依然としてほとんど盲目なままである。それらは静止画を詳細に記述することはできるが、動画の中の未来の動きを予見することはできない。このギャップにより、人間の理解の大部分がコンピュータの手の届かないところに置かれ、自然で安全な形で世界と相互作用する能力が制限されてきた。

新たな研究は、この隔たりを埋めるために設計された「Human-JEPA」と呼ばれるシステムを紹介している。研究者たちは、人間によるラベル付けや手動の注釈を一切使わず、ビデオ映像のみを用いて、現在を認識し、かつ未来を予測することを同時に学習するモデルを構築した。彼らの発見の核心は、システムの学習方法にある。人間の動きについて機械に教えようとするこれまでの試みは、学習プロセス自体に欠陥があったために失敗することが多かった。システムがビデオから学習しようとすると、静的なパターンをコピーすることに集中しすぎるあまり、肢の形状や衣服の質感といった人間の体の細部を理解する能力を密かに失ってしまうのである。研究者たちは、システムの身体に関する記憶を固定された出発点に繋ぎ止め、過去の欠落した部分を埋めるのではなく、未来を予測させるように強制することで、この崩壊を防げることを見出した。その結果、このモデルは、分野における従来のリーダーたちよりも大幅に小型でありながら、人間の動きの追跡や個人の識別において、未来を予測する能力を維持したまま、それらを凌駕する性能を発揮した。

チームが直面した課題は、既存の強力なモデルが静止画に基づいて訓練されていることだった。これらのモデルは写真を読むことには優れているが、動きを理解してはいない。人間が動いている状態を理解するシステムを作るために、研究者たちは、インターネットから一般的なパターンをすでに学習済みのビデオベースのモデルから着手した。そして、それを人間に特化させた。しかし、単にこのモデルにより多くの人間の動画を見せるだけではうまくいかなかった。システムは劣化し始め、身体の部位や衣服といった微細な詳細を認識する能力を失っていった。これは、学習プロセスにおいてエラー信号すら表示されないほど微妙な失敗であった。モデルは、動き方を学ぼうとする過程で、人間がどのような姿をしているのかを忘れてしまっていたのである。

これを解決するために、研究者たちは「アンカー付き予測(anchored forecasting)」と呼ぶ手法を導入した。新しいスキルを学ぼうとしている学生に対し、すでに知っている基礎を忘れるように命じたと想像してみてほしい。その学生は混乱し、基礎を失ってしまうだろう。研究者たちは、システムの形態に関する理解を、元の知識の凍結された不変のコピーに「ピン留め」することで、これを防いだ。このアンカーによって、モデルが未来の動きを予測することを学習している間も、現在の認識能力を失わないようにしたのである。さらに、人物の静止画を用いたトレーニングデータのストリームを追加することで、システムが人間の外見に対する鋭い感覚を維持できるようにした。この組み合わせにより、モデルは人間の体の詳細な知覚を維持しながら、動きを予見することを可能にした。

第二の大きな変更は、学習中のテスト方法に関するものである。標準的な手法では、モデルにビデオの欠落したブロックを埋めるよう求めることが多いが、これは周囲の時間的・空間的な情報を単にコピーすることを助長してしまう。これは、シーンがどのように展開するかを真に学習することを妨げるショートカットである。研究者たちはこれを、純粋な「過去から未来への分割」に置き換えた。モデルにはビデオクリップの前半部分を見せ、後半部分を予測させるようにした。未来が完全に隠されているため、成功するためには、シーンが時間の経過とともにどのように変化するかという真のモデルを構築する以外に道はなかった。これにより、システムは静的なパターンを暗記するのではなく、人間の動きのダイナミクスを学習することを強制されたのである。

このアプローチの結果は驚くべきものだった。凍結されたチェックポイント(つまり、テスト中にさらなる学習を許可しない状態)でテストした際、新しいモデルは、パラメータ数が2.7倍少ないにもかかわらず、利用可能な最大かつ最も特化したヒューマンビジョンモデルを凌駕した。それは、人間のポーズの追跡や、群衆の中での個人の識別において、より高い精度を達成した。例えば、人物の再識別に関する標準的なテストにおいて、自身のベースバージョンよりも2.7ポイントスコアを向上させ、画像ベースの専門モデルをも上回った。おそらく最も重要なことは、これらの変更によって未来を予測する能力が損なわれなかったことである。実際、システムの予測ヘッドは、他の能力を損なうことなく予測能力を向上させた最初の例となった。

研究チームは、直感的に思いつくいくつかのアイデアが機能しないことも厳格に検証し、排除した。彼らは、人物自身を予測の単位とし、人物全体をマスクすることで、モデルがパートナーを追跡できるかどうかを試みた。しかし、このアプローチは完全に失敗し、相互作用を理解する能力を崩壊させた。また、単にデータを増やしたりモデルのサイズを大きくしたりしても、学習手法によって引き起こされる根本的な問題は解決しないことも分かった。失敗の原因は、データの不足や計算能力の不足ではなく、学習目的の構造における根本的な欠陥にあったのである。研究は、人間を時間の中で理解するための鍵は、単に彼らを見る(watch)ことではなく、形態の知覚を固定しながら、未来を予測させる(predict)ことにあると結論づけている。

この研究は、人工知能の新しい方向性を確立している。一つのモデルが、現在という静的な知覚と、未来という動的な予見という、以前は別々のアプローチが必要だと考えられていた二つのタスクを、見事に両立できることを証明した。詳細な知覚の静かな崩壊を防ぎ、真の学習を妨げるショートカットを取り除くことで、研究者たちは、人間をありのままの姿、すなわち、時間の中に存在し、動き、変化する実体として捉えるシステムを作り上げた。この知見は、機械が真に人間を理解するためには、単に過去を振り返る(look back)のではなく、未来を見据える(look forward)ことを教えられなければならないことを示唆している。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →