← 最新の論文
💬 NLP

The JEPA Paradox in Language: The Geometry of Linguistic Alternatives

本論文は、決定論的な結合埋め込み予測アーキテクチャ(JEPA)は、テキストに固有のマルチモーダル性が二乗誤差による潜在表現予測に必要とされる条件付き集中を損なうため、言語においては失敗し、複数の妥当な補完を保持するように目的関数を再設計しない限り、表現の崩壊とダウンストリーム性能の低下を招くと論じている。

原著者: Anh Trac Duc Dinh, Khang Nhat Hoang Vo

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Anh Trac Duc Dinh, Khang Nhat Hoang Vo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに世界の理解の仕方を教えようとしている場面を想像してみてください。これを行うために、科学者たちは「自己教師あり学習」と呼ばれるトリックをよく使います。これは、コンピュータがすでに見たパズルの欠けている部分を推測することで学習するという手法です。画像や動画の世界では、これは魔法のように機能します。もし猫の写真の一部を隠したとしても、コンピュータは、毛並みや耳、そして背景がすべて滑らかで予測可能なパターンによってつながっているため、その下に何があるかを容易に推測できます。猫の頭がどのような形かを知っていれば、その隣にある耳がどのような形であるべきかも正確にわかるのです。JEPA(Joint-Embedding Predictive Architecture)として知られるこの手法は、画像の欠けているピースには通常、たった一つの正解しかないため、画像、動画、音声においてスター選手となりました。

しかし、科学者たちがこれと同じ「欠けているピースを推測する」というトリックを言語に対して使おうとしたとき、奇妙なことが起こりました。言語は画像とは異なります。言語はもっと「選択型のアドベンチャー・ブック」に近いものです。「猫がマットの上で ___ 」という文章の単語を隠した場合、欠けている単語は「座った(sat)」、「横になった(lay)」、「眠った(slept)」、あるいは「遊んだ(played)」など、いくらでも考えられます。これらはすべて成立しますが、それぞれ内容は全く異なります。この論文が取り組んでいる大きな問いは、「なぜ『欠けているピースを推測する』という手法は画像では非常にうまくいくのに、テキストでは無残にも失敗するのか?」ということです。著者たちは、この失敗の背後にある幾何学的な理由を探るべく、本質的に、ピクセルから言葉へと切り替わったときにゲームのルールが変わってしまうのかどうかを問い直しました。

「The JEPA Paradox in Language(言語におけるJEPAのパラドックス)」と題されたこの論文は、問題はコンピュータの知能が足りないことではなく、ゲーム自体がコンピュータに対して不公平に設定されていることだと主張しています。著者たちは、画像の予測器のテキスト版(彼らはこれをT-JEPAと呼んでいます)を構築し、それがリアルタイムで苦戦する様子を観察しました。彼らは、コンピュータに「単一の『平均的な』答え」を推測して欠けている単語を予測させようとすると、コンピュータが混乱することを発見しました。文章を完結させる方法は多種多様であるため、コンピュータは妥協点を見つけようとしてしまいます。その結果、コンピュータは「sat」、「lay」、「slept」を混ぜ合わせたような、実際には存在せず、意味も持たない「幽霊単語(ghost word)」を予測してしまうのです。

研究者たちは、特定の失敗のシーケンス(連鎖)を発見しました。まず、コンピュータは多くの選択肢があるために、高い確信を持って単語を予測できないことに気づきます。次に、この不確実性を扱う代わりに、コンピュータはすべての異なる意味を単一の退屈な一点へと押し込めることで「ズル」をしようとします。これは「重心の退化(centroid degeneracy)」と呼ばれます。虹を説明しようとして、その真ん中にある単なるグレーの点の一箇所を指差すようなものです。そうすると、あらゆる色彩と意味を失ってしまいます。論文は、この崩壊がコンピュータが失敗に気づくよりも前に起こることを示しています。コンピュータの内部マップは縮小し、幸せな文章と悲しい文章の区別さえできなくなり、読解力や検索といったタスクにおいてひどいパフォーマンスをもたらします。

この研究は、コンピュータに単に学習時間を増やしたり、より大きな脳を与えたりすれば解決するという考えを明確に否定しています。失敗の原因は、画像の数学(二乗誤差予測)は単一の鋭い答えを要求するのに対し、言語は自然と多くの可能性の「雲」を提供しているという点にあります。著者らは、コンピュータがこの方法で言語を学ぶためには、それらの可能性を一つの点へと押し潰すのをやめ、代わりに「雲」のような妥当な選択肢の広がりを尊重することを学ぶ必要があると示唆しています。この論文は、AIに言語を教える問題を解決したと主張しているわけではありませんが、現在の「画像スタイル」のアプローチがなぜテキストに対して壁に突き当たるのかについて明確な地図を提供しており、人間の言葉の持つ美しく混沌とした曖昧さを扱える新しい手法への道筋を示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →