← 最新の論文
🤖 machine learning

Identifiable Token Correspondence for World Models

本論文は、識別可能なトークン対応を備えた構造化された確率推論フレームワークを導入することで、Transformer ベースの世界モデルにおける時間的不整合に対処し、困難なベンチマークにおける長視野視覚強化学習の性能を大幅に向上させる。

原著者: Youngin Kim (Interdisciplinary Program in Artificial Intelligence, Seoul National University), Ray Sun (Department of Computer Science and Engineering, Seoul National University), Inho Kim (Department
公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Youngin Kim (Interdisciplinary Program in Artificial Intelligence, Seoul National University), Ray Sun (Department of Computer Science and Engineering, Seoul National University), Inho Kim (Department of Computer Science and Engineering, Seoul National University), Bumsoo Park (KRAFTON), Hyun Oh Song (Interdisciplinary Program in Artificial Intelligence, Seoul National University, Department of Computer Science and Engineering, Seoul National University)

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットがビデオゲームを学ぶ際、毎回実際にプレイさせるのではなく、ゲームについて「夢」を見させるように教えることを想像してみてください。これが研究者たちが「ワールドモデル」と呼ぶものです。ロボットはゲーム世界の精神的なシミュレーションを構築し、実際のゲームに時間やエネルギーを浪費することなく戦略を練習できるようにします。

最近、科学者たちは、多くの現代のチャットボットの背後にあるのと同じ技術である強力な AI であるトランスフォーマーを用いて、これらの精神的なシミュレーションを構築してきました。しかし、これらのトランスフォーマーには奇妙な欠陥があります:未来について「夢」を見る際、誰が誰なのかを混乱させてしまうのです。

問題点:「クローン」と「消え去る演技」

あなたが部屋を歩く猫のビデオを見ていると想像してください。

  • 欠陥: 標準的なトランスフォーマーは次のフレームを見て、「ああ、ここに猫がいて、そしてもう一匹あそこにも猫がいる!」と考えてしまうかもしれません。それは偶然に猫を複製してしまいます。あるいは、次のフレームを見て、「待てよ、猫はいなくなった」と言うかもしれません。実際には猫が椅子の後ろに移動しただけなのにです。さらに、猫を犬に変えてしまうことさえあります。
  • なぜか? トランスフォーマーはビデオを文字の列のように扱います。フレーム 10 の猫が、少し異なる位置にあるだけであって、フレーム 9 の猫と同じ猫であることを本当に理解することなく、次の「文字」(またはピクセルパッチ)を推測しようとします。それは毎回猫をゼロから発明しようとするため、間違いを招きます。

解決策:「動くパズル」(ITC)

この論文の著者であるキム・ヨンイン氏と共著者たちは、**識別可能トークン対応(ITC)**と呼ばれる新しい手法を提案しています。

ビデオゲームの世界を巨大なパズルだと考えてください。

  • 古い方法: パズルがわずかに変化するとき(猫が動くとき)、古い AI はパズル全体を捨てて、ゼロから全く新しいパズルを構築しようとします。時には間違ったピースを組み合わせてしまい、二重の猫や欠けたピースを作ってしまうことがあります。
  • 新しい方法(ITC): 新しい AI は、「ねえ、このパズルの大部分は変わっていないよ!床はそこにあるし、壁もそこにあるし、あの猫も同じ猫で、ただ右に一マス移動しただけだ」と気づきます。

すべてのピースを推測する代わりに、AI は最適輸送と呼ばれる数学的なツール(超スマートな物流プランナーのようなもの)を使用します。次のフレームのすべての部分について、以下の 2 つの質問を投げかけます:

  1. このピースを前のフレームからコピーするだけでいいかな?(例:「この木は動いていないから、昨日の木をそのままコピーしよう。」)
  2. 新しいピースを発明する必要があるかな?(例:「プレイヤーが新しいドアを開けたから、新しいドアのトークンを生成する必要がある。」)

簡単なステップでの仕組み

  1. セットアップ: AI はゲーム画面を小さな正方形(トークン)に分割します。
  2. マッチメーカー: AI が次のフレームを予測する前に、「マッチメイキング」アルゴリズムを実行します。現在の画面と、AI の次の画面に対する推測を照合します。
  3. 決定: アルゴリズムは決定します:「次のフレームのこの正方形は、現在のフレームのあの正方形と一致する。だからそれをコピーしよう。」あるいは、「この正方形は全く新しいものだ;生成しよう。」
  4. 結果: 最終的な予測フレームは、一貫性を保つコピーされたピースと、変化を処理する新しいピースの組み合わせになります。

結果:より優れた夢見る者

研究者たちは、多くの動く部品を持つ 2D オープンワールドアドベンチャーのような複雑なゲームであるCraftaxを含む、いくつかのビデオゲームベンチマークでこれをテストしました。

  • スコア: 旧来の最良の方法は約**67.4%のスコアでした。新しい ITC 手法は72.5%**のスコアを記録しました。
  • 視覚的効果: AI が作成した「夢」(シミュレーション)を見たところ、旧来の方法では猫が突然現れたり消えたりしていました。新しい方法では猫が一貫して保たれていました。猫は複製になったり消えたりすることなく、ある場所から別の場所へ滑らかに移動しました。

なぜこれが重要なのか(論文によると)

この論文は、AI に画像の「トークン」(画像のピース)が時間の経過とともにどのオブジェクトに対応するかを明示的に追跡させることで、AI が(オブジェクトの複製のような)「幻覚」を起こさなくなることを主張しています。これにより、AI の「想像力」ははるかに信頼性が高まり、実際のゲームでより良い戦略を学習できるようになります。

要約すると:この論文は、AI に毎秒世界全体を再描画しようとするのをやめ、すでにそこにあるピースを動かすことを学ぶように教えるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →