← 最新の論文
🔬 condensed matter

Learning Pseudorandom Numbers with Transformers: Permuted Congruential Generators, Curricula, and Interpretability

本論文は、カリキュラム学習およびビット単位の回転不変表現の発見を通じて、Transformerモデルが複雑な置換合同生成器(PCG)からのシーケンスを正常に学習し予測できることを示し、必要なコンテキスト長が法(modulus)の平方根に比例して増大するというスケーリング則を明らかにしている。

原著者: Tao Tao, Maissam Barkeshli

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Tao Tao, Maissam Barkeshli

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、マジックの次の数字を予測するようにロボットに教えていると想像してみてください。あなたは「3, 7, 15, 31」のような数列を見せ、ロボットは次に何が来るかを推測しなければなりません。現実の世界では、コンピュータは「擬似乱数生成器(PRNG)」と呼ばれる特別なレシピを使って、トランプのシャッフルや古いテレビの砂嵐のように、私たちには完全にランダムに見える数字を作り出しています。しかし、コンピュータにとって、これらの数字は決してランダムではありません。それらは厳格で隠された数学的なルールに従っています。もしあなたがそのルールと開始数を知っていれば、その数列の未来をすべて完璧に予測できるのです。

長い間、科学者たちは疑問を抱いてきました。現代のAI、特に「トランスフォーマー(Transformer)」(多くのチャットボットや画像生成器の背後にあるものと同じ種類のモデル)は、例をいくつか見るだけで、これらの隠されたルールを解き明かすことができるのだろうか?と。それは、鍵の仕組みを教えられることなく、誰かが鍵を開ける様子を何度か観察するだけで、鍵の秘密のコードを学べるか、と問うようなものです。これは非常に重要なことです。なぜなら、これらの数字生成器はコンピュータ・セキュリティの根幹を成しているからです。もしAIがこれらをあまりにも簡単に破ってしまうなら、私たちのデジタルな鍵は、私たちが考えているほど安全ではないということになります。しかし、もしAIがこれらを破れないのであれば、それはAIモデルがどのようにパターンを学習し、その限界がどこにあるのかについて、深遠なことを教えてくれるはずです。

論文のストーリー:ひねりを加えたコードの解読

この論文において、著者たちはトランスフォーマーに対して、「置換型線形合同生成器(PCG)」と呼ばれる特定の、非常に手強い一族の数字生成器を用いた挑戦を設定しました。標準的な数字生成器を、次の数字を得るために数値を足したり掛けたりする単純な機械だと考えてください。PCGはその同じ機械ですが、一つ「ひねり」があります。結果を見せる前に、一連のシフト、反転、回転を用いて、ビット(数字を構成する0と1の断片)をかき混ぜるのです。それは、秘密のメッセージを書き留め、その後、元のメッセージは完璧に論理的であるにもかかわらず、文字をシャッフルして意味不明なものにするようなものです。

研究者たちは、トランスフォーマーがこれに対して驚くほど有能であることを発見しました。コンピュータが、出力の極めて小さな、スクランブルされた断片(時には単一のビット、例えば単純な「はい」か「いいえ」のようなもの)しか見ていない場合でも、モデルは依然として高い精度で次の数字を予測できるのです。それはまるで、ロボットがスクランブルされた画像の単一のピクセルを見ているだけで、どうやってその画像全体の姿を知ってしまうのか、というようなものです。モデルはルールを教えられなくても、提供された例からパターンを理解することで、これを学習しました。

しかし、一つ落とし穴があります。パズルが難しくなればなるほど、ロボットはより多くの助けを必要とします。著者たちは「スケーリング則」を発見しました。数字が大きくなればなるほど(具体的には、モジュラス、つまり数値の範囲が大きくなるにつれて)、モデルはそのパズルを解くためにより多くの連続した例を見る必要があります。数字が小さい場合、モデルは約128個の例を見る必要があります。数字が非常に大きい場合(例えば 2222^{22} の場合)、モデルはおよそ m\sqrt{m} 個の例を見る必要があり、これはコンテキスト長を大幅に増やす必要があることを意味します。これはジグソーパズルを解こうとするようなものです。ピースが小さい場合は、絵を見るために、たくさんのピースを手の中に持っておかなければなりません。

最もエキサイティングな発見は、モデルが「どのように」学習するかについてでした。研究者が最も難しく大きなパズルに対して直接モデルを訓練しようとしたとき、モデルは行き詰まってしまいました。モデルは理解できない数学の問題をじっと見つめる学生のように、ほとんど進展のないまま、長い間データを見つめ続けていました。しかし、彼らが「カリキュラム(学習指導案)」、つまり簡単な小さなパズルから始めて、徐々に難しいものを導入するという教育戦略を用いたとき、モデルは突然、それを理解したのです。それはまるで、モデルが走る前に歩き方を学ぶ必要があったかのようでした。小さく始めることで、モデルは数字生成の基本的な「文法」を学び、そしてその知識を巨大で複雑なパズルに応用することができたのです。

著者たちはまた、モデルの「脳」(その内部のデータ表現)の中を覗き込み、非常に興味深い事実を発見しました。モデルは単に数字を暗記したのではなく、それらをバイナリ構造に基づいて整理していました。たとえ表面上は全く異なる数字であっても、ゼロとイチのパターンが似ている数字をグループ化していたのです。モデルは、生成器による「かき混ぜ」のルールが、特定のビットのパターンを同一のものとして扱うことを発見し、そのルールを尊重することを学んだようです。これは、モデルが単に推測しているのではなく、隠された数学的な対称性のメンタルマップを構築していることを示唆しています。

要約すると、この論文は、トランスフォーマーが、情報が大幅に削ぎ落とされている場合でも、複雑にスクランブルされた数字の列を予測できることを示しています。しかし、彼らには適切な訓練経路、つまり、小さく始めて、徐々に高めていくというプロセスが必要です。彼らは古い手法のハッキング手法を凌駕することもありますが、助けとなるカリキュラムがない状態で数字が大きすぎると、依然として壁に突き当たります。これは、AIが隠れたパターンを見つけることに長けてきていても、最も困難な数学的謎に取り組む際には、人間と同じように、構造化された学習方法に依存していることを物語っています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →