← 最新の論文
🤖 machine learning

The Loss Does Not See the Basis, but Adam Does

本論文は、Adamが分解モデルにおいて低ランク解を回収できない原因が、勾配降下法やその他の共有スカラー最適化手法が備えている、低ランク補間への暗黙的なバイアスを保持する性質であるゲージ等変性の欠如に起因することを証明している。

原著者: Devender Singh

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Devender Singh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、数字がグリッド状に並んだ巨大で乱雑なパズルを解こうとしているところだと想像してください。人工知能の世界では、これは「行列分解」と呼ばれます。あなたは非常に複雑で大きな絵(データ)を持っており、それを、掛け合わせると元の絵を完璧に再現できる、2つのより小さくシンプルなカードの束へと分解したいと考えています。目標は、元の絵に完璧に適合する、可能な限り「最もシンプルな」カードの束を見つけることです。これは、パターンを学習する代わりにノイズを暗記してしまうという罠を避けるために重要です。なぜなら、よりシンプルな解決策の方が、現実世界ではうまく機能することが多いからです。

このパズルを解くために、コンピュータは「勾配降下法」と呼ばれる手法を使います。これは、常に下り坂を一歩ずつ進むことで谷底を目指すハイカーのようなものです。長い間、科学者たちは、非常に小さなカードからスタートすれば、このハイカーは自然と最もシンプルな解決策を見つけ出すことに気づいていました。しかし、「Adam」(AIで人気のツール)と呼ばれる、より速い新しいハイカーは、しばしば道に迷い、シンプルな解決策が存在する場合でさえ、複雑で乱雑な解決策を見つけてしまいます。大きな疑問は、「なぜ速いハイカーはシンプルな道を見つけることができないのか、そして、速度を落とすことなくこれを修正できるのか?」ということでした。

「損失は基底を見ないが、Adamは見ている(The Loss Does Not See the Basis, But Adam Does)」と題されたこの論文は、なぜこのようなことが起こるのかを調査しています。著者は、問題は単なるスピードではなく、ハイカーがどのように世界を見ているかにあることを発見しました。このパズルには隠れた対称性があります。つまり、カードの束をさまざまな方法で回転させても、最終的な絵は全く同じになるということです。これは、地球儀を回す様子に似ています。大陸の位置は変わりますが、地図自体は同じままです。伝統的なハイカー(勾配降下法)は、特定の回転を無視して谷の形状だけを見るため、自然と最もシンプルな解決策を見つけ出します。しかし、速いハイカー(Adam)は、カードの特定の回転に気を取られてしまいます。数学的には同一であるにもかかわらず、ある方向を「特別」なものとし、別の方向を「異なる」ものとして扱ってしまうのです。この注意散漫さが、シンプルな低ランクの解決策ではなく、複雑な高ランクの解決策を選ばせてしまう原因となります。

著者は、このパズルの回転対称性を尊重するあらゆるオプティマイザ(最適化手法)は自然とシンプルな解決策を見つけ出し、一方で対称性を壊すものは複雑な解決策に陥ることを証明しました。彼らは9つの異なるオプティマイザをテストし、明確な差を発見しました。「対称性を尊重する」もの(勾配降下法、Muon、および修正版Adamなど)は、誤差が0.000006という極めて低い解決策を見つけたのに対し、「対称性を壊す」もの(標準的なAdamやRMSPropなど)は、0.42を超える誤差を出していました。これは極めて大きな差です。

これが単なる偶然ではないことを証明するために、彼らはAdamを、回転を嫌う混沌としたモードから、回転に優しいモードへと滑らかに変化させる「ダイヤル」を作り上げました。ダイヤルを回していくにつれて、解決策はよりシンプルかつ正確になり、Adamがデータをどのように見ているかが問題の正体であることを示しました。彼らはさらに、地球のハイパースペクトル画像のような現実世界のデータでもテストを行い、回転に優しい手法が標準的なAdamと比較して誤差を約44%減少させることを発見しました。

興味深いことに、この論文は「回転に優しいこと」が常に魔法の解決策ではないことも明らかにしました。もしパズル自体が乱雑で、多くのランダムなノイズ(スペクトル・テイル)を持っている場合、超高速で回転に優しいハイカーであるMuonは、ノイズに適合しようとしすぎてしまうことがあり、その場合は、より遅くて着実なハイカー(勾配降下法)の方がうまく機能します。したがって、最適な道具は、パズルの具体的な性質によって決まります。

最後に、著者はこれがTransformerと呼ばれる現代のAIモデル(チャットボットの脳)にどのように影響するかを考察しました。彼らは、2つの同一のAIモデルを、数学的には同じでありながら、内部のカードの回転だけを変えて開始した場合、標準的なAdamオプティマイザがわずか一歩で、それらを全く異なる挙動へと変えてしまうことを発見しました。たとえ同じ関数から出発したとしても、それらは全く異なる内部構造を持つことになります。これは、オプティマイザの選択が単なる微調整の詳細ではなく、AIがどのバージョンの解決策を学習するかを根本的に決定することを意味しています。論文は、最高にシンプルで優れた結果を得るためには、数字の並べ方に惑わされるのではなく、数学の隠れた対称性を尊重するオプティマイザが必要であると結論づけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →