← 最新の論文
🔬 physics

Thermodynamic cost of inference and learning in physical neural networks

本論文は、物理的ニューラルネットワークにおける準静的な推論には熱力学的コストが発生しない一方で、パラメータの学習には不可避なエネルギー消費が伴うことを示しており、ニューラル計算の根本的な熱力学的代価は、算術処理ではなくメモリ蓄積によって決定されることを立証している。

原著者: Alexei Tkachenko

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Alexei Tkachenko

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが問題を解決したり、新しいパターンを学習したりするたびに、それはエネルギーを消費します。これは、データセンターに電力を供給する巨大な発電所や、ノートパソコンから放出される熱として目にすることができます。何十年もの間、科学者たちは、このエネルギーコストのうちどれほどが現在の技術の単なる欠陥であり、どれほどがどの機械も決して逃れることのできない自然界の根本的な法則なのかという疑問を抱いてきました。デジタルコンピュータに関する標準的な答えは、「ランダウアーの原理」と呼ばれる規則に由来します。これは、もし機械が情報を消去する場合、微量で避けられない熱を放出しなければならないというものです。この規則は、情報が「オン」または「オフ」のような明確で安定した状態として保存される、プロセッサ内部のバイナリスイッチに適用されます。しかし、現在多くの研究者が、異なる種類のコンピュータを構築しています。これらは物理的ニューラルネットワークであり、光、機械部品、または電子回路で作られたデバイスで、ボールが最も低い点を見つけるために丘を転がり落ちるように、バランスの取れた状態へと落ち着くことで計算を行います。これらの機械は硬直したスイッチを切り替えることに依存しないため、ビットを消去することに関する古い規則が、それらには同じようには適用されない可能性があります。問題は、これらの新しい機械が、ほとんどエネルギーを消費せずに計算や学習を行えるのか、それとも彼らもまた、厳しい物理的限界に縛られているのかという点です。

ブルックヘブン国立研究所の研究者が、これらの物理的ネットワークがどれだけのエネルギーを必要とするかを正確に描き出しました。彼らは実験室で物理的なデバイスを構築したのではなく、ニューラルネットワークをバネと重みのシステムとして扱う詳細な数学的モデルを作成しました。彼らのモデルでは、ネットワークの層間の接続は硬直した指示ではなく、システムを特定の形状へと引き寄せるバネのような弾性拘束です。ネットワークにインプットが与えられると、それはすべてのバネを同時に満たす形状へと単に落ち着きます。このアプローチにより、科学者は2つの異なるプロセス、すなわち、問題を解く行為である「推論」と、問題を解く能力を高めるために機械を訓練する行為である「学習」のエネルギーコストを計算することができました。彼らの発見は、これらの機械の物理学における驚くすべき分離を明らかにしました。彼らは、思考する行為、すなわち推論は、機械が十分にゆっくりと動くならば、理論的にゼロのエネルギーで行うことができることを発見しました。コストは、機械が速く動かされるときにのみ発生します。対照的に、学習という行為は、機械がいかにゆっくり動作しようとも避けることのできない、永続的なエネルギー価格を伴います。

研究者は、推論においては、デジタルコンピュータのようにネットワーク内部の接続数や「重み」によってエネルギーコストが決まるのではないことを見出しました。代わりに、コストはネットワークの幅、つまり一度にいくつのニューロンが活性化しているかに依存します。もし機械がゆったりとしたペースで次のインプットへと移動し、ゆっくりと落ち着くことが許されるならば、作業は全く必要ありません。これは、機械が常に平衡状態にあり、メモリを消去したり丘を登ったりすることなく、滑らかなエネルギーの谷に沿って滑っているためです。エネルギーが消費されるのは、機械がその自然な緩和速度よりも速く動くよう強制されたときだけです。この高速領域において、必要なエネルギーは、機械が状態空間を移動しなければならない距離を、移動にかかる時間で割ったものに比例します。シミュレーションによれば、最も速い有用な速度であっても、エネルギーコストは極めて低く、ネットワークの最も広い層の次元ごとに、環境の熱エネルギーにほぼ等しいものでした。これは、コストがネットワークの総複雑さではなく、ネットワークの幅のサイズに応じてスケールすることを意味します。100万個のニューロンが活性化しているネットワークの場合、エネルギーコストは単一粒子の微小な熱エネルギーの約100万倍であり、これは現在のデジタルハードウェアが消費する量よりも何十億倍も小さい数値です。

しかし、学習は異なる物語を語ります。機械が訓練されるとき、入力と望ましい出力の両方が同時にシステムに強制されます。これにより、現在の設定では入力とターゲットを同時に満たすことができないため、ネットワークのバネの中に葛藤、あるいは歪みが生じます。学習するために、機械は内部の重みを調整してこの歪みを解消しなければなりません。研究者は、この重みを調整するプロセスが、還元不可能なエネルギーコストを伴うことを見出しました。推論とは異なり、このコストは訓練が無限にゆっくり行われたとしても消失しません。重みが変更されるたびに、小さな量のエネルギーが熱として散逸します。これは、環境の熱エネルギーの数倍程度であり、パラメータごとに発生します。このコストは、機械の知識を定義する全パラメータに対して一度だけ課されます。それは、機械が訓練中にどれだけの例を見るかには依存せず、むしろ保持すべき重みの数に依存します。これは、デジタル訓練において、機械がすべての例を見るたびに情報を消去し書き換えなければならず、結果としてデータセットの規模に応じて膨大なエネルギー請求が発生する状況とは鮮明な対照をなしています。

研究者は、機械学習の標準的なタスクである手書き数字を認識するように訓練された小さなネットワークをシミュレートすることで、これらのアイデアをテストしました。彼らは、数字を切り替えたときや、精度を高めるために重みを調整したときに、機械がどのように振る舞うかを観察しました。結果は彼らの理論的予測と完璧に一致しました。機械に数字を素早く推論させると、消費されるエネルギーは急激に上昇し、機械が行う仕事がシステムの熱によるランダムな揺らぎと同等になると、精度が低下しました。しかし、機械がゆっくりと動くことが許されると、ほとんどエネルギーを消費せずに問題を解決し、精度も高いまま維持されました。訓練中、彼らは重みの調整に費やされるエネルギーが精密なパターンに従うことを観察し、学習が行われるごとに一定の小さな熱が放出されることを確認しました。シミュレーションによれば、一度機械がタスクを学習すれば、その知識を維持するために必要なエネルギーは無視できる程度ですが、その知識を最初に書き込むために必要なエネルギーは、基本的で避けられないコストであることが示されました。

これらの知見は、ニューラルネットワークの熱力学的代償は、その算術(演算)ではなく、そのメモリによって決定されることを示唆しています。結果を計算する行為は、機械がどれほど速く動かされるかに限定されるだけで、ほぼ無料です。しかし、学習する行為は、機械の物理的構造にパラメータを書き込むための、小さくも永続的な手数料を支払うことを要求します。この区別は、コンピューティングの未来に新しい視点を提供します。デジタルマシンは、あらゆる操作においてビットを消去するコストに縛られていますが、物理的なマシンは、現在のハードウェアよりも数桁高いエネルギー効率で複雑な計算を実行できる可能性があります。現在のハードウェアとこれらの理論的限界との間の残された隔たりは、物理法則の欠陥によるものではなく、むしろ現在の材料や設計の非効率性に起因しています。この研究は、もし私たちが、真に解決策へと「落ち着く」ことができる機械を構築できれば、知性のエネルギーコストを宇宙が許容する最小限にまで削減できることを示し、明確なロードマップを提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →