あなたは、光、音、そして生きた細胞でできたピース(破片)からなる、巨大で乱雑なパズルを解こうとしているところだと想像してください。これが機械学習の世界です。機械学習とは、コンピュータがデータの中からパターンを見つけ出し、例えば医療スキャンから患者が癌であるかどうかを推測するように、予測を行う科学の一分野です。通常、これらのコンピュータは「古典的」であり、あなたの机の上にあるノートパソコンのように動作します。それらは非常に高速に、一度に一歩ずつ情報を処理しますが、パズルのピースがあまりに多すぎたり、ピースが複雑すぎたりすると、処理しきれなくなることがあります。
ここで、量子コンピューティングが登場します。これは、魔法のような新しい種類のパズル解決策だと考えてください。単なる「はい」か「いいえ」のスイッチではなく、そのピース(量子ビットと呼ばれます)は、「重ね合わせ」と呼ばれる奇妙な物理現象のおかげで、同時に多くの状態に存在することができます。また、それらは「量子もつれ」の状態になることもあり、これは、どれほど離れていても、一方の状態が変わると瞬時にもう一方に影響を与えるという性質を意味します。科学者たちは、この魔法によって、最も不可能な医学的パズルを数秒で解けるようになることを期待しており、これを量子超越性という夢と呼んでいます。しかし、ここで大きな疑問が生じます。この魔法は今、医療データに対して現実的なものなのでしょうか? それとも、まだ技を習得していない、ただの光り輝くおもちゃに過ぎないのでしょうか?
この論文は、真剣な現実チェックを行うものです。Cascade Quantum Inc.のチームは、推測をやめてテストを開始することに決めました。彼らは、3種類の異なる医療記録(細胞測定の単純なスプレッドシート、複雑な遺伝子「オミクス」データ、および医療画像)を用いた実際の癌データを使用し、自分たちの最高の量子モデルを最高の古典的モデルと対決させるための公平な「アリーナ」を構築しました。彼らは、ビット・ビット・エンコーディングという特別な手法を用いて、乱雑な生物学的データを量子コンピュータが理解できる言語へと翻訳しました。そして、古典的コンピュータに対しても、同じ翻訳と、勝利するための最善の設定を与えました。
結果はどうだったでしょうか? 数千回のシミュレーションを実行した後、著者らは、量子モデルが古典的モデルよりも優れているという証拠は見つからなかったと報告しています。実際には、量子モデルは古典的モデルとほぼ同じ性能を示し、どちらのモデルも、理論的に到達可能な精度の限界を超えることは一貫してできませんでした。この論文は、これまで使用されてきたデータセットが、量子コンピュータの超能力を見せつけるにはあまりに小さく、単純すぎることを示唆しています。それは、まるでフォーミュラ1の車を、静かな住宅街の路上でテストしているようなものです。その車は素晴らしいものですが、その性能を証明するには、道が十分に挑戦的ではないのです。著者らは、真の「量子超越性」を見るためには、現在入手が困難な、より大規模で複雑、かつ現実的な生物学的データセットを見つける必要があると結論付けています。それまでは、古典的コンピュータが依然として踏みとどまっているのです。
技術要約:腫瘍学的データにおける量子および古典機械学習モデルのベンチマーキング
問題提起
機械学習は、検出、診断、および治療において、腫瘍学的データへの適用がますます進んでいる。しかし、生物学的データは、高次元性、サンプルの多様性の欠如、および複雑な特徴量の相互作用(「次元の呪い」)を含む特有の課題を提示する。量子機械学習(QML)は、このような複雑で高次元なデータを扱う上で理論的な優位性を提供すると提案されているが、実用的な量子優位性を実証する厳格な経験的評価は不足している。既存の研究の多くは、性能の限界が最適化の問題(例:バレン・プラトー、局所解)に起因するのか、モデル固有の表現力に起因するのか、あるいはデータのエンコーディング手法に起因するのかを区別できていない。また、先行研究における古典的なベースラインは、固定されたハイパーパラメータを用いて訓練されることが多く、その最適な性能が実現されているかどうかの疑問が残っている。
手法
著者らは、表形式、オミクス、および空間的な腫瘍学的データセットにわたって、QMLと古典的機械学習(CML)モデルを公平に比較するための厳格なベンチマーキング・フレームワークを開発した。本研究では、量子機械学習フレームワークであるRed Cedarと、AutoMLによって最適化された古典的ニューラルネットワークを使用した。
- データセット: 本研究では、以下の3つのカテゴリのデータを評価した:
- 表形式: ウィスコンシン診断乳癌(WDBC)データセット。
- オミクス: 乳癌(BRCA)、結腸癌(COAD)、および卵巣癌(OV)に関するThe Cancer Genome Atlas(TCGA)のゲノムmRNA発現データ。
- 空間的: MedMNIST(BreastMNIST, PathMNIST, DermaMNIST)の医療画像データセット。
- 前処理: 著者らは、表形式およびオミクスデータに対するランダムフォレストによる特徴量選択、および空間データに対するResNet18による特徴抽出を含む、様々な前処理戦略をテストした。
- 量子モデル:
- エンコーディング: 本研究では、サンプルを量子ビットの初期化および読み出しに対応するビットとして古典的にエンコードする手法である**ビット・ビット・エンコーディング(bit-bit encoding)**を採用した。このアプローチは普遍的近似特性を提供し、表現力の制約なしに理論的に100%の訓練精度を達成することを可能にする。
- アーキテクチャ: ラベル量子ビットとデータ量子ビットの間にパラメータ化されたもつれノードを持つ、層状の二部グラフ(bipartite)アーキテクチャ。
- 訓練: モデルは、Red Cedarフレームワークの**サブネット初期化(sub-net initialization)および正確な座標更新(exact coordinate updates)**を用いて訓練された。このインクリメンタルなウォームスタート戦略は、バレン・プラトーを回避し、古典的な最適化アルゴリズムを不要にする。訓練は、100%の訓練精度に達するか、5日間の制限時間に達するまで継続された。
- 古典的ベースライン:
- AutoML: TPOT2ライブラリを使用して、最適なニューラルネットワークのアーキテクチャとハイパーパラメータを進化させ、古典的ベースラインが過小最適化されていないことを保証した。
- 比較ステージ: 古典的モデルは、生データ、前処理済みデータ、およびビット・ビット・エンコーディングされたデータ(事前離散化および離散化済みデータの両方)に対して訓練され、データ表現全体にわたる公平な比較を行った。
- リソース推定: 理論的な指標である Qdataset(1.0) を算出した。これは、データセットをエンコードするために必要な量子ビット数であり、100%の訓練およびテスト精度が理論的に可能(すなわち、離散化空間における衝突がない状態)となるものである。古典的なシミュレーション能力のプラトーに基づき、潜在的な量子優位性のためのヒューリスティックとして50量子ビットの閾値を用いた。
主な結果
- 量子優位性の証拠なし: テストされたすべてのデータセット(WDBC、TCGAオミクス、およびMedMNIST空間データ)および前処理方法において、量子モデルはAutoMLによって最適化された古典的ニューラルネットワークを凌駕することはなかった。両方のモデルクラスのテスト精度は、標準誤差の範囲内で統計的に区別がつかなかった。
- 訓練性能: すべての量子モデルは100%の訓練精度に到達することに成功し、訓練手法がバレン・プラトーのような最適化の落とし穴を効果的に回避したことを裏付けた。したがって、量子優位性の欠如は訓練の失敗に起因するものではない。
- 汎化: 量子モデルおよび古典的モデルのいずれも、量子ビット数が増加しても、特に複雑性の高いデータセットにおいて、理論上の最大テスト精度に一貫して到達することはできなかった。
- リソース推定の知見:
- WDBCおよびオミクス: WDBC(約14〜15量子ビット)およびオミクスデータセット(約15〜20量子ビット)の Qdataset(1.0) 値は、50量子ビットの閾値を大きく下回っており、これらのデータセットは量子優位性の候補になりにくいことを示唆している。
- 空間的データセット: 一部の空間的データセット(例:平坦化されたBreastMNIST)は50量子ビットの閾値に接近または超過したが、その結果は前処理方法(ResNet18 vs 平坦化)によって一貫性がなく、多くの場合、データ処理のアーティファクトに起因するとされた。
- 前処理に対する堅牢性: リソース推定フレームワークは前処理に対して堅牢であった。オミクスデータにおいて、ランダムフォレストによる特徴量選択は特徴量を99.8%削減したが、Qdataset(1.0) は前処理前後のデータセット間で統計的に有意な差はなかった。
意義および主張
本論文は、モデルサイズに伴う性能のスケーリングを系統的に分析し、AutoMLによって最適化された公平な古典的ベースラインを用いることで、量子優位性を評価するためのより厳格なフレームワークを確立したと主張している。主要な結論は、現在の量子機械学習文献におけるベンチマークデータセットには、腫瘍学的分類における量子優位性の証拠が見られないということである。
著者らは、既存のベンチマークを超えていく必要があると論じている。彼らは、実用的な量子優位性への有意義な進展には、量子計算の特性を活用するために必要な表現力と高次相互作用を備えた、より高次元で、より生物学的に現実的なデータセット(マルチオミクス、マルチモーダル、または時系列データなど)を分析することが必要であると示唆している。本研究は、アクセス可能な複雑なオープンソースの生物学的データが不足していることが、生命科学における量子実用性を実証する上での障壁となっていることを強調している。
毎週最高の quantum physics 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録