← 最新の論文
🤖 machine learning

Quantum Models with Multi-Stage Training for Compositional Concept Generalization

本論文は、テンソルと変分量子回路を用いて名詞と関係の表現を分離する、マルチモーダル量子機械学習のための多段階学習フレームワークを提案しており、古典的なベースラインよりもはるかに少ない学習可能パラメータ数で、CLEVRデータセットにおける組成的な汎化性能が大幅に向上することを実証している。

原著者: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人間の知性は、学習した単純なアイデアを全く新しい状況へと再結合する驚くべき能力を備えています。「車」とは何か、「黄色」とは何を意味するかを理解している人は、見たことがない黄色い車であっても、即座にそれを認識し、その未知の組み合わせに対して「危険」という知識を適用することができます。この「構成的汎化(compositional generalization)」として知られる能力により、私たちは既知のパーツが新鮮な配置で現れる世界を航行することができるのです。しかし、人工知能にとって、このスキルは依然として手強い障壁となっています。現代のシステムは、学習中に見たパターンの認識には長けていますが、それと同じパターンを新しい組み合わせ(例えば、特定の物体が新しい空間的関係の中に置かれた場合など)に適用しようとすると、しばしば躓いてしまいます。この限界は、現在のモデルが、物事がどのように組み合わさるかという根本的なルールを真に理解しているのではなく、事例を暗記しているに過ぎないことを示唆しています。

ユニバーシティ・カレッジ・ロンドンとアムステルダム大学の研究者たちは、この問題を解決するための異なる道を探求し、奇妙で強力な量子力学の論理へと目を向けました。IEEE Quantum Weekカンファレンスで発表された彼らの研究では、量子コンピュータが情報を処理する方法が、人間が概念を組み合わせる方法と自然に一致している可能性を提案しています。オブジェクトの学習と、それらの間の関係性の学習を分離するモデルを構築することで、彼らは従来のメソッドよりもはるかに効果的に、未知のシナリオへと汎化できるシステムを作り上げました。しかも、これはごくわずかな計算資源で実現されています。

チームは、コンピュータが2つの幾何学的な図形の画像を見て、それらの関係性を説明する2つの選択肢から正しいものを選ぶというタスクに焦点を当てました。例えば、立方体が円錐の左にある画像が与えられたとき、システムは正しいフレーズである「立方体 左 円錐」を、紛らわしい選択肢である「立方体 右 円錐」から区別しなければなりません。機械に教えるために、研究者たちは球、円柱、円錐といった形状の画像を様々な位置に配置したデータセットを使用しました。課題は、例えば「立方体の右にある円錐」といった組み合わせでシステムを訓練し、その後、「立方体の左にある円錐」のような、一度も見せたことのない組み合わせでテストすることでした。この設定により、モデルは「左」や「右」という概念を、単に特定の画像として暗記するのではなく、あらゆる形状に適用できる独立したルールとして学習することを強制されます。

システム全体を一度に訓練する代わりに、研究者たちはカリキュラムを模倣した2段階のアプローチを採用しました。第1段階では、モデルは個々のオブジェクトを認識することを学習しました。単独の球や単一の立方体といった単一の形状を見せられ、それらを名前と一致させるよう教えられました。モデルがこれらの基本的な構成要素を習得した once、研究者たちはその形状の記憶を固定しました。第2段階では、関係性のタスクを導入しました。モデルは今や2つの形状を含む画像を見せられ、すでに記憶した安定した形状の定義を用いて、それらがどのように関連するかというルールのみを学習しなければなりませんでした。この設計により、システムは新しい関係性を見るたびに「立方体」とは何かを再学習しようとすることがなくなり、関係性を、固定されたオブジェクトに適用される分離された変換として扱うことが強制されました。

これを実装するために、チームは言語と意味を「テンソル」と呼ばれる数学的構造に変換し、それを量子回路に直接マッピングできるフレームワークを使用しました。彼らは、画像データを量子回路に送り込むさまざまな方法をテストしました。一つの方法である「振幅エンコーディング(amplitude encoding)」は、元の画像データの正確な幾何学的形状を保持しようと試みました。もう一つの「角度エンコーディング(angle encoding)」は、データを非線形な変化を伴うように変換し、情報の形を変えることで、関係性の違いをより明確にするように情報を再構成しました。また、2つの別々の形状のための量子回路を物理的に結合して、単一の関係性を持つ画像を表現する「コラージュ」法についても実験を行いました。

彼らのシミュレーション結果は、極めて示唆に富むものでした。研究者がこのマルチステージの量子モデルを標準的な古典的システムと比較したとき、効率の差は歴然としていました。古典的なベースラインは、このタスクを遂行するために1億5,000万以上の学習可能パラメータを必要としましたが、未知の組み合わせに対しては汎化できず、50パーセントの精度しか出せず、実質的に推測している状態でした。対照的に、量子モデルはわずか426個の学習可能パラメータを使用して、強力な汎化を実現しました。彼らのシステムの中で最も成功したバージョンである、コラージュ法と角度エンコーディングを組み合わせたものは、未知のテストケースに対して72パーセントを超える精度に達しました。このパフォーマンスは、すべてを一度に学習しようとしたシングルステージの量子モデルよりも大幅に優れており、「オブジェクトの学習と関係性の学習を分離すること」が極めて重要であったことを証明しました。

研究者たちは、モデルの成功がデータのエンコーディング方法に大きく依存していることを見出しました。非線形変換を導入した角度エンコーディング法は、振幅エンコーディング法よりも優れていることが判明しました。これは、標準的なツールによって処理された元の画像データが、タスクに必要な空間的関係を明確に分離できていなかったことを示唆しています。量子エンコーディングのプロセス自体が、情報を再構築するのを助け、「左」と「右」の区別をモデルにとってより可視性の高いものにしました。一方で、振幅エンコーディングはデータの元の形状を保持してはいたものの、異なる空間配置間の紛らわしい類似性をそのまま維持してしまい、区別を困難にしていました。

コンピュータ・シミュレーションのみから得られたこれらの知見は、構造化された量子表現が、機械に構成性を理解させるための有望な手段であることを示しています。物事の性質とそれらの関係性を明確に分離し、量子回路を用いてデータをより分離しやすい形へと再構成することで、モデルは古典的システムがはるかに多くのリソースを用いても苦戦したレベルの汎化を達成しました。この研究は、人工知能の問題を解決したと主張するものではありませんが、「プリミティブ(基本要素)を先に学習し、その後に組み合わせる」という特定の構造化された学習アプローチが、量子コンピューティングの独自の特性と組み合わせた際に非常に効果的であることを実証しています。著者らは、今後の課題として、これらのアイデアを実際の量子ハードウェアでテストし、より複雑なシーンや豊かな語彙へと拡張できるかどうかを探求する必要があると述べていますが、現在の結果は、機械学習に対する新しい考え方についての説得力のある概念実証を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →