← 最新の論文
🤖 machine learning

Modular Pretraining Enables Access Control

本論文は、特定の能力をモジュール・アブレーションによって選択的に無効化することで、汎用的な性能を維持しつつ、事後的なアンラーニングよりも高い耐性を備えたスケーラブルなアクセス制御をデュアルユースAIに実現する、コスト効率の高い事前学習手法であるGradient-Routed Auxiliary Modules(GRAM)を提案する。

原著者: Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたには、超スマートなロボットシェフがいます。このシェフは、命を救うワクチンから危険な生物兵器に至るまで、あらゆるものを調理できる素晴らしい能力を持っています。これは「デュアルユース(軍民両用)」のジレンマです。病気を治すための知識は、同時に疫病を作り出すための知識にもなり得るのです。もしこのシェフを病院に与えれば、治療薬が得られます。しかし、もし悪党に与えてしまえば、トラブルを招くことになります。

通常、悪党を止める唯一の方法は、シェフを完全に解雇することです。しかし、それでは病院が治療薬を失うことになってしまいます。あるいは、5人の異なるシェフを雇い、それぞれが特定の知識しか持たないように訓練するという方法もあります(一人はワクチン、一人はサイバーセキュリティ、一人は核物理学、といった具合です)。しかし、5人ものシェップを雇い、訓練するのは非常にコストがかかり、時間がかかります。

そこで登場するのが GRAM (Gradient-Routed Auxiliary Modules) です。GRAMは、5人の別々のシェフを雇うのではなく、「魔法のモジュール式エプロン」を身につけた一人のマスターシェフを雇うことを提案しています。

魔法のエプロン

通常のAIでは、すべての知識が巨大なスープのように混ざり合っています。もし「生物兵器」のレシピを取り除こうとすると、スープ全体をかき混ぜなければならず、その過程で誤って「ワクチン」のレシピまで台無しにしてしまう可能性があります。

GRAMはこのキッチンのレイアウトを変更します。シェフには、玉ねぎを切ったりお湯を沸かしたりといった基本的な作業をこなす「メインのエプロン(コア)」を与えます。しかし、そこに追加で、いくつかの小さな「取り外し可能なポケット」を付け加えます。

  • 一つはウイルス学のためのポケット。
  • 一つはサイバーセキュリティのためのポケット。
  • 一つは核物理学のためのポケット。
  • 一つは特殊なコードのためのポケット。

ここで魔法のような仕掛けがあります。シェフが学習しているとき、キッチンはその日のレッスンに必要な特定のポケットだけを開きます。もしレッスンがウイルスに関するものであれば、「ウイルス学ポケット」だけに注意が向けられ、更新が行われます。「核物理学ポケット」はジッパーが閉まったまま、その日のレッスンについては何も学びません。

結果:一人のシェフ、多くの人格

知識がこれらの別々のポケットに保存されているため、仕事に行く前にどのポケットのジッパーを開けるかを制御するだけで、シェフが何を知っているかをコントロールできます。

  • 病院に対して: 「ワクチン」のポケットを開け、「兵器」のポケットを閉じた状態にします。こうすれば、シェフは治療の天才になりますが、兵器の作り方については全く知らない状態になります。
  • 研究所に対して: 「サイバーセキュリティ」のポケットを開け、残りのポケットを閉じます。

論文によれば、この一つのモジュール式エプロンを持つシェフは、ゼロから5人の別々のシェフを訓練した場合とほぼ同等の性能を発揮します。実際に、彼らが50億パラメータのモデル(巨大な脳)でテストしたところ、この単一のモジュール式シェフは、高価な手法(個別にモデルを訓練する方法)と比較して、優れたスキルを維持し、悪いスキルを忘れる能力においても同等の性能を示しました。

なぜ他の手法よりも優れているのか

研究者たちは、この問題を解決するために他の方法を試し、それらを退けました。

  • 「事後的な忘却(Post-Hoc Unlearning)」の手法: これは、シェフがすでに学んでしまった記憶を、後から脳から消去しようとする試みです。論文では、これは弱い手法であると指摘しています。もし後から「兵器」のレシピを「忘れさせよう」としても、少し練習(ファインチューニング)するだけで、シェフは簡単にそれを思い出せてしまいます。それは、歌を逆再生して歌うことで曲を忘れようとするようなもので、効果が定着しません。
  • 「モデル分岐(Model Branching)」の手法: これは、まずシェフに基礎を教え、その後で5つの異なる専門学校へ送り、特定のスキルを学ばせるようなものです。これは一定の効果はありますが、論文では、特にデータにラベルが付いていない「汚れた」データがある場合、GRAMの「モジュール式エプロン」アプローチの方が、スキルの分離をより上手く維持できることが示されました。

「部分ラベル」の驚き

ここで奇妙ですが面白い発見があります。時には、どのレシピがどれなのか分からないことがあります(例えば、データの50%にラベルが付いていない場合など)。

  • 別々のシェフを訓練したり、「分岐」の手法を使ったりする場合、ラベルのないデータがあると、それらをすべて「基礎的知識」として扱ってしまうため、意図せず危険なスキルまで学習してしまいます。
  • しかし、GRAMのシェフは驚くほど賢いです。ラベルが半分欠けていても、モジュールのポケットは危険なスキルを隔離し続けることができます。論文によれば、これは一度ポケットが専門化し始めると、ラベルのないデータも自然とその同じポケットへと「漂流」していくため、コアとなる脳がクリーンに保たれるからだとされています。

どれほど確かなのか?

著者たちは数値に非常に自信を持っていますが、限界についても慎重に述べています。

  • 彼らは、合成された物語や、ウイルス学、サイバーセキュリティ、核物理学、および特殊なコードをカバーする現実世界のデータを用いてテストを行いました。
  • モデルの規模を5000万パラメータから50億パラメータへとスケールアップさせました。
  • これらの実験において、GRAMは「ゴールドスタンダード(個別にモデルを訓練する方法)」の性能に一貫して匹敵しつつ、5つのプロファイル設定において、訓練コスト(計算量)を5分の1に抑えることができました。
  • ただし、論文では、この手法がまだ絶対的な「最先端(フロンティア)」の巨大モデルに対してテストされていないことも認めています。したがって、50億パラメータまでは良好な傾向が見られますが、極めて巨大なスケールでも全く同じように機能するかどうかは断言できません。

結論

GRAMは、AI開発者に「最小権限」のシステムを与える方法を示唆しています。全員にキッチン全体を与えるのではなく、適切なポケットのジッパーを開閉するだけで、ユーザーごとに特定の安全なバージョンのシェフを提供できるのです。これは、新しいケーキを毎回焼くことなく、「強力なAIを手に入れつつ(ケーキを食べつつ)、安全なアクセス制御も実現する(ケーキを食べる)」ための方法です。

論文は、これがあらゆる問題を解決する魔法の杖ではない(一部のスキルは分離するには絡まりすぎている)と結論づけていますが、あらゆる仕事に対して新しいモデルを構築する必要のない、より安全で柔軟なAIに向けた有望な一歩であるとしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →