← 最新の論文
💻 computer science

MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks

MASCing は、LSTM ベースの代理モデルを用いてルーティングゲート上のステアリングマスクを最適化することで、多様な安全性シナリオ向けに混合専門家(MoE)モデルを構成する軽量かつ再トレーニング不要なフレームワークであり、これにより汎用性を損なうことなく特定の行動の標的的な強化または抑制を可能にする。

原著者: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

公開日 2026-05-01
📖 1 分で読めます☕ さくっと読める

原著者: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(チャットボットを動かしているようなもの)を、巨大でハイテクなオーケストラだと想像してみてください。

古いモデルでは、すべての楽手(パラメータ)がモデルが奏でるすべての音符に対して、それぞれの楽器を演奏していました。これは騒がしく、高価で、遅いものでした。

**エキスパート混合(MoE)**モデルは異なります。これらは巨大なオーケストラのようなもので、各音符に対して、ごく少数の特定の楽団員だけが演奏のために呼び出されます。残りの楽団員は静かにしています。「指揮者」(ルーター)が、各単語に対してどの 2 人または 4 人の楽団員グループが演奏するかを決定します。これにより、モデルははるかに高速に、かつ安価に実行できるようになります。

しかし、このシステムには新しい問題があります:指揮者が弱点です。

問題:「悪い指揮者」

一度に演奏する楽団員が少数であるため、狡猾ないたずらっ子(攻撃者)が、指揮者を間違った楽団員グループに演奏させるよう仕向けることができます。

  • シナリオ A(ジャイルブレイク): いたずらっ子がモデルに悪いことをするように頼みます(爆弾の取扱説明書を書くなど)。モデルは通常、「いいえ、それは危険です」と言います。しかし、いたずらっ子は多くのターンにわたって回りくどい方法で頼み込み、指揮者を混乱させて「安全」の楽団員ではなく「有害」の楽団員を演奏させるように仕向けます。
  • シナリオ B(過剰な拒絶): 時々、モデルがあまりにも慎重すぎることがあります。架空の悪党についての物語を書くことを拒絶するのは、「悪党」という言葉が「悪い」を意味すると考えているからです。開発者は特定の文脈でその物語を書くことをモデルに許可したいと考えているかもしれませんが、指揮者は「拒絶」の楽団員を呼び出し続けます。

通常、これを修正するには、オーケストラ全体を解雇して新しい楽団員を雇う(再トレーニング)必要があり、それは数ヶ月を要し、莫大な費用がかかります。

解決策:MASCing(「賢い楽譜」)

この論文はMASCing(MoE Activation Steering Configuration)を紹介しています。これはオーケストラを解雇するのではなく、指揮者に特別な、事前に書かれた楽譜(ステアリングマスク)を渡し、楽団員自体を変えることなく、仕事にふさわしい正しい楽団員を選ぶよう微妙に促すものだと考えてください。

MASCing が機能する仕組みは、以下の 3 つの簡単なステップです。

1. 「代理」探偵(パターンの学習)

まず、研究者たちは小さな高速な AI(LSTM)を訓練して探偵役をさせます。この探偵は、モデルが話す際に指揮者の「音符」(ルーティングログイット)を観察します。

  • 学習します:「指揮者がこれらの特定の音符を見ると、モデルは通常、回答を拒絶する」。
  • また学習します:「指揮者がこれらの音符を見ると、モデルは通常、物語を書くことに同意する」。
  • 重要なのは、探偵が実際に誰が演奏したかを見るだけでなく、指揮者が考慮していた潜在的な音符を見ることで、すべての隠れた情報を保持している点です。

2. 「安全回路」の発見(マスクの作成)

探偵は次に、望ましい結果を得るために指揮者の楽譜のどの音符を微調整する必要があるかを正確に特定します。

  • 悪い回答を阻止したい場合、探偵は「安全」につながる音符を見つけ、それを増幅し、「有害」につながる音符を減衰させます。
  • 特定の回答(安全な文脈におけるアダルトコンテンツなど)を許可したい場合、探偵は「拒絶」につながる音符を見つけ、それを減衰させ、「コンプライアンス」の音符を増幅させます。

これにより、ステアリングマスクが作成されます。これは指揮者の楽譜の特定の箇所をマークする蛍光ペンのようなものです。音楽そのものを変えるのではなく、指揮者に「ねえ、これらの特定の音符に特に注意を払って」と伝えるだけです。

3. 演奏(推論)

モデルが実際に実行されているとき、システムはこのマスクをリアルタイムで適用します。

  • 指揮者が音符を見ます。
  • マスクが音符に小さな「促し」を加えます。
  • 促しに影響された指揮者が、「有害」の楽団員ではなく「安全」の楽団員(またはその逆)を選びます。

彼らは何を達成しましたか?

研究者たちは、この手法を 2 つの非常に異なる目標を持つ 7 つの異なる MoE モデルでテストしました。

  1. ジャイルブレイクの阻止(盾): 彼らは MASCing を使用して、長い会話を通じてモデルを悪いことを言うように仕向けようとするいたずらっ子に対する抵抗を高めるようにしました。

    • 結果: モデルは、悪いリクエストをブロックする割合が**52%から84%**に向上しました。
    • 比喩: 指揮者が「悪い」楽団員を呼び出すように仕向けられることが、はるかに難しくなりました。
  2. 特定コンテンツの許可(鍵): 彼らは MASCing を使用して、ポリシー上実際に許可されているアダルトコンテンツのリクエストに対するモデルの拒絶を減らすようにしました。

    • 結果: モデルは、そのような物語の作成に同意する割合が**52%から82%**に向上しました。
    • 比喩: 指揮者が悪党についての物語に対してパニックを起こして「拒絶」の楽団員を呼び出すのをやめ、「創造的」な楽団員が演奏できるようにしました。

なぜこれが特別なのか?

  • 再トレーニング不要: オーケストラ全体に教え直す必要はありません。楽譜(マスク)を変えるだけです。
  • 高速: 「探偵」のトレーニングには、高性能なコンピュータで約 5 分かかります。マスクの適用はほとんど時間を要しません。
  • 柔軟: マスクを瞬時に交換できます。明日ルールが変われば、新しいマスクを生成するだけです。
  • 安全: モデルの数学計算や通常のメール作成の能力を損なうことはありません。意思決定プロセスの「安全」部分だけを微調整します。

要するに、MASCingとは、AI を最初から作り直すことなく、特定の状況において「この特定の状況では、異なるグループのエキスパートに耳を傾けてください」と、賢い AI に伝えるための軽量で即効性のある方法です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →