✨ 要約🔬 技術概要
人工知能の世界には、メモリ(記憶)と安全性との間に存在する永続的な緊張関係があります。大規模言語モデルは、役に立つアシスタントとなるよう設計されていますが、長く複雑な会話を行う際、進行状況を維持するために、以前に話された内容を覚えておく必要があります。伝統的に、これらのモデルは、発言されたすべての単語の履歴を保持することでメモリを処理しますが、会話が進むにつれて、これは重く、動作を遅くさせます。同時に、これらのモデルを有害な要求から安全に保つことは、通常、外部のルールを追加したり、システム全体を再学習させたりすることを伴い、それがモデルの柔軟性を損なったり、無害な質問への回答を拒否させたりすることがあります。研究者たちの課題は、長期的なコンテキストを自然に保持しながら、安全性を単に後付けされたものではなく、その構造自体に組み込んだシステムを構築することです。
上海AIラボラトリーの研究チームは、「Safin-1」と呼ばれるモデルのファミリーを用いて、この問題を解決する新しい方法を提案しました。彼らは、安全性を外部のルールや別個のコードの層として扱うのではなく、人がさまざまな状況において行動を導く一連の個人的な価値観を携えているのと同じように、モデルが内部状態として安全性を保持するように設計しました。彼らの革新の核心は、モデルが一定の間隔で自身の内部思考プロセスのスナップショットを保存できるメカニズムにあります。モデルが長い文書を読んだり、複雑な指示に従ったりする際、モデルは定期的に一時停止し、現在の理解のコンパクトな要約を保存します。その後、モデルが過去の何かを思い出す必要があるとき、会話の全履歴を一度に処理しようとするのではなく、これらの保存されたスショットの中から最も関連性の高い情報を見つけ出すことができます。研究者たちが「メモリ・ネイティブな状態進化(memory-native state evolution)」と呼ぶこのアプローチは、モデルのメモリを、過去の受動的な記録から、必要に応じて参照・更新できる能動的なツールへと変貌させます。
研究者たちは、まずアーキテクチャが正しく機能することを確認するために、このアイデアを小規模なモデルでテストしました。その結果、特定の過去の状態を検索する能力を追加することで、モデルが長いコンテキストを理解し、テキストの奥深くに隠された情報を見つける能力が大幅に向上することを発見しました。数千語の「干し草の山の中から一本の針を探す」ようなテストにおいて、この新しい設計は、モデルが訓練中に見たことのない長さのテキストであっても、従来の手法を凌駕しました。これは、過去の状態を選択的に想起する能力が、膨大な情報量の中で迷うことなく、長期間にわたってモデルの集中力と推論能力を維持させるのに役立つことを示唆しています。
この初期の成功に基づき、チームはこの技術を40億から350億パラメータに及ぶより大規模なモデルへとスケールアップしました。彼らは同じメモリ・ルーティング・システムをこれらの大型モデルに適用し、その後、特定の応用分野である「安全性」についてテストを行いました。彼らは、モデルに付加できる特別な、持続的な「安全性状態(safety state)」を作成しました。この状態は、有害な要求を認識し、モデルを安全な応答へと導くよう訓練されていますが、切り離し可能な設計となっています。研究者たちは、この安全性状態が有効であるとき、モデルがトリックを用いて有害なコンテンツを生成させようとする試みに抵抗する能力が大幅に向上することを発見しました。ある一連のテストでは、この新しいアプローチは、標準的なモデルと比較して、こうした欺瞞工作の成功率をほぼ半分に減少させました。決定的なのは、この安全性の向上は、モデルの有用性を犠牲にすることなく達成されたという点です。モデルを過度に慎重にさせて正当な質問を拒否してしまう他の手法とは異なり、この新しいアプローチは、危険なものはブロックしながらも、無害な要求を拒否することははるかに少ない、高いレベルの有用性を維持しました。
この研究は、安全な人工知能を構築する方法についての考え方の転換を浮き彫りにしています。モデルの「脳」全体を絶えず再学習させたり、外部のフィルターだけに頼ったりするのではなく、この研究は、安全性がモデルの内部機構の不可欠な一部となり得ることを示唆しています。状況に応じてオン・オフを切り替えられる特化した状態をモデルに持たせることで、研究者たちは適応性と堅牢性を兼ね備えたシステムを作り上げました。結果は、この手法が、安全性が外部から課される制約ではなく、モデル自身のメモリと推論プロセスの中で自然に進化する能力となる、有望な道筋を提供していることを示しています。研究者たちは、これが初期の探索であり、このビジョンを完全に実現するにはさらなる作業が必要であると指摘していますが、これらの知見は、安全性が機械の思考と記憶の仕組みそのものに織り込まれ得ることを具体的に実証しています。
テクニカルサマリー:Safin-1 – メモリネイティブな状態進化による「内なる安全性」
1. 問題提起
長期間にわたる複雑なタスクには、基盤モデルが情報を蓄積し、内部状態を維持し、長期的な相互作用の中で適応していくことが求められます。現在のアプローチでは、通常、これらの機能は分離されています。すなわち、コンテキストはトークンレベルのキー・バリュー(KV)キャッシュや再帰的状態を通じて保持される一方で、再利用可能な振る舞い(安全性など)は、モデルの更新、アダプター、または外部の推論時制約を通じてエンコードされます。
本論文は、安全性が単なる外部的なガードレールや事後的なアライメント(例:教師あり微調整)に依存する行動的制約ではなく、モデル自体の本質的な特性であるべきだと主張しています。さらに、従来の再帰的設計は最新の状態のみを読み取り用に公開しており、初期の状態との関連性が減衰または上書きされると、それらは回復不能になります。これは、歴史的な状態をコンパクトに表現し、現在のコンテキストに従って効率的に呼び出す必要があるというボトルネックを生み出します。核心となる問いは、**「モデルの状態は、単なる一時的なコンテキストの圧縮としてだけでなく、永続的かつ選択的に呼び出し可能な能力のネイティブな基盤として機能し得るか?」**という点です。
2. 手法:Safin-1 と MARCH
Safin-1 は、**MARCH(Memory-Anchor Routing across Context History:コンテキスト履歴にわたるメモリ・アンカー・ルーティング)**に基づいた基盤モデルファミリーです。このアーキテクチャは、再帰的計算の一時的な軌跡を、アドレス指定可能な内部状態の増大するバンクへと変換します。
2.1 コアアーキテクチャ:MARCH
MARCHは、主に以下の3つのコンポーネントで構成されています。
コンテキスト由来の状態アンカー(Context-Derived State Anchors): 再帰的なバックボーンは、特定の境界(例:C C C トークンごと)において進化する状態を定期的にチェックポイント化し、「状態アンカー」を形成します。各アンカーは、コンパクトで状態を認識するルーティングキーとペアになっています。現在の状態のみを保持する標準的な再帰モデルとは異なり、MARCHはその境界までの累積的なプレフィックス状態を保持するため、アドレス指定可能な履歴を作成します。
コンテンツ・ルーテッド状態検索(Content-Routed State Retrieval): 各トークンに対して、ルーティングモジュールは隠れ状態をクエリへと投影し、すべての因果的に可視な状態アンカー(および学習された「null」オプション)のキーに対してスコアリングを行います。ルーターは、関連する歴史的状態を選択するか、あるいは検索をバイパスすることを選択します。検索された状態の読み出しは、現在の状態のパスと残差的に融合され、基礎となる再帰的更新ロジックを維持します。
永続的能力状態(Persistent Capability States): ルーティングされた状態バンクは、動的なコンテキスト・アンカーとともに、学習された永続的な状態(例:「安全性状態」)をホストできます。これらは、入力シーケンスの長さに依存せず、最初のトークンから利用可能な学習可能なパラメータです。
2.2 実装の詳細
プロデューサー・リーダー機構: システムは、状態チェックポイントを生成するためのハードウェア効率の高いプロデューサー(Gated DeltaNetのようなチャンク単位のカーネルに基づく)と、クエリ・トークンを状態候補とタイリングする融合型リーダーを使用します。これにより、高密度なルーティング行列のマテリアライズを回避し、長いシーケンス長(最大128Kトークン)においても計算コストを抑えるためのスパース・ルーティング(例:Top-4)をサポートします。
状態ネイティブな特化: このアーキテクチャは、学習された「安全性状態」を通じて「内なる安全性」を実現することを可能にします。言語モデルのバックボーンは凍結されたまま、永続的な状態パラメータのみが最適化されます。ルーターは、この安全性状態のトークンおよびコンテキスト依存の寄与を決定し、共有バックボーンを書き換えることなく、この状態を脱着・除去することを可能にします。
3. 主な貢献
Safin-1 アーキテクチャ: 再帰的計算の軌跡をアドレス指定可能な状態アンカーのバンクへと変換し、再帰的更新ルールを変更することなく、初期の状態への選択的なアクセスを可能にするモデルファミリー。
永続的能力状態: 「内なる安全性」のためのインターフェースであり、安全性への特化を、バックボンの変更や外部のプレフィックスとしてではなく、ネイティブなルーティング・パスウェイ内の脱着可能な永続的状態として実現します。
制御されたスケール検証:
小規模検証 (0.8B): 複数の再帰的バックボーン(Gated DeltaNet, Kimi Delta Attention, Gated DeltaNet-2)を用いた制御された事前学習研究により、アーキテクチャ上の利点を分離して検証。
大規模検証 (4B および 35B-A3B): スケーラビリティと能力保持を検証するため、Qwen3.5 バックボーンを用いた継続的事前学習および教師あり微調整(SFT)を実施。
4. 実験結果
4.1 小規模検証 (0.8B)
一般的な言語モデリング: MARCHは、8つのゼロショット常識ベンチマークすべてにおいて最高のパフォーマンスを達成し、フルアテンションのベースラインおよび他の再帰的バリアントを上回りました。
長文コンテキストおよび検索: MARCHは、連想想起(NIAHタスク)において顕著な向上を示し、特にマルチ・ニードル(multi-needle)シナリオや、訓練時(16K)を超える長さの補外(32K–64K コンテキスト)において優れた性能を発揮しました。また、現実世界のデータセット(SQuAD, TriviaQAなど)におけるインコンテキスト検索においても、ベースラインに対して14〜23%の向上を見せました。
効率性: スパースなTop-4ルーティングは、128Kトークンにおいて、高密度ルーティングと比較してエンドツーエンドのスループットを2倍にし、コア実行時間を1桁削減しました。
4.2 大規模評価 (4B および 35B-A3B)
能力の向上: Safin-1は、困難な推論ベンチマーク(MMLU-Pro, GPQA-Diamondなど)や競技レベルの数学(AIME 2025)において性能を向上させつつ、標準的なベンチマーク(GSM8K, MATH, コード生成)での性能を維持、あるいはわずかに向上させました。
安全性の堅牢性(ベースライン): 永続的状態を持たない場合、Safin-1は、対応するQwen3.5ベースラインと比較して、平均的なジェイルブレイク攻撃成功率(ASR)において緩やかな改善を示しました。
4.3 内なる安全性(永続的安全性状態)
凍結されたバックボック上で「安全性状態」を学習させた場合:
ジェイルブレイク耐性: 安全性状態は、未適応のSafin-1チェックポイントと比較して、平均ASRを42.3% (4B) および 52.3% (35B-A3B) 低減させました。
過剰拒絶(Over-Refusal)のトレードオフ: 学習一致型のランク8 LoRA制御と比較して、安全性状態はより低いASRを実現しながら、良質なプロンプトに対する過剰拒絶を大幅に抑制 しました。例えば、35B-A3Bにおいて、LoRAは過剰拒絶を10.0パーセントポイント増加させましたが、安全性状態による増加はわずか2.0ポイントでした。
能力の保持: 4Bにおいて、安全性状態はテストされたすべてのタスクにおいてLoRAよりも高い能力保持を示しました。35B-A3Bにおいては、タスク依存の結果となりましたが、安全性状態は数学のタスクにおいてLoRAを上回る性能を示しました。
5. 意義と主張
本論文は、Safin-1を「内なる安全性」の初期的なアーキテクチャ的探索 として位置付けています。その意義は、モデルのメモリを、コンテキストの受動的な記録から、モデルの振る舞いを維持し進化させるための能動的な基盤 へと再定義した点にあります。
ネイティブな安全性: 安全性が、外部的な制約のみに頼るのではなく、モデルのネイティブな計算(状態ルーティング)を通じて表現され、呼び出され得ることを実証しました。
モジュール性: 安全性状態の脱着可能な性質により、共有の汎用基盤を再学習することなく、制御された特化が可能になります。
限界: 著者らは、本研究が出発点であることを明示しています。限界としては、使用した安全性コーパスの小ささ、英語のみのベンチマーク、および適応型・多言語攻撃や状態改ざんに対するテストの欠如が挙げられます。論文は、安全性を「状態ネイティブで適応的に維持可能な能力」とする広範なビジョンを実現するためには、大幅なさらなる研究が必要であることを強調しています。
結論として、著者らは、Safin-1がこのアーキテクチャの方向性に対して具体的な証拠を提供するものであるものの、これが決定的な解決策を確立するものではないとし、代替的かつ補完的なアーキテクチャの探索が不可欠であると述べています。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×