← 最新の論文
🤖 machine learning

Safin-1: Safety from Within through Memory-Native State Evolution

本論文は、外部的な制約に依存するのではなく、メモリネイティブな状態進化を通じて、安全性を内在的かつ適応的に維持可能な能力として組み込むための、コンテキスト履歴を横断するメモリー・アンカー・ルーティング(MARCH)アーキテクチャを活用した基盤モデルファミリーであるSafin-1を紹介するものである。

原著者: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang S
公開日 2026-09-02
📖 1 分で読めます☕ さくっと読める

原著者: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界には、メモリ(記憶)と安全性との間に存在する永続的な緊張関係があります。大規模言語モデルは、役に立つアシスタントとなるよう設計されていますが、長く複雑な会話を行う際、進行状況を維持するために、以前に話された内容を覚えておく必要があります。伝統的に、これらのモデルは、発言されたすべての単語の履歴を保持することでメモリを処理しますが、会話が進むにつれて、これは重く、動作を遅くさせます。同時に、これらのモデルを有害な要求から安全に保つことは、通常、外部のルールを追加したり、システム全体を再学習させたりすることを伴い、それがモデルの柔軟性を損なったり、無害な質問への回答を拒否させたりすることがあります。研究者たちの課題は、長期的なコンテキストを自然に保持しながら、安全性を単に後付けされたものではなく、その構造自体に組み込んだシステムを構築することです。

上海AIラボラトリーの研究チームは、「Safin-1」と呼ばれるモデルのファミリーを用いて、この問題を解決する新しい方法を提案しました。彼らは、安全性を外部のルールや別個のコードの層として扱うのではなく、人がさまざまな状況において行動を導く一連の個人的な価値観を携えているのと同じように、モデルが内部状態として安全性を保持するように設計しました。彼らの革新の核心は、モデルが一定の間隔で自身の内部思考プロセスのスナップショットを保存できるメカニズムにあります。モデルが長い文書を読んだり、複雑な指示に従ったりする際、モデルは定期的に一時停止し、現在の理解のコンパクトな要約を保存します。その後、モデルが過去の何かを思い出す必要があるとき、会話の全履歴を一度に処理しようとするのではなく、これらの保存されたスショットの中から最も関連性の高い情報を見つけ出すことができます。研究者たちが「メモリ・ネイティブな状態進化(memory-native state evolution)」と呼ぶこのアプローチは、モデルのメモリを、過去の受動的な記録から、必要に応じて参照・更新できる能動的なツールへと変貌させます。

研究者たちは、まずアーキテクチャが正しく機能することを確認するために、このアイデアを小規模なモデルでテストしました。その結果、特定の過去の状態を検索する能力を追加することで、モデルが長いコンテキストを理解し、テキストの奥深くに隠された情報を見つける能力が大幅に向上することを発見しました。数千語の「干し草の山の中から一本の針を探す」ようなテストにおいて、この新しい設計は、モデルが訓練中に見たことのない長さのテキストであっても、従来の手法を凌駕しました。これは、過去の状態を選択的に想起する能力が、膨大な情報量の中で迷うことなく、長期間にわたってモデルの集中力と推論能力を維持させるのに役立つことを示唆しています。

この初期の成功に基づき、チームはこの技術を40億から350億パラメータに及ぶより大規模なモデルへとスケールアップしました。彼らは同じメモリ・ルーティング・システムをこれらの大型モデルに適用し、その後、特定の応用分野である「安全性」についてテストを行いました。彼らは、モデルに付加できる特別な、持続的な「安全性状態(safety state)」を作成しました。この状態は、有害な要求を認識し、モデルを安全な応答へと導くよう訓練されていますが、切り離し可能な設計となっています。研究者たちは、この安全性状態が有効であるとき、モデルがトリックを用いて有害なコンテンツを生成させようとする試みに抵抗する能力が大幅に向上することを発見しました。ある一連のテストでは、この新しいアプローチは、標準的なモデルと比較して、こうした欺瞞工作の成功率をほぼ半分に減少させました。決定的なのは、この安全性の向上は、モデルの有用性を犠牲にすることなく達成されたという点です。モデルを過度に慎重にさせて正当な質問を拒否してしまう他の手法とは異なり、この新しいアプローチは、危険なものはブロックしながらも、無害な要求を拒否することははるかに少ない、高いレベルの有用性を維持しました。

この研究は、安全な人工知能を構築する方法についての考え方の転換を浮き彫りにしています。モデルの「脳」全体を絶えず再学習させたり、外部のフィルターだけに頼ったりするのではなく、この研究は、安全性がモデルの内部機構の不可欠な一部となり得ることを示唆しています。状況に応じてオン・オフを切り替えられる特化した状態をモデルに持たせることで、研究者たちは適応性と堅牢性を兼ね備えたシステムを作り上げました。結果は、この手法が、安全性が外部から課される制約ではなく、モデル自身のメモリと推論プロセスの中で自然に進化する能力となる、有望な道筋を提供していることを示しています。研究者たちは、これが初期の探索であり、このビジョンを完全に実現するにはさらなる作業が必要であると指摘していますが、これらの知見は、安全性が機械の思考と記憶の仕組みそのものに織り込まれ得ることを具体的に実証しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →