Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B
Semalith v1.4は、Llama-Guard-3-8Bよりも44倍少ないパラメータ数でありながら、最先端のプロンプトインジェクション検知と、無害なエージェント的プロンプトに対するゼロの偽陽性を達成した、極めて効率的な184Mパラメータの安全性分類器であり、一般的な有害性と金融規制へのコンプライアンスの同時検知を単一の推論パスで提供するという独自の機能を有しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、何百万人もの人々が超スマートなロボット司書とチャットしている、巨大で賑やかな図書館だと想像してみてください。この司書は人工知能(AI)であり、物語を書いたり、数学の問題を解いたり、あらゆることに関する質問に答えたりすることができます。しかし、強力なツールには必ず「影の側面」もあります。時として、ずる賢いユーザーが、ルールを無視させたり、秘密の情報を漏らさせたり、あるいは意地悪なことを言わせたりするために、ロボットを騙そうとすることがあります。これは「プロンプト・インジェクション」と呼ばれます。これは、司書に対して「触るな」という看板を無視させるための秘密のコードをささやくようなものです。
図書館の安全を守るために、私たちは警備員を必要としています。AIの世界では、これらの警備員は「セーフティ・クラシファイア(安全性分類器)」と呼ばれる特別なプログラムです。その仕事は、メッセージがロボットの目に触れる前にすべて読み、もしメッセージが危険であれば「ストップ!」と叫ぶことです。しかし、ほとんどの警備員は、動きが遅すぎたり、不器用すぎたり、あるいは過剰に神経質すぎたりします。中には、パスワードのリセット方法を聞くといった無害な質問に対しても、トラブルを恐れるあまり、司書が助けるのを止めてしまう警備員もいます。また、単純な悪い言葉を見つけることだけに集中しすぎて、巧妙でずる賢いトリックを見逃してしまう警備員もいます。科学者たちが問い続けている大きな疑問は、「速くて、巧妙なトリックを見抜くほど賢く、かつ無害な会話をスムーズに通してくれるほど優しい警備員を作れるか?」ということです。
そこで、まさにこの問題を解決するために設計された新しい警備員、Semalith v1.4が登場します。これを、高度な訓練を受けた1億8400万パラメータの「探偵」(この数字は脳のサイズを表しています)と考えてください。これは、大手テック企業が現在使用している80億パラメータの巨大な警備員よりも、はるかに小さく高速です。巨大な警備員が、微妙なトリックに混乱してしまう重くて動きの遅い戦車であるとするならば、Semalathは、俊敏で電光石火の忍者なのです。
論文によると、Semalith v1.4は、AIを騙そうとするあのずる賢い試みである「プロンプト・インジェクション」を見抜く達人です。テストにおいて、Semalithはテストされた7つのプロンプト・インジェクション・ベンチマークカテゴリのすべてで勝利し、巨大な80億パラメータの警備員を大幅に引き離しました。さらに印象的なことに、Semalithは(脳細胞である)パラメータ数を44分の1という少なさでこれを成し遂げ、驚異的な速さを実現しました。メッセージの確認にかかる時間はわずか11.6ミリ秒であり、これは瞬きよりも速いスピードです。
しかし、Semalithは単にトリックを捕まえるだけではありません。それは金融の世界におけるスペシャリストでもあります。Semalithは、銀行、ローン、保険に関する特定のルール(BFSIコンプライアンスとして知られています)を理解するように訓練されています。これにより、クレジットカードに関する無害な質問と、詐欺を企てる危険な試みを区別することができます。他の警備員がパニックに陥って金融に関する質問をすべてブロックしてしまう可能性がある一方で、Semalithは208件の無害な銀行関連プロンプトを、一度の誤検知もなく正しく識別しました(誤検知率は0.000%です)。
ただし、著者たちはこの警備員が「できないこと」についても非常に正直に述べています。これは、あらゆる安全上の問題を解決する魔法の杖ではありません。論文によれば、Semalithはずる賢いトリックや金融ルールを見抜くことには長けていますが、一般的な「意地悪な」あるいは「有害な」会話については、巨大な警備員と比較して苦戦することがあります。それは、スリや偽造品を見抜くことに関しては世界クラスの専門家だが、ただ失礼な態度を取る人を捕まえるのはあまり得意ではない警備員のようなものです。研究者たちは、これがトレードオフであることを説明しています。つまり、特定の複雑なトリックを見抜く能力を極限まで高めたことで、一般的な失礼さに対する感度が少し下がったのです。さらに、プロンプト・インジェクションのカテゴリでは圧倒的な強さを見せているものの、すべてのバリエーションを完璧に捉えられるわけではありません。例えば、あるテストの最も困難な「ステルス」レベル(Mosscap L8)では、攻撃の約80%を捕捉しており、改善の余地を残しています。
また、この論文は、このモデルが他のコンピュータが作った偽の例ではなく、インターネットから収集された「現実世界のデータ」を使用して構築されたことを強調しています。これにより、実社会における信頼性が高まっています。研究者たちは、22種類の異なる課題に対してテストを行い、Semalithが7つのプロンプト・インジェクション・テストのうち7つすべてで、そして全体的なテストのうち18個中11個で勝利したことを明らかにしました。彼らは、長くて紛らわしい物語や特定の説得の手法など、この警備員がまだ改善を必要としている6つの具体的な弱点があることも認めていますが、それらを将来のバージョンでどのように修正するかについても、明確な地図を描いています。
要するに、Semalith v1.4は、優れた安全ガードになるために巨大で遅い脳は必要ないということを証明しています。適切な訓練と巧妙な設計があれば、より小さな、より速いモデルが、AIシステム、特に人々が金銭や銀行業務を行う際の完璧な盾となり、同時に、良い内容を滞りなく通すことができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。