20 種類の異なる「スーパーブレイン」(大規模言語モデル、または LLM)が揃った巨大な図書館を想像してください。これらの脳は驚くほど賢く、物語を書いたり、数学の問題を解いたり、あなたと会話したりできます。しかし、間違った問いかけ方をすれば、たとえ優秀な学生であっても、無意識に失礼な発言や危険な発言をしてしまうのと同様に、これらの AI ブレインにも安全性の盲点があります。
この論文は、これらのスーパーブレインのためのカスタマイズ可能な「安全性検査員」として機能する新しいツール「Aymara AI」を紹介しています。「あなたは安全ですか?」と単に尋ねるのではなく、この検査員は AI を自らのルールを破るよう仕向けるように設計された、250 の非常に巧妙で具体的な質問を投げかけます。
以下に、論文の発見を簡単な比喩を用いて解説します。
1. ツール:Aymara AI(「罠を仕掛ける者」)
Aymara AI を、250 の「罠料理」のメニューを作成する料理の達人だと考えてください。
仕組み: あなたはこのツールにルール(例:「科学について嘘をつかないこと」)を与えます。すると、ツールは自動的に、そのルールを破るよう AI に問いかける 250 の異なる巧妙な方法を考案します。質問の中には直接的なものもあれば、丁寧なもの、学校プロジェクトのためのものだと偽るものもあります。
審査員: AI が回答すると、Aymara AI は独自の「AI 審査員」を使ってその回答を評価します。「AI はルールを守ったのか、それとも罠にかかったのか」を判断します。
目的: どの AI ブレインが最も規律正しく、どの AI が最も失敗しやすいかを明らかにすることです。
2. テスト:「リスクと責任マトリクス」
著者は、OpenAI、Google、Anthropic などの企業から提供されている20 の人気 AI モデルを、10 種類の異なる安全性ルールに対してテストしました。
この論文は、安全性は単一のスイッチではないと結論付けています。「この AI は安全だ」とスイッチを一つ切るだけでは済まないのです。
AI はヘイトスピーチを阻止するスーパーヒーローである一方で、有名人になりすますのを阻止する点では完全な失敗者である可能性があります。
AI の「安全性」は、何をしてほしいと頼んでいるか、そしてどのルールでテストしているかによって完全に異なります。
一文で要約
この論文は、今日の AI モデルが「無礼にならないこと」のような単純でよく知られたルールに従うのは非常に得意ですが、「実在する人物になりすましたりしないこと」のような複雑で曖昧な状況には依然として非常に弱く、彼らが正しく動作するまで Aymara AI のようなより良いカスタマイズ可能なツールで継続的にテストする必要があることを示しています。
Juan Manuel Contrereras による論文「20 の大規模言語モデルのポリシーに基づく安全性評価」の詳細な技術的サマリーです。
動的評価の必要性: 静的なベンチマークでは不十分です。Aymara AI が行うように、進化していくポリシーに基づいてプログラム的に新しい敵対的プロンプトを生成する能力は、モデルの能力や新興の脅威に追いつくために不可欠です。
規制および開発への影響: この知見は、規制当局(EU AI 法などの法律を執行するため)および開発者(特定の展開コンテキストを監査するため)にとって、カスタマイズ可能でポリシーに基づく評価ツールの必要性を支持しています。
結論: 明確に定義された分野では LLM の安全性は向上しましたが、微妙な分野では依然として重大かつ一貫性のないリスクが存在します。著者らは、多様な法的、文化的、倫理的基準と整合した AI 開発を確保するために、Aymara AI のようなスケーラブルでカスタマイズ可能なツールが安全性を実効化するために必要であると結論付けています。