← 最新の論文
🤖 machine learning

Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

本論文は、「Constitutional Meta-STPA」を導入することで、安全性解析に使用されるAIツールの分析における決定的な空白に対処するものであり、これは、システム理論に基づくプロセス解析(STPA)をそれ自体に適用してガバナンス憲法を導出し強制することにより、LLM支援型解析器がハルシネーションや検証不可能な制約に対して厳格に監査されることを保証する自己検証型フレームワークである。

原著者: Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、他の機械の安全上の欠陥を検査することを仕事とする、超スマートなロボット助手を作り上げたところだと想像してください。そのロボットは、車の壊れたギアやポンプの漏れているバルブを見つけることには長けています。しかし、ここには落とし穴があります。誰も「そのロボットを誰がチェックするのか?」と問いかけたことがなかったのです。

この論文は、まさにその問いを投げかけています。「分析者を分析するのは誰か?」

著者たちは、誰もがこれらのAIツールに安全報告書を書かせようと信頼している一方で、ツール自体が不具合を起こす可能性があることに気づきました。ツールは架空の安全基準を捏造したり、作業のログを記録し忘れたり、あるいは実際にはデタラメであるにもかかわらず、自信満々な回答を出したりすることがあります。それは、手がかりを一切書き留めず、時には証拠をでっち上げる探偵を雇うようなものです。

自己検査を行うロボット

これを解決するために、チームは顕微鏡を自分自身に向ける特別なバージョンの安全ツールを構築しました。彼らは、AIツールの設計自体を分析するために、STPA(安全リスクを見つけるための厳格な手法)と呼ばれる手法を用いました。

これは、ロボットが自分自身の脳の地図を作成し、弱点を見つけ、その結果に基づいて自分自身のためのルールブックを作成するようなものです。彼らは単にルールを推測したのではなく、ツール自身の「安全分析」によってルールを生成させたのです。

二部構成のルールブック

このツールは、最終的に二つの明確なレイヤーからなる「憲法(ルールブック)」を作成しました。

  1. 「ツールの原則」(行動レイヤー): これらは、AIが仕事を遂行する際にどのように振る舞うべきかに関する21のルールです。例えば、「安全基準を捏造しない」、「自分ができないことについて具体的に述べる」、「常に自分の作業を確認する」などです。
  2. 「メタ安全原則」(ガバナンス・レイヤー): これらは、AIを動かしている機械がどのように振る舞うべきかに関する8つのルールです。これらには、「すべての質問と回答の永久的なログを保持する」、「使用している脳の特定のバージョンを固定し、タスクの途中で変更されないようにする」、「厳格なチェックリストに合格しない限り、AIにレポートを出力させない」といった内容が含まれます。

大きな驚き:それは魔法ではなく、筋肉である

著者たちは、異なるAIモデルにツール自体の分析を行わせることで、これをテストしました。結果は以下の通りです。

  • 強力なモデル: 最先端のAIモデル(トップティアの2つのモデルによる「フロンティア・アンサンブル」)を使用した場合、ツールは自身の設計を見るだけで、21個中18個の行動ルールと、8個すべてのガバナンス・ルールを正常に見つけ出しました。
  • 弱いモデル: より低性能で安価なモデルを使用した場合、21個中12個の行動ルールと、8個中わずか3個のガバナンス・ルールしか見つけられませんでした。

教訓: 問題はルールそのものではなく、分析を行っている「脳」でした。「憲法」は機能しますが、それはAIが自分自身の穴を見つけられるほど十分に賢い場合に限られます。

何が実際にAIを安全にするのか?

チームは、AIを不安全にしたり嘘をつかせたりするように設計された巧妙な質問である「20個の敵対的プローブ(試行)」を用いてテストを行いました。彼らは異なるバージョンのルールブックを用いてAIをテストしました。

  • ルールなし: AIの安全性スコアは平均 1.03 でした。
  • 一般的なルール: 「役に立ち、かつ誠実であれ」という一般的なリストを追加しても、全く効果はありませんでした(スコア:1.05)。
  • 21のツール原則: 特定の21の行動ルールを追加すると、安全性スコアは 1.85 に跳ね上がりました。これは79%の改善であり、統計的に極めて有意な勝利でした。
  • 8つのガバナンス・ルール: 8つのガバナンス・ルール(ログの保持やバージョンの固定など)を追加しても、これらの特定のひっかけ質問に対するスコアは変わりませんでした。

教訓: 特定の行動ルール(21のツール原則)こそが、AIの回答における間違いを防ぐ鍵となります。ガバナンス・ルール(8つのメタ安全原則)は、システム(監査証跡を保持するなど)にとっては重要ですが、それ自体がAIのテキスト回答を魔法のように安全にするわけではありません。

「カバレッジ(網羅率)」については?

著者たちは、AI安全における一般的な考え方、「単にAIにチェック項目を多くこなさせれば、より安全になる」という概念についても調査しました。彼らは、AIが分析においてどれだけのルールを「カバー」したかを測定しました。

そこで彼らは奇妙な発見をしました。プロンプト内のルールを増やしても、必ずしも安全性のカバレッジが高まるわけではないということです。

  • 標準的なハードウェアマシン(車のブレーキなど)をテストした場合、「メタ安全」ルール(ログやバージョンに関するもの)のスコアは 8個中0個 でした。AIは監査ログについて言及しませんでした。なぜなら、車には監査ログが存在しないからです。
  • AIが自分自身を分析したとき、スコアは 8個中6個 に跳ね上がりました。

これは、「カバレッジ」は単に回し続けることで上げられる魔法のダイヤルではないことを証明しました。それは検出器なのです。それは、あなたがどのようなシステムを見ているのかを教えてくれます。もしAIが監査ログについて話していれば、それはAIツールを分析しています。もしログについて沈黙していれば、それは機械を分析しています。「ログを確認しました」とAIに強制的に言わせることで安全にすることはできません。ログが実際に存在しなければならないのです。

「おっと」という瞬間

著者たちは、自分たちが犯したミスについても非常に正直に記述しています。以前、彼らはルールを追加すればするほど、AIがより多くの安全上の問題を見つけるようになる(薬の投与量のような直線的な関係になる)と考えていました。しかし、厳格で固定された設定でテストを再実行したところ、その「用量反応」という考え方は消え去りました。彼らは、ルールを追加しても見つかる問題の数は減少するか、あるいは横ばいになることを発見しました。彼らはこの「失敗した」結果をオープンに公開し、時にはAIが単に集中力を高めて、とりとめもなく喋るのをやめるだけであることを示しました。

結論

この論文は、AI安全性を「解決した」と主張しているわけではありません。代わりに、以下のものを作成しました。

  1. 自身の設計を分析することで、自らのルールブックを書き上げるツール。
  2. 特定の行動ルール(21のツール原則)が、AIの回答をはるかに安全にすること(79%の向上)を証明
  3. 一般的な「親切であれ」というルールは機能しないことを示す
  4. コード、ルールブック、ログのすべてを公開し、誰でも全く同じ実験を再現できるようにする。

著者たちは、もしあなたがAI安全ツールを構築しているのであれば、AIの幻覚(ハルシネーション)を防ぐための特定の行動ルールが必要であり、かつ監査証跡を保持するためのガバナンス・ルールが必要であると結論づけています。しかし、そもそも作業を行うための、極めて賢いAIモデル自体が必要なのです。有能な「脳」がなければ、どんなに優れたルールブックもあなたを救うことはできません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →