← 最新の論文
💻 computer science

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

本論文は、AIシステムにおける「デプロイ後開示ギャップ」を調査しており、プロバイダーが安全性に関する文書を公開している一方で、デプロイされたモデルが報告されたバージョンと一致していることを外部から検証するメカニズムが欠如していることを明らかにし、その上で、透明性と説明責任を強制するための「サイレント・アップデート・スコアカード」および「3部構成の行動トリガー・システム」を提案している。

原著者: Sophia Abraham, Ben Bucknall

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Sophia Abraham, Ben Bucknall

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、シェフが超スマートなロボットである、巨大で魔法のようなビュッフェにいます。あなたは特定の料理、例えば「GPT-5バーガー」を注文しました。メニューには、その中に何が入っているか、食べて安全か、そして有名な美食家のレビューに基づいた味までもが正確に記されています。あなたはメニューを信頼しているので、安心感を感じています。しかし、ここにひねりがあります。シェッフルは、あなたがまだ食べている最中に、あなたに知らせることなく、名前を変えたり、メニューを更新したりすることなく、こっそりとバーガーのパティをすり替えたり、秘密のソースを変えたり、あるいはバンズそのものを全く別のものに置き換えたりすることができるのです。AIの世界では、これが「基盤モデル(foundation models)」で起きていることです。これらは、チャットボットやツールを動かしている巨大なAIの脳です。ここでの鍵となる概念は「管理の連鎖(chain of custody)」であり、これはあなたが食べているバーガーが、まさに批評家が味わったものと同じであることを証明するレシートのようなものです。もう一つの概念は「サイレント・アップデート(silent updates)」であり、それはシェフが行う秘密の入れ替えのことです。人々がこれを懸念するのは、もしメニューにはバーガーが安全だと書いてあるのに、シェフが密かに激辛の毒を混ぜていたら、レビューは役に立たず、あなたは体調を崩してしまうかもしれないからです。私たちは、今使っているものが、実際にテストされたものであるかどうかを知る必要があります。

ここで、研究者のソフィア・エイブラハムとベン・バックナールが何をしたのかを見てみましょう。彼らは食品検査官のような役割を果たしました。ただし、レストランをチェックする代わりに、9つの大きなAI企業と、これらのAIツールをホストしている7つの場所をチェックしました。彼らは、AI企業が秘密の材料の入れ替えについて正直であるかどうかを確認するために、「サイレント・アップデート・スコアカード」と呼ばれる特別なチェックリストを作成しました。彼らは、今日あなたが話しているAIが、まさに彼らの安全報告書でテストされたものと同じであるという証拠を探しました。

結果は、まるでビュッフェに「ゴーストキッチン」があることを突き止めたかのようでした。研究者によると、シェフ(AI企業)は詳細なメニューや安全報告書(安全文書や評価の公開)を書くことには非常に長けていますが、皿の上にある食べ物がメニューと一致していることを証明することについては非常に無力であるということが分かりました。実際、彼らが調査した9つの主要なAIプロバイダーのうち、提供されている特定のAIモデルが、彼らの安全報告書に記載されているものと全く同一であることを外部の人間が検証する方法を提供していた企業は、ゼロでした。それは、シェフが「これはメニュー通りのバーガーです、私を信じてください」と言いながら、厨房への立ち入りを拒み、レシートも見せないようなものです。

論文によれば、これはAIシステムが静的なものではなく、背景で常に変化し続けているために起こるとされています。研究者は、この「サイレント・アップデート」のゲームが行われる4つの主な方法を特定しました。

  1. 変幻自在の名前: 企業は「GPT-5」や「Claude」のような安定した名前を使用しますが、これらの名前は時間の経過とともに異なるバーガーに貼り付く魔法のラベルのようなものです。ある日「GPT-5」は牛肉のパティかもしれませんが、翌月には野菜のパティになっているかもしれません。しかし、名前は変わりません。
  2. 欠落したログブック: 企業は新しいバーガーを発売したことを発表することは得意ですが、すでにメニューにある古いバーガーの材料を密かに変更したときに、それを記録することは滅多にありません。
  3. 二つの顔: ウェブサイトで提供されているバーガー(チャットボット)と、コンピュータプログラムを通じて取得できるバーガー(API)が異なっていることがあり、企業はその違いを教えてくれません。
  4. 紐付けられていないレシート: 安全報告書は、特定の変更不可能なバージョンではなく、「(例:GPT-5ファミリーのような)モデルのファミリー」について語ることがよくあります。つまり、安全報告書は昨年のバーガーについてのものかもしれませんが、あなたが今食べているのは今日のものです。

また、研究者は、一部の企業が、人々が食べ物をチェックすることを実際に阻止するようなルールを契約内に持っていることも発見しました。例えば、調査した9社中6社は、AIがメニュー通りに振る舞っているかどうかを確認するための独自のテストを実行することを禁止する条項を持っています。これは、レストランが「私たちのメニューを読むことはできますが、もし食べ物の味見をしてメニューと一致するかどうかを確認しようとしたら、あなたを追い出します」と言っているようなものです。

これを解決するために、著者たちは「三部構成の行動トリガー・システム(Three-Part Behavioral Trigger System)」と呼ばれる新しいシステムを提案しています。これは、新しい厨房ルールのようなものです。シェフがレシピを変えたことを認めるのを待つのではなく、ルールは次のように定めます。

  • もしAIが以前とは異なる挙動(以前は答えられた質問を拒否するなど)をし始めたら、それは「ドリフト・トリガー(Drift Trigger)」であり、彼らはメニューを更新しなければなりません。
  • もし彼らが機械の特定の部品(ソースのディスペンサーやグリルなど)を変更した場合、それは「コンポーネント・トリガー(Component Trigger)」であり、直ちにログに記録しなければなりません。
  • もしAIが突然、非常に賢くなったり、あるいは非常に危険になったりした場合、それは「ケイパビリティ・トリガー(Capability Trigger)」であり、全体を再テストしなければなりません。

彼らはまた、「セーフハーバー(Safe Harbor)」ルールも提案しています。これは、「もしあなたが、公衆の利益のためにバーガーの安全性をチェックしようとしているフードクリティック(批評家)であるなら、レストランはあなたを訴えたり、追い出したりすることはできない」という法律のようなものです。

この論文は、これらの企業が嘘をついているとか、現在のAIが危険であると主張しているわけではありません。むしろ、現在のシステムは、使用しているAIと安全報告書の間のリンクを証明する方法がないために壊れていると示唆しています。著者らは公開情報を用いてこれを測定し、書類自体は存在するものの、「管理の連鎖」が断絶していることを明らかにしました。彼らは、使用しているAIがテストされたものと同じであることを検証できない限り、私たちは暗闇の中で食事をしているのだと指摘しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →