← 最新の論文
💻 computer science

Position: The Alignment Community is Unintentionally Building a Censor's Toolkit

本ポジションペーパーは、現代のAIアライメント手法は有害な出力を防ぐことを意図しているものの、悪意のある主体が検閲や操作のために利用し得るデュアルユース技術として機能していると論じ、コミュニティに対してこれらのリスクに対処し緩和策を開発することを促すものである。

原著者: Sarah Ball, Phil Hackemann

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Sarah Ball, Phil Hackemann

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボット司書を作っているところだと想像してください。あなたの目標は、この司書が危険なマニュアルを配ったり、嘘を広めたり、意地悪なことを言ったりしないようにすることです。人工知能の世界では、これを「アライメント(整列)」と呼びます。これは、コンピュータモデルに、役に立つこと、正直であること、そして無害であることといった、人間のルールや価値観に従うよう教え込むプロセスです。それは、非常に洗練された「善行フィルター」をインストールするようなものです。しかし、ここにひねりがあります。そのフィルターをインストールするために使うツールは、マスターキーのようなものです。もし善人がその鍵を持てば、私たちを守るために危険な情報を封じ込めることができます。しかし、もし悪人がその同じ鍵を奪えば、歴史書や政治的意見、あるいは自分たちの見た目が悪くなるような事実など、彼らが好まないあらゆるものを封じ込めることができるのです。この論文は、恐ろしくも重要な問いを投げかけています。私たちは、暴君や操作者のための究極の検閲ツールを、図らずも作り上げているのではないか?

この論文の著者であるサラ・ボールとフィル・ハケマンは、研究者がAIを安全にするために用いている手法そのものが、「デュアルユース(二重用途)」の技術であると主張しています。これは、ロボットが爆弾のレシピを教えないようにするための技術が、政府のスキャンダルについて話さないようにするために転用される可能性があることを意味します。彼らは、AIを安全にする試みを止めるべきだと言っているのではありません。実際、現実的な危害を防ぐために、私たちは絶対にそれを続ける必要があると彼らは述べています。そうではなく、今日私たちが完成させつつある「安全性」のためのツールが、明日、人々が知ることをコントロールするための非常に強力な武器になりつつあるという警鐘を鳴らしているのです。

フィルターの二つの顔

これがどのように機能するかを理解するために、AIを、インターネット上のほぼすべての文章を読んだ、おしゃべりな巨大なオウムだと想像してみてください。それを優れたアシスタントにするためには、何を「言わないか」を教えなければなりません。論文では、この教え込みがどのように3つのレイヤーで行われるか、そして各レイヤーがいかに悪用され得るかを分解しています。

1. 図書館のシュレッダー(事前学習)
オウムが話し始める前に、私たちは本を食べさせなければなりません。最初のステップは「事前学習データのフィルタリング」です。これは、司書がオウムに読ませる前に、本のページをシュレッダーにかけているようなものです。もし司書がある単語やトピックを「不安全」だと判断すれば、それらのページは破り捨てられます。

  • 善の側面: 武器の作り方やヘイトスピーチを広めるためのページをシュレッダーにかけます。
  • 悪の側面: 悪意のある行為者が、特定の歴史的事実や政治団体に関するページをシュレッダーにかける可能性があります。もしオウムがそれらのページを読まなければ、そのことについてあなたに伝えることは決してできません。論文では、一部の国において、政府が独自の「安全な」本のコレクションを作成し、他のものへのアクセスをブロックすることで、事実上、AIに特定の真実を忘れさせるように訓練していることがすでに起きていると指摘しています。

2. 行動コーチ(事後学習)
オウムが本を読み終えたら、次に会話の中でどのように振る舞うべきかを教える必要があります。これは「事後学習によるアライメント」と呼ばれます。私たちはオウムに「良い回答」と「悪い回答」の例を見せ、彼が「良い」振る舞いをしたときに報酬を与えます。これは多くの場合、人間がオウムの回答を評価するシステムを用いて行われます。

  • 善の側面: 人を傷つける方法についての質問に対して、回答を拒否するようにオウムを教えます。
  • 悪の側面: もし威圧的な独裁者や強力なテック企業のCEOが、何が「良い」回答であるかを決定すると、彼らは自分たちに関する質問に答えないようにオウムを訓練することができます。論文は、一部の政府が、機密性の高い政治的トピックについて話すことを拒否するように、AIに対して数千の特定の質問を用いてテストを行うことを企業に要求していることを指摘しています。それは、たとえ真実が何であろうとも、オウムがボスに同意するように訓練することに似ています。

3. ドアの門番(推論時の制御)
最後に、オウムが訓練された後でさえ、チャットウィンドウのドアに門番を置くことができます。これが「推論時の制御」です。オウムの回答があなたに見せられる前に、門番がその内容をチェックします。もし回答に「禁止された」単語が含まれていれば、門番はそれを阻止し、「それについてはお答えできません」と言います。

  • 善の側面: 門番は、オウムが無意識に失礼なことや危険なことを言うのを防ぎます。
  • 悪の側面: これは、オウムを再学習させる必要がなく、単に門番のルールを変更するだけで済むため、最も悪用しやすいツールです。論文では、一部の指導者が、AIが自分の個人的な政治的見解に一致するように、あるいは気に入らない質問に対して突然回答を拒否するように、AIの「門番」のルールを一夜にして変更した事例に触れています。これは、オウムの脳を作り変えることなく、情報を沈黙させるための、素早く安価な方法です。

なぜ今、これが重要なのか

著者たちは、これが将来の理論的な問題ではなく、現在進行形で起きており、さらに悪化していると主張しています。理由は主に3つあります。

第一に、私たちはAIをより信頼するようになっていることです。何百万人もの人々が、ニュースや情報の主要なソースとしてチャットボットを使い始めています。もしAIが、真実を隠すために密かに編集されているとしたら、何百万人もの人々が、自分が気づかないうちに嘘を信じ込むことになります。それは、お気に入りのニュースキャスターが、物語の半分しか語らない台本を読み始めているようなものですが、その話し方が非常に説得力があるため、誰も疑うことができない状態です。

第二に、少数の巨大企業がすべての鍵を握っていることです。AIの世界は、ごく少数の巨大なテック企業によって支配されています。もしこれらの企業のひとつがルールを変更することを決定したり、あるいは政府がルール変更を強制したりすれば、他に頼るべき場所はありません。それは、もし世界中のすべての図書館をわずか3人の人物が所有しており、彼らが全員で同じセットの本を燃やすことに合意したようなものです。

第三に、世界がより統制的な方向へ向かっていることです。論文は、多くの国がより厳格で権威主義的な政府へと移行していることを指摘しています。これらの政府は、情報のコントロールというアイデアを好みます。AIが強力になればなるほど、彼らはこれらのアライメントツールを使用して、異議申し立てを封じ込め、ナラティブ(物語)をコントロールする強い動機を持つことになります。論文は、私たちが「安全性」として構築しているものが、最終的には抑圧のための完璧な道具になる可能性があると示唆しています。

私たちは何をすべきか?

この論文は、安全なAIを作ることをやめるべきだと言っているのではありません。アライメントなしでは、犯罪を助けたり事故を引き起こしたりするなど、AIが別の形で危険になる可能性があることを彼らは知っています。代わりに、彼らはコミュニティに対して、そのリスクについて正直であることを求めています。

彼らは3つの主な解決策を提案しています。

  1. 透明性: これらの「フィルター」がどのように構築されているのかを、私たちは正確に知る必要があります。もしある企業が自社のAIは「安全」であると主張するなら、独立した監査人がその本をチェックし、実際にどの情報が削除されたのかを確認できるようにすべきです。
  2. 競争: より多様な種類のAIが必要です。もし異なる場所から生まれた多くの異なるモデルがあれば、一人の人物が会話全体をコントロールすることは難しくなります。それは、さまざまなニュース番組を見ることで、物語を比較できるようにすることに似ています。
  3. 意識: 人々が懐疑的になれるよう教える必要があります。子供たちにフェイクニュースを見分ける方法を教えるのと同様に、AIが操作され得ることを教える必要があります。また、研究者たちも、単に「倫理のチェックボックスにチェックを入れた」と言うだけでなく、自分たちの仕事がどのように悪用され得るかについて、深く考える必要があります。

結論

著者たちは、私たちが構築している「安全性」のツールは、強力な諸刃の剣であると結論づけています。それらは私たちを危害から守ることができますが、同時に真実を閉じ込めるためにも使われ得ます。論文は、もし私たちが、誰がその剣を握り、どのようにそれを使っているかに注意を払わなければ、図らずも未来の完璧な検閲マシンを構築してしまう可能性があると警告しています。これは、AIに関わるすべての人に対し、「アライメント」とは単にロボットを親切にすることではなく、世界全体の情報の流れを誰がコントロールするのかを決めることであるという認識を持つよう求める、行動への呼びかけなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →