Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence
本論文は、AIガバナンスのための再実体化された入出力論理(Reified Input/Output Logic)のWolfram言語による実装を提示し、法的規範を実行可能なコードへと変換してエージェントの振る舞いを監査可能にする能力を示すとともに、この定式化プロセスを自動化する上で大規模言語モデルを使用することにおける現在の限界を浮き彫りにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ルールだらけの世界で振る舞う方法を、超スマートなロボットに教えようとしているところだと想像してください。問題は、ロボットの脳が「ブラックボックス」であることです。中を覗き込んで、どのように考え、なぜその決定を下したのかという理由を知ることはできません。それは、手品師がまだパフォーマンスを行っている最中に、そのトリックの仕組みを説明しろと頼むようなものです。通常、私たちは人間のように考えることをロボットに学習させようとすることで解決を図りますが、これはリスクが高い方法です。なぜなら、人間の言語は曖昧で、隠れた意味や抜け穴に満ちているからです。
ここで「計算法学(Computational Law)」が登場します。これは、乱雑な手書きのルールブックを、厳格なコンピュータプログラムへと作り変えることだと考えてください。「意地悪をしてはいけない」と書く代わりに、「もしアクションXが発生したら、結果Yが発生しなければならない」というコードを書きます。この分野は、法律のルールを、コンピュータが読み取り、従い、そしてルールに従ったことを証明できるほど精密にすることを目指しています。私たちが目にしている論文は、Wolfram Languageという特別なプログラミング言語を用いた、具体的な方法を探求しています。これは、法律を数学の方程式のように扱い、たとえロボットの脳の仕組みが理解できなくても、そのロボットがルールを守っているかどうかをチェックできるようにするものです。大きな疑問はこうです。「超スマートなAI(このテキストを書いているようなもの)に、私たちの乱雑な英語の法律を、完璧なコンピュータコードへと翻訳させることはできるのだろうか?」
この論文の大きな実験:AIはルールを書けるのか?
著者であるジェームス・K・ワイルズ(James K. Wiles)は、このアイデアをテストすることに決めました。彼は、Wolfram Languageを用いて「法的翻訳機」として機能するシステムを構築しました。このシステムは、Reified Input/Output Logicと呼ばれる特殊な論理を使用しています。これを理解するために、自動販売機を想像してみてください。あなたはコイン(入力)を入れ、機械はソーダ(出力)を出します。この法的システムにおいて、「入力」は事実(例:「今は夜である」)であり、「出力」はルール(例:「停止しなければならない」)です。また、このシステムは「リイフィケーション(実体化)」という複雑な概念も扱います。これは、単に「アリスがボブに本を渡す」といった出来事を、コンピュータが保持し、測定し、語ることができる「物理的なオブジェクト」へと変換するという、少し凝った手法のことです。
その後、著者は強力なAI(GPT-4)に、翻訳者としての役割を依頼しました。彼はAIに4つの単純な英語の法的文章を与え、それらをシステムが必要とするコンピュータコードへと変換するよう命じました。
結果:魔法とグリッチの混在
実験の結果、AIは高速であり、一見正しく見えるコードを書くことはできるものの、まだそれだけに頼って安全とは言えないことが判明しました。4つのテスト文章で起きたことは以下の通りです。
- 「ネクタイと金髪」テスト: AIに対し、ネクタイを着用していない、あるいは金髪である人が部屋から退出しなければならないというルールを翻訳させました。AIは動作しているように見えるコードを書きました。しかし、著者が数学的な検証を行ったところ、サイレントバグを発見しました。そのコードは、ネクタイを着用し黒髪である人を含め、全員に対して「真(True)」と答えてしまうという、機能不全を起こしていました。AIは、実際には何もチェックしていないルールを作り上げてしまったのです。
- 「すべての男」テスト: AIに対し、「すべての男は走る義務がある」という文章の翻訳を求めました。AIは動作するコードを書きましたが、「男」の定義においてミスを犯しました。その人は実際に「男」であるかどうかを確認する代わりに、ルールに「男」とあるからといって、その人を最初から男であると仮定してしまったのです。これは、クラブの入り口で、IDを確認するのではなく、「全員がVIPである」と勝手に決めて全員を通してしまうドアマンのようなものです。
- 「マネージャーと秘書」テスト: AIに対し、秘書はマネージャーのタスクを記録しなければならないというルールを翻訳させました。AIは完璧に見えるコードを書き、さらに「デイブはマネージャーではないので、義務はない」というコメントまで添えました。しかし、実際にそのコードを実行してみると、コードはコメントを無視して、強制的に秘書にタスクを記録させました。AIのコードとその説明が矛盾していたのです。
- 「人工衛星」テスト: AIに対し、人工衛星は国際宇宙ステーションから200キロメートルの距離を保たなければならないというルールを書かせました。AIは実際の人工衛星のデータを用いたコードを書き、これは印象的でした。しかし、数学が間違っていました。それは、宇宙空間を通る直線距離ではなく、地球の表面に沿った距離(道路をドライブするように)を測定していました。その結果、2つの人工衛星が垂直方向に400キロ離れていても、コード上では「接触している」と判定されてしまいます。
結論
論文は、AIは優れた助手ではあるが、ひどい上司である、と結論付けています。AIはルールを素早くドラフトできますが、「サイレントエラー」——プログラムをクラッシュさせることはないものの、ロボットに誤った行動をさせるミス——を引き起こします。著者は、AIに他のAIのための法律を書かせることはできないと主張しています。代わりに、チームによるアプローチが必要です。AIがコードをドラフトし、人間が厳格なテストを用いて、ロジックが成立しているかどうかを一行ずつチェックしなければなりません。
「フラフィー」のケーススタディ:ロボットの番犬
これが現実世界でどのように機能するかを示すために、著者は**フラフィー(Fluffy)**という名前のロボットの番犬のケーススタディを作成しました。フラフィーはAI企業によって所有されており、「計算契約(computational contract)」の下で稼働しています。これは紙の契約書ではなく、ルールが直接フラフィーの脳内に書き込まれているものです。
その契約には、3つの単純なルールがありました:
- 侵入者を阻止せよ: 夜間に人が自宅から100メートル以内に近づいた場合、フラフィーは彼らを阻止しなければならない。
- 近くに留まれ: フラフィーは自宅から200メートル以内にいなければならない。
- 武力行使の許可: フラフィーはテーザー銃の使用を許可されているが、使用を強制されることはない。
素晴らしい点は、フラフィーの行動が**監査可能(auditable)**であることです。もしフラフィーがテーザー銃を使用したとしても、システムは単に「実行した」と言うだけではありません。それは、「私はこれを行った:事実A(人が80mにいる)+事実B(今は夜である)+ルール1 = 阻止する義務」という、記号的なレシートを発行します。これにより、ロボットが法に従ったことを証明する、明確で変更不可能な証拠の足跡が作成されます。
なぜこれが重要なのか
この論文は、ロボットが法律を「理解」することを期待するのをやめ、法律を実行できるようにする必要があると主張しています。AIの心のブラックボックスの中身が見えるようになるまで待つことはできません。代わりに、ブラックボックスを「実行可能なルール」という檻で囲む必要があります。
著者は、すべての法律をコードに変換することはできない(「合理的であること」のように、あまりに曖昧なものもある)ものの、安全性に関わる機械のためのルールについては、間違いなくコード化すべきであると示唆しています。目標は人間の裁判官に取って代わることではなく、ロボットが「今まさに」ルールに従っているかどうかをチェックするためのツールを私たちに提供することです。
論文は次のような警告で締めくくられています。私たちは強力な機械を作りつつあり、もし彼らに明確で実行可能なルールを与えなければ、ロボットが恐ろしい決断を下したとしても、なぜそうなったのかが全く分からない未来を迎えることになるかもしれません。計算法学を用いることで、たとえロボットがブラックボックスであったとしても、そのルールは極めて明快であり、それがなされるべきであった通りに行われたかどうかを常に確認できるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。