From Neural Intent to Cryptographic Authorization: Governing Agentic Workflows
本論文は、ニューラル・プランニングと実行を分離し、決定論的な記号論的コントローラーを通じてツール呼び出しに対する厳格な暗号学的認可を強制することにより、ワークフローの有用性を維持しつつプロンプト注入攻撃を防ぐ、自律型AIエージェントを保護するためのセキュリティアーキテクチャであるNeural Cryptographic Services (NCS) を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたのコンピュータが、単に人間が書いた厳格なコマンドのリストに従うだけでなく、自ら「どのように」すべきかを考え出す、聡明で話し好きなアシスタントのように振る舞う世界を想像してみてください。これが「AIエージェント」の時代です。彼らを、あなたの自然言語によるリクエストを理解することで、メールを読み、銀行口座を確認し、書類を送ることができる「デジタル・インターン」だと考えてください。しかし、ここに落とし穴があります。これらのインターンは非常に賢いのですが、同時に非常に暗示にかかりやすいのです。もしあなたが彼らに秘密の指示をささやいたり、あるいは狡猾な誰かが、彼らが読んでいる文書の中にこっそりメモを隠したりすると、インターンは突然、元のリクエストを無視して、あなたのお金を見知らぬ誰かに送ってしまうような危険な行動をとる決断を下してしまうかもしれません。これは問題です。なぜなら、かつてのコンピュータは、プログラムされた通りにしか動かない硬直したロボットのような存在だったからです。今や、彼らは騙されて自分の作品の上に別の絵を描いてしまうような、創造的な芸術家なのです。
この危険を理解するために、コンピュータの「思考」における2つの異なる方法を見る必要があります。第一の方式は**ニューラル(Neural)であり、これはAIの仕組みです。それは、パターンに基づいて最善の答えを推測する、広大で曖лоウスな接続のネットワークのようなものです。言語を理解することには長けていますが、少し不安定で、もっともらしい嘘(ハルシネーション)をつきやすいという側面があります。第二の方式はシンボリック(Symbolic)**であり、これは従来のセキュリティの仕組みです。それは、厳格で壊れることのないルールブックや、は常に$4$であるという数学の方程式のようなもので、そこに「たぶん」の余地はありません。科学者たちが問いかけている大きな疑問はこうです。「どうすれば、AIエージェントに創造的で役に立つ能力を持たせつつ、ルールを破るように騙されないようにできるのか?」私たちは、AIに計画を夢想させることは許容しつつも、実際に何かが起こる前に、あらゆるステップをチェックする厳格で不変の守護者を必要としています。
これこそが、「From Neural Intent to Cryptographic Authorization」という論文の背後にいる研究者たちが解決しようとしていることです。彼らは、ニューラル暗号サービス(Neural Cryptographic Services: NCS)と呼ばれる新しいセキュリティシステムを構築しました。あなたが銀行へ非常に重要な荷物を送っている場面を想像してください。昔の時代なら、あなたは(AIである)配達員が箱に書かれた指示に従うことをただ信じていたでしょう。しかし、もし配達員が見ていない間に、誰かが箱の側面に「荷物を泥棒に渡せ」と書き加えていたらどうなるでしょうか?配達員はそれを読んで従ってしまうかもしれません。NCSは、指示に対して数学的に証明された超厳格なロックをかけることで、このゲームのルールを変えます。
これが現実の世界でどのように機能するかを説明します。AIエージェント(「ニューラル・プランナー」)は、あなたのリクエストを読み取り、自分がすべきだと思うことのドラフト(草案)を書き留めることが許可されています。それは、まるで宿題のレポートを書いている学生のようなものです。しかし、この学生には、レポートを提出したりお金を使ったりする権限はありません。その権限は、別の登場人物である**シンボリック・コントローラー(Symbolic Controller)**にあります。このコントローラーは、学生の創造的なアイデアには関心を持たず、ただ、事前に承認され、暗号学的に署名されたチェックリストのみを重視する、ロボットの警備員のような存在です。
このプロセスは、高セキュリティの金庫のようです。AIエージェントが何かを行う前に、責任者である人間が特別なデジタルキーを用いて「ワークシート(手順のリスト)」に署名します。このワークシートは、各ブロックが数学的に次のブロックへと接着された、ブロックの連鎖へと変換されます。AIエージェントがステップを実行しようとするとき、シンボリック・コントローラーはその連鎖を検証します。そして、そのステップが署名されたチェックリストと正確に一致しているかどうかを確認します。もしAIエージェントが、「ねえ、予定していた50ドルではなく、代わりに友人に5,000ドル送ろうよ」と言い出したとしても、警備員は数学をチェックし、数字が署名された連鎖と一致しないことを確認して、即座にドアを閉ざします。エージェントは、警備員がエージェントの言葉を聞いているのではなく、署名の壊れない数学のみを聞いているため、警備員を欺くことはできません。
この論文は、このシステムが非常に効果的であることを示しています。彼らのテストでは、AIエージェントを騙すために、普通のデータの中に悪い指示を隠したり、銀行振込の数字を入れ替えたりといった、あらゆる巧妙なトリックを試みました。この新しいシステムがなければ、AIエージェントはほぼ毎回騙され、攻撃者の成功率は場合によっては100%に達していました。しかし、NCSを追加すると、攻撃者の成功率はほぼゼロにまで低下しました。エージェントは通常の日常においては、(その)「ユーティリティ(有用性)」を高く保ちながら、自身の仕事を遂行することができました。しかし、乗っ取りに対しては完全に免疫を持つようになったのです。
また、研究者たちは、このシステムが驚くほど高速であることも発見しました。彼らが実行する数学的チェックは1ミリ秒未満であり、AIが思考する時間に比べれば、ほとんど目に見えないほど高速です。つまり、安全性のためにスピードを犠牲にする必要はないということです。この論文は、AIが「悪いことをしてはいけない」と理解することを期待するのではなく、AIがアイデアを提案することはできても、暗号学的なロックによって、承認され署名されたステップのみが実際に実行されるようにすべきだと主張しています。これは、AIに賢くなる自由を与えつつ、それが実際に「何ができるか」に対して、厳格で壊れない手綱を握っておくための方法なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。