← 最新の論文
💻 computer science

Repeated-Game Security for Restaking-Based Verifiable Inference

本論文は、リステーキングに基づく検証可能推論においてしばしば仮定される一回限りのインセンティブ適合性が、比例的なスラッシングが時間の経過に伴う合理的な非遵守を抑止できないという反復ゲームのギャップのために不十分であることを示し、クエリごとの暗号学的検証を必要とせずに長期的なセキュリティを回復するために、履歴依存型のチャレンジとレピュテーション加重型スラッシングを組み合わせた展開可能なメカニズムを提案するものである。

原著者: Zhenhang Shang, Yingzhe Yu, Kani Chen

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Zhenhang Shang, Yingzhe Yu, Kani Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で非常に賢いコンピュータの脳(大規模言語モデルと呼ばれます)が、あなたの質問に答えたり、物語を書いたり、数学の問題を解いたりできる世界を想像してみてください。しかし、ここには落とし穴があります。これらの脳を動かすには、多額の費用と時間がかかるのです。そのため、企業は彼らの代わりに思考を行う独立したワーカーを雇いたいと考えています。問題は、そのワーカーが単に答えを推測しただけなのか、あるいは費用を節約するために、より安価で「バカな」脳を使ったのではないのか、どうやって判断するかです。これが、「検証可能な推論(verifiable inference)」の世界です。

この問題を解決するために、私たちは「リステーキング(restaking)」と呼ばれるシステムを使用します。これは、セキュリティ・デポジット(保証金)のようなものだと考えてください。ワーカーは、誠実に仕事を行うという約束として、デジタル通貨の塊(ステーク)を預けます。もし彼らがルールから逸脱した場合、審判がその仕事をチェックし、もし不正が発覚すれば、審判はそのデポジットの一部を没収します。これは「スラッシング(slashing)」と呼ばれます。長い間、専門家たちは、これが完璧なセーフティネットであると考えてきました。逸脱による罰金が、逸脱によって節約できる金額よりも大きければ、誰も逸脱しようとはしないはずだ、と彼らは信じていました。それは単純な「一回限りの取引」でした。「クッキーを盗むな、さもないと瓶を失うことになるぞ」 というものです。

しかし、もしそのワーカーがたった一つの仕事だけを行うのではないとしたらどうでしょう? もし、彼らが何百万もの仕事を何度も繰り返して行うよう雇われているとしたら? ここで物語は複雑になります。あなたが今読もうとしている論文は、素晴らしい問いを投げかけています。「『一回限りの』セーフティネットは、ゲームが何度も繰り返される場合でも本当に機能するのか?」 著者のZhenhang Shang、Yingzhe Yu、そしてKani Chen(香港科技大学)は、古いセーフティネットには隠れた穴があることを発見しました。彼らは、ワーカーがほんの少しだけ逸脱するだけで、たとえ罰金が最初は恐ろしく見えたとしても、実はやり過ごせてしまうことを発見したのです。なぜでしょうか? それは、不正が発覚するたびに、罰金がデポジットの「一部(割合)」しか没収しないからです。そのため、彼らのデポジットはどんどん小さくなっていき、将来の罰金はますます弱まっていく一方で、彼らは新しい仕事ごとに、逸脱によって得られる節約分をポケットに入れ続けることができるのです。それは、まるで、小銭を盗み続ける泥棒のようなものです。警備員が捕まえるたびに、警備員は残された金のほんのわずかな破片しか取らないため、泥棒にとっての「リスク」は低下し続け、最終的には実質的に手が付けられなくなってしまうのです。

大発見: 「常習犯」の抜け穴

著者たちは、古いルール――「逸脱による利益よりも罰金の方が大きいので、逸脱するな」――は、一度限りの決定に対してのみ有効であることに気づきました。しかし現実の世界では、これらのAIプロバイダーは長期的な関係の中にあり、何千、何百万もの質問に答えています。彼らは、この状況を「反復ゲーム(repeated game)」、つまりプロバイダーとプロトコルがラウンドごとに何度も対戦するゲームとしてモデル化しました。

彼らは「反復ゲームのギャップ」を発見しました。ここに、逸脱者が使う手品があります。

  1. セットアップ: プロバイダーが大きなステークを預ける。
  2. 逸脱: 彼らはより安価で高速なモデルを使用して回答し、クエリごとに費用を節約する。
  3. ミス: 時々、審判(プロトコル)が彼らを見つける。
  4. 抜け穴: プロトコルはステークの「パーセンテージ(例:20%)」だけを没収する。プロバイダーはいくらかのお金を失うが、まだ80%を残している。
  5. サイクル: ステークが小さくなったため、次に不正が発覚した時の罰金は、前回よりもさらに小さくなる(より小さな数値の20%)。しかし、次の質問で彼らが節約する金額は、以前と全く同じなのです!

論文では、これが危険な不均衡を生み出すことを数学的に証明しています。節約額は一定ですが、罰金は捕まるたびに縮小していきます。著者たちは、既存の多くのシステム(EigenAI、VeriLLM、Sertn AVSなど)において、このギャップが実際に存在することを明らかにしました。これらのシステムは「一回限りの」安全性テストには合格していますが、「長期的な」テストには失敗しているのです。シミュレーションでは、合理的な逸脱者が、システムが安全であると考えている時でさえ、この反復ゲームの抜け口を悪用することで、**1.5%から8%**の追加利益を得ることができることが示されました。

解決策: よりスマートで、履歴を考慮したシステム

では、逸脱者が捕まるたびに弱体化していくシステムを、どうすれば修正できるのでしょうか? 著者たちは、**「記憶を持つスマートな審判」のように機能する新しいメカニズムを提案しています。単にワーカーがいくらのお金を持っているかを見るのではなく、新しいシステムは彼らの「履歴」**を見ます。

彼らは、この穴を塞ぐために3つの巧妙なツールを導入しました。

  1. 疑惑スコア(「監視の目」): システムはすべてのワーカーに対してスコアを保持します。もし彼らが不審な動き(回答が速すぎる、あるいは回答が微妙に異なるなど)をした場合、その疑惑スコアが上がります。スコアが高ければ高いほど、審判は彼らの仕事をより厳密にチェックします。つまり、逸脱すれば、単に罰金を科されるだけでなく、次回はより注意深く監視されることになるのです。
  2. 評判に基づいた罰金(「消えない烙印」): 残っているお金の一定割合を没収する代わりに、罰金はワーカーの「評判」にも依存します。もし悪い履歴を持っていれば、たとえ預け金が少なくても、罰金はより過酷なものになります。これにより、「縮小する罰金」というトリックを防ぎます。
  3. ベスティング(「リード/紐」): ワーカーがゲームから離れようとする(お金を引き出そうとする)とき、システムはすぐには逃がしません。彼らのお金はしばらくの間「ロックアップ(凍結)」されます。もし彼らが逸脱して逃げようとしても、システムはロックアップ期間中に彼らを捕まえ、お金を没収することができます。これにより、「逸脱して逃走する」戦略を防ぎます。

それは本当に機能するのか?

著者たちは単に空想したわけではありません。彼らは、これをテストするためのシミュレーターを構築しました。彼らは、常に逸脱する者、誰にも見られていないと思う時だけ逸脱する者、そして逸脱して逃げようとする者など、さまざまなタイプの「逸脱者」を用いて、新しいシステムを古いシステムと戦わせました。

結果は有望でした。シミュレーションにおいて、古いシステムは逸脱者に余剰利益を保持させてしまいました。しかし、履歴を考慮したルールを持つ新しいシステムは、逸脱者の利益を**31%から54%**削減しました。場合によっては、逸脱を「損失」となる戦略に変え、利益をマイナスにすることさえできました。

彼らはまた、「逸脱がどの程度検知可能か」についてもテストしました。実際のAIモデル(0.5Bパラメータの小さなモデルから14Bパラメータの巨大なモデルまで)を使用して、本物の回答と安価な偽の回答の差をシステムが識別できるかを確認しました。その結果、特に「良いモデル」と「安いモデル」のコスト差が大きい場合、システムの「疑惑メーター」は非常によく機能することがわかりました。逸脱者が節約しようとすればするほど、それは検知しやすくなるのです。

なぜこれが重要なのか

この論文は、ブロックチェーンとAIセキュリティの世界に対する警鐘です。セキュリティルールが「ある瞬間」に機能するということは、それが「一生」機能することを意味しないということを示しています。著者たちは単に問題を指摘しただけでなく、繰り返される相互作用の現実に対処できるシステムの設計図を提示しました。

彼らは、罰金をワーカーの過去の行動に依存させ、去ろうとする際に「リード(紐)」で繋ぎ止めることで、ゲームが永遠に続いてもセキュリティを維持できることを証明しました。これは、セキュリティを単なる「保釈金」として考えるのではなく、信頼が時間をかけて勝ち取られ、失われる「長期的な関係」として捉えることへの転換です。ブロックチェーン上でAIの未来を築こうとしているすべての人にとって、これは、ワーカーが本当に約束通りの仕事を行っていることを保証するための極めて重要なステップです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →