← 最新の論文
💻 computer science

MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models

本論文は、GUIグラウンディングモデルの数字シリアル化された座標生成プロセスを、位取りへの感度を利用して悪用することで、既存の手法と比較して非標的型および標的型の成功率を大幅に向上させるホワイトボックス型敵対的攻撃であるMissClickを導入するものである。

原著者: Yu Ran, Wentao Zhao, Xin Zhang, Yi Pan

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Yu Ran, Wentao Zhao, Xin Zhang, Yi Pan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューターの画面が単なる画像ではなく、タップされるのを待っているコマンドの地図である世界を想像してみてください。このデジタル風景の中で、新しい種類の「スマートアシスタント」、すなわちGUIエージェントが登場しました。これらのエージェントを、非常に有能だが、少し融通の利かないツアーガイドだと考えてください。「赤いボタンをクリックして靴を買ってください」と伝えると、彼らは画面を見て、そのボタンが正確にどこにあるかを判断し、それをタップします。これを行うために、彼らは単に指をさすだけでなく、「数字の秘密のコード」で話します。彼らは「814, 515」のような数字の列を生成し、コンピューターがそれを画面上の正確な位置へと翻訳します。このプロセスは「ビジュアルグラウンディング(視覚的接地)」と呼ばれ、ロボットやAIが人間の手を介さずにアプリ、ウェブサイト、スマートフォンを操作することを可能にする魔法です。しかし、どんな地図でもそうであるように、ガイドに数字の読み方を誤らせることができれば、彼らを全く別の目的地へと送り込むことができます。

これは、MissClickと呼ばれる新しい発見の物語です。この背後にいる研究者たちは、これらのAIエージェントが座標を書き出す方法が、算数の授業における「位取り」のゲームに似ていることに気づきました。AIが「814」という数字を書くとき、「8」は単なる「8」ではありません。それは百の位にあるため、「800」を表す「8」なのです。「1」は単なる10であり、「4」は単なる4です。チームは、もしAIにその「8」を「9」に変えさせるよう仕向けることができれば、クリックはわずかに移動するだけでなく、画面を横に100ピクセルも跳び越えてしまうことを発見しました。この数学的な癖を利用することで、彼らは、AIに「数量」フィールドではなく「チェックアウト」ボタンをクリックさせたり、あるいは画面の空白地帯へと迷い込ませたりするための「ハッカー」ツールを作り上げました。彼らはデスクトップ、ウェブ、モバイルの画面上で2つの異なるAIモデルに対してこれをテストし、数字の背後にある数学を理解することで、かつてないほど効果的にシステムを破壊できることを明らかにしました。

画面の秘密のコード

MissClickがどのように機能するかを理解するために、まずこれらのAIエージェントがどのように画面を「見ている」のかを見る必要があります。あなたが「アイテムの数量を5に調整して」という指示を与えたとき、AIは単に場所を推測するわけではありません。それはタイプライターのように振る舞い、文字のシーケンスを一つずつ吐き出します:(, 8, 1, 4, ,, 5, 1, 5, ). つまり、数字の「814」と「515」をテキスト文字列として生成しているのです。生成が終わると、コンピューターはその文字列を受け取り、それを実際の座標へと変換し、マウスをその正確なピクセルへとジャンプさせます。

研究者たちは、このプロセスについて非常に興味深いことに気づきました。AIは各数字を個別の文字として扱いますが、コンピューターはそれらを数学的な値として扱います。もしAIが座標の最初の数字を間違えると、結果は劇的な変化をもたらします。例えば、AIが814をクリックすべきところを、騙されて914をクリックしてしまった場合、クリックは右に100ピクセル移動します。もし最後の数字を間違えて、814815に変えてしまった場合、移動はわずか1ピクセルです。これは、数百の位の数字をいじることは「巨石を動かす」ようなものであり、一の位の数字をいじることは「小石を突く」ようなものであることを意味しています。

MissClickの二つの顔

Yu Ran氏と、国防科技大学のチームを中心とする研究者たちは、MissClickと呼ばれる攻撃ツールを構築しました。彼らは、このシステムをハッキングするためには、数字を単なるテキストとして扱うのではなく、数学を尊重しなければならないことに気づきました。彼らは、ハッカーが何を達成したいかに応じて、2つの異なる戦略、すなわち「モード」を設計しました。

モード1:「ミス(Miss)」(非標的型攻撃)
AIを崖から転落させたいと考えている場面を想像してください。AIがどこに着地するかはどうでもよく、ただ本来あるべき場所ではない場所にさえ着地すればよいのです。これは「非標的型(untargeted)」攻撃と呼ばれます。MissClick-U(「U」はUntargetedの略)は、「ソフト」なバージョンの座標を計算することで機能します。AIが単一の数字を選ぶのを待つのではなく、あらゆる可能な数字の「確率」を調べます。「もしAIが8の代わりに9を選んだら? もし7を選んだら?」と問いかけるのです。そして、それらの重み付き平均を計算し、数字の間を漂う「ゴースト座標」を作り出します。目標は、このゴースト座標を正しい場所からできるだけ遠ざけることです。この距離を最大化することで、AIは本来の場所から大きく外れた場所へとクリックを飛ばしてしまう数字を選ばされることになります。

モード2:「ハイジャック(Hijack)」(標的型攻撃)
次に、AIを「保存」ボタンではなく、「アカウント削除」のような特定の危険なボタンをクリックするように騙したい場面を想像してください。これは「標的型(targeted)」攻撃です。ここでのMissClick-T(「T」はTargetedの略)は、異なるゲームを展開します。単にクリックを移動させるだけでなく、特定のゾーンに着地させることを目的としています。研究者たちは、単に「平均」の数字をターゲットに合わせようとするだけでは不十分であることを発見しました。AIは平均が5だと「考えて」いても、実際には最も可能性の高い選択肢である1や9を選んでしまうことがあるからです。そのため、MissClick-Tは「位取り」に焦点を当てます。高価値の桁(百の位や十の位)に対して追加の圧力をかけます。つまり、「百の位の『8』を正しく維持しなければならない。なぜなら、それがクリックを最も大きく動かすからだ」とAIに指示するのです。各桁の数学的な影響力に基づいて重要度に重み付けを行うことで、攻撃者のターゲットに確実に着地するために必要な正確な数字をAIに選択させるのです。

結果:成功率の大幅な向上

チームは、デスクトップコンピュータ、ウェブブラウザ、および携帯電話の3つの異なる環境において、2つの人気のあるAIモデル、OS-AtlasUGroundに対してMissClickをテストしました。彼らは、座標を単なるテキストとして扱い、数学を無視していた古いハッキング手法と比較しました。

結果は驚くべきものでした。

  • 「ミス(Miss)」攻撃において: MissClick-Uは、OS-Atlasで75.07%、UGroundで**72.93%**の確率で、AIに誤った場所をクリックさせることに成功しました。従来のメソッドでは、それぞれ約58%と42%しか成功していませんでした。これは、いくつかのケースで成功率を30パーセントポイント以上向上させた、極めて大きな飛躍です。
  • 「ハイジャック(Hijack)」攻撃において: MissClick-Tはさらに印象的でした。OS-Atlasでは44.86%、UGroundでは驚異の**62.67%**の確率で、クリックを攻撃者が選んだターゲットへとリダイレクトすることに成功しました。従来のメソッドは苦戦しており、成功率はわずか13%から15%程度でした。

研究者たちはまた、2つの目標には異なるツールが必要であることも発見しました。「ミス」の戦略を「ハイジャック」のために使おうとしても上手くいかず、その逆も同様でした。これは、攻撃の具体的な目的を理解することが、数字の背後にある数学を理解することと同じくらい重要であることを裏付けています。

なぜこれが重要なのか

この論文は、単にAIが騙され得ることを示しているだけではありません。AIの言語に隠された構造を理解することで、より効果的に騙す方法を示しています。著者らは、AIが座標を数字のシーケンスとして生成するため、それらの数字の「位取り」が脆弱性を生み出していると指摘しています。高価値の数字に対する小さな変化が、最終的なアクションに劇的な変化をもたらすのです。

しかし、研究者たちは自身の研究の限界についても慎重に述べています。彼らは、座標を数字ごとのテキストとして書き出すモデルのみをテストしました。異なる方法で対象を指し示すモデルについてはテストしていません。また、彼らはAIの「脳」に完全なアクセス権を持っている(「ホワイトボックス」シナリオ)と想定しており、これは内部が見えないシステムをハッキングするよりも容易な状況です。しかし、コアとなる考え方――私たちがAIに数字を話させる方法がセキュリティに影響を与えるということ――は、確かな発見であるようです。

結局のところ、MissClickは、デジタル世界において、数字は単なる数字ではないということを思い出させてくれます。数字は座標であり、コマンドであり、そして時には罠でもあるのです。数学の背後にある魔法を理解することで、研究者たちは、これらのスマートなエージェントを躓かせたり、あるいは私たちが望む場所へと正確に誘導したりできることを示したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →