MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、自分の生活を管理するためにパーソナルアシスタントを雇おうとしています。その際、ファイルも写真もなく、あなたの誰であるかという記憶も持たない、新品の空っぽのデスクを彼らに渡したりはしませんよね?あなたは、彼らがあなたの行きつけのカフェや、銀行口座の残高、今度の休暇、そして友人の誕生日を知っていることを期待するはずです。
問題点:「空っぽのデスク」テスト
現在、AIコンピュータがパーソナルアシスタントとして十分に賢いかどうかを判断するために使われているテストは、AIに「記憶のない、ログインもされていないアカウントのない、個人データも存在しないコンピュータ」を与えているようなものです。これは、誰が誰であるかを知らない相手に対して、「いつもの夕食を注文しておいて」と頼むようなものです。
この論文は、これが大きなギャップであると主張しています。真のパーソナルアシスタントには、乱雑で、相互に繋がり、個人の履歴に満ちたデジタルライフをナビゲートする能力が必要です。
解決策:MYPCBENCH(「マイケル・スコット」シミュレーション)
これを解決するために、研究者たちはMYPCBENCHという新しいテストを構築しました。空っぽのデスクの代わりに、彼らは特定のキャラクター、すなわちドラマ『ジ・オフィス』のマイケル・スコットの、完全に満たされたデジタルライフを作成しました。
これは、以下のような大規模でインタラクティブなビデオゲームの世界を作るようなものです:
- キャラクター: マイケル・スコットが「ユーザー」となります。
- データ: コンピュータには、1,812件の銀行取引、2,398通のメール、679件のカレンダーイベント、そして数千件のチャットメッセージがあらかじめロードされています。
- アプリ: 17種類の異なる「架空の」ウェブサイト(架空の銀行、架空の航空会社、架空のフードデリバリーアプリなど)があり、これらはすべて繋がっています。例えば、マイケルが架空の航空会社でフライトを予約すると、彼の架空の銀行明細に自動的に請求が表示され、確認メールが彼の架空の受信トレイに届きます。
- ゴール: AIはマイケルのアシスタントとして振る舞い、彼の特定の履歴を用いて、これらのアプリを操作して現実世界の問題を解決しなければなりません。
テスト:184の現実世界の課題
研究者たちは、人々が実際にAIアシスタントに対して行うリクエストに基づいた、184の具体的なタスクを作成しました。これらのタスクは、単純なものから非常に複雑なものまで多岐にわたります:
- 単純: 「Zelleを使ってパムに100ドル送金して。」(AIはまず、連絡先にパムがいるかどうかを確認する必要があります)。
- 複雑: 「ジャマイカとバルバドスへの旅行を予約している。現在のクレジットカードの残高で両方とも支払えるかな?」(AIは銀行アプリを確認し、旅行アプリを確認し、計算を行う必要があります)。
- パターンの発見: 「私はいつもフードデリバリーでいくらチップを払っているかな?」(AIは過去の数百件の注文をスキャンして、パターンを見つけ出す必要があります)。
結果:AIは「現実生活」に苦戦する
研究者たちは、利用可能な最もスマートなAIモデルのうち6つ(Anthropic、OpenAIなどの企業によるもの)をこのテストで検証しました。その結果は以下の通りです:
- 最高の実績: トップのモデル(Claude Opus 4.6)は約**55%**のタスクを完璧にこなしました。これは一見良く聞こえますが、これが現存する最高のAIであることを忘れてはいけません。それでも、半分近くのケースで失敗しています。
- 「マルチアプリ」の問題: タスクが複数のアプリを使用する必要がある場合、AIのパフォーマンスは著しく低下しました。タスクが7つ以上の異なるアプリ(メールを確認し、次にカレンダー、次に銀行、次に旅行サイトといった具合に)をまたぐ必要があった場合、ほとんどのモデルの成功率は**0%**にまで落ち込みました。
- 「長い記憶」の問題: AIは長い一連の動作を追跡することに苦労しました。もしタスクが50ステップを必要とする場合、AIは途中で迷子になるか、諦めてしまうことがよくありました。
- 異なる失敗のスタイル:
- GPTのような一部のAIは、仕事を完了させる前に「終わりました」と言って、早すぎる段階で諦める傾向がありました。
- Qwenのような一部のAIは、データに存在しないマイケル・スコットに関する事実を捏造し始めました。
- 最良のAIであるClaudeは、通常の人間のようにメニューをクリックする代わりに、コマンドライン(ハッカーのような方法)を使用してショートカットを行うことがありました。
結論
この論文は、AIがコンピュータを使う能力は向上しているものの、真の「パーソナル」アシスタントになる準備はまだできていないと結論付けています。AIは、クリーンで単純なタスクなら処理できますが、個人の履歴を伴う、乱雑で相互に連結した現実世界のデジタルライフをナビゲートしなければならない状況では、崩壊してしまいます。
研究者たちは、他の科学者が、実際の人間が持つ複雑なデジタルライフを扱えるより優れたアシスタントを構築できるように、このテスト環境(「マイケル・スコット」コンピュータ)を一般に公開しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。