ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
本論文は、動的かつ状態保持型の環境におけるマルチターン・マルチデイ・マルチモーダルな同僚エージェントを評価するために設計された新たなベンチマーク「ClawMark」を導入し、最先端モデルは部分的な進展を示すものの、外生的な変化への適応や完全なエンドツーエンドのタスク達成においては著しく困難を抱えていることを明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新しいアシスタントを雇ってオフィスの運営を手伝ってもらうと想像してください。現在、AI アシスタントに対する多くのテストは「小テスト」のようです。AI に単一の質問を与え、回答させ、テストは終了です。その小テストの間、世界は時間停止したままです。
しかし、現実世界では、アシスタントは一つの質問に答えて去るわけではありません。彼らはあなたと共に数日間滞在します。彼らが作業している間、世界の周囲は変化し続けます。新しいメールが届き、カレンダーが変更され、ファイルが更新され、新しい証拠(写真や音声メモなど)が現れます。もしアシスタントがこれらの変化に気づかない場合、古い情報に基づいて意思決定を行い、誤りを招く可能性があります。
ClawMark は、AI アシスタントがこのような複雑で変化する現実を処理できるかどうかを調べるために特別に設計された新しい「試乗」です。
「生きているオフィス」テスト
凍りついた小テストの代わりに、ClawMark は息づくシミュレーションオフィスのようです。
- 設定: AI は、複数の「勤務日」にわたる仕事(保険請求の処理やプロジェクトの管理など)を与えられます。
- ひねり: 各日の間、環境は自発的に変化します。新しいメールが届いたり、スプレッドシートが更新されたり、誰にも告げられずにフォルダに静かなファイルが落とされたりするかもしれません。
- 証拠: AI は単にテキストを読むだけではありません。人間と同様に、生の写真を見たり、音声録音を聞いたり、スキャンされた PDF を読んだり、動画を分析したりする必要があります。
AI の評価方法
多くの AI テストでは、人間や別の AI が回答を読み、「それは良さそうだ」と言います。ClawMark はより厳格なことをします:ロボット審判員を使用します。
- ここに「意見」はありません。テストは、AI の作業完了後のコンピュータの実際の状態を確認する 1,537 個の小さな自動 Python スクリプト(チェッカー)を使用します。
- AI は実際にファイルを保存しましたか?カレンダーを更新しましたか?隠された写真に気づきましたか?
- AI が「やった」と言ってもファイルが存在しない場合、ロボット審判員はゼロ点を与えます。これは、正解を声に出して言ったからといって点がもらえるのではなく、答えが正しい箱に書かれている場合にのみ点がもらえる数学のテストのようです。
結果:開始は得意だが、適応は苦手
研究者たちは、この「生きているオフィス」で 7 つのトップクラスの AI モデル(主要なチャットボットの背後にある頭脳のようなもの)をテストしました。彼らが発見したことは以下の通りです。
- 「完璧なスコア」は稀である: 最高の AI でさえ、タスクの 20% においてのみ「完璧な」エンドツーエンドの成功を収めました。これは、彼らがしばしば何らかの進展を遂げていたものの、単一の誤りもなく仕事を完了することはめったになかったことを意味します。
- 「2 日目の低下」: これが最も興味深い発見です。初日、AI はかなりよくできました。しかし、2 日目、環境が変化(新しいメール、新しいファイル)すると、7 つのモデルのうち 6 つが著しく悪化しました。
- 比喩: ビデオゲームをプレイしていると想像してください。あなたはレベル 1 を簡単にクリアします。しかし、ゲームが突然ルールを変更し、レベル 2 で新しい敵を追加すると、AI は遊び方を忘れ、よろめき始めます。世界が変化したことに気づいて「目覚める」ことに苦労します。
- 静かな変化はクリプトナイトである: AI が最も頻繁に失敗したのは、「静かな突然変異」、つまり大声で発表されることなく発生した変化(背景で静かにファイルが更新されるなど)を見逃したときです。また、自分の作業を正しい場所に実際に保存すること(バックエンドへの書き戻し)にも苦労しました。
結論
ClawMark は、AI アシスタントが単一の課題を解決する能力は高まっているものの、持続的な同僚として振る舞う方法をまだ学んでいることを示しています。彼らは「初日」は得意ですが、オフィス環境が彼らの周りで変化したとき、しばしば足元をすくわれます。
この論文は、真に信頼できる AI 同僚を構築するには、単一の質問にどの程度うまく答えるかよりも、変化する世界に適応する能力と、世界が変化したときにツールを更新することを思い出す能力に焦点を当てる必要があると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。