OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
本論文は、LLMエージェントを評価するために、経済的根拠(人間の労働時間とタスク価格)を備えた100個の長期的なオフィススイート・タスクで構成される新しいベンチマークであるOmegaUse-OfficeValを導入し、現在のモデルは人間よりも大幅に安価で高速であるものの、タスク完了における人間レベルの品質の達成には依然として及ばないことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピューターが単にボタンのクリックを待つだけでなく、あなたの代わりに実際に「仕事」をしてくれる世界を想像してみてください。これが「AIエージェント」の夢です。これらは、あなたの指示を読み、ファイルを開き、仕事を完遂できるスマートなプログラムであり、いわば「デジタル・インターン」のような存在です。しばらくの間、これらのエージェントは、メールを一通書いたり、短い記事を要約したりといった、短くて単純なトリックを得意としてきました。しかし、彼らの真の力の試金石は、丸一日のオフィスワーク――例えば、乱雑なレポートを受け取り、フォーマットを整え、チャートを追加し、完璧な状態で保存する――を、混乱したりファイルを壊したりすることなくこなせるかどうかです。研究者たちが投げかけている大きな問いは、「これらのデジタル労働者は本当に仕事をこなせるのか? そして、人間の実務者に雇うのと比較して、それだけの価値があるのか?」という点です。
ここで、Baiduの研究者によって設計された、まさにこのことをテストするための新しい「成績表」、OmegaUse-OfficeValが登場します。彼らは単に作り物の簡単なタスクを用意したわけではありません。壊れたスプレッドシートの修正や、下書きを洗練されたプレゼンテーションへと作り変える作業など、100の現実世界のオフィスにおける課題を用いたベンチマークを構築しました。このテストを特別なものにしているのは、すべてのタスクに「値札」が付いていることです。彼らは人間がそのタスクを完了するのにかかった時間を正確に測定し、誰かに支払うコストを推定しました。そして、世界で最も賢いAIモデルのいくつかに、これらと同じパズルを解かせました。結果はどうだったでしょうか? AIエージェントは驚異的に速く、安価でした。多くの場合、わずか数分、しかも数セントの費用で完了させました。しかし、最終製品を信頼するには、まだミスが多すぎたのです。彼らは向上してはいるものの、まだ信頼できる人間のジュニアワーカーのレベルには達していません。
セットアップ:デジタルの障害物競走
研究者が何を行ったのかを理解するために、オフィスを巨大で乱雑なワークショップだと考えてみてください。かつて、AIのテストはブロックをいくつか積み上げるようにお願いすることに似ていました。もし一つでも落としたら、失敗です。しかし、実際のオフィスワークは、もっと複雑なケーキをゼロから焼くことに似ています。材料(ファイル)を集め、レシピ(指示)に従い、もしフロスティングを焦がしてしまったら、ケーキ全体が台無しになってしまうのです。
研究者たちは、これら100の「ケーキ作り」タスクを含むOmegaUse-OfficeValというデータセットを作成しました。これらは単なる「詩を書いて」といったリクエストではありませんでした。Word文書、PowerPointスライド、Excelス方面レットを扱う、長時間の多段階のジョブでした。いくつかのタスクでは、人間が完了するのに平均2.32時間を要しました。コンピューターにとって、集中力を維持するのは長い時間です!
このベンチマークをユニークにしているのは、その「経済的な裏付け」です。研究者たちは単に「AIはタスクを完了したか?」と聞いたのではありません。「どれだけの価値を生み出したか?」を問いました。これを行うために、彼らはすべてのタスクについて2つの要素を追跡しました。
- 人間の労働時間: 実物の人間がそれを行うのにかかった時間。
- タスク価格のプロキシ(代理指標): フリーランサーを雇った場合にそのタスクにかかる費用の概算(1タスクあたり約3.65ドルから29.22ドルの範囲)。
これにより、彼らはAIをスピードだけでなく、実際にコストを削減しているのか、それとも単に安価なミスをしているだけなのかという観点からも比較することができました。
テスト:AI vs. 人間のインターン
研究者たちは、いくつかのトップクラスのAIモデルを「人間のベースライン」と対決させました。このベースラインはCEOや天才ではなく、熟練したジュニアワーカーやインターンでした。人間にはAIと同じ指示とファイルが与えられ、作業を行うよう求められました。
結果を採点するために、研究者たちは単に人間が最終ファイルを見て「良さそうだ」と言うような方法はとりませんでした。それでは遅すぎますし、主観的すぎます。代わりに、彼らは**コードベースの検証器(verifier)**を作成しました。自動的に最終ファイルをチェックするロボットの検査官を想像してください。それは文書を開き、表紙があるかを確認し、チャートのサイズが正しいか数え、テキストが誤って削除されていないかを確認します。もしファイルが壊れていたり、重要な部分が欠けていたりすれば、ロボットはゼロを突きつけます。これにより、テストは公平で、速く、再現可能なものとなりました。
結果:速くて安いが、完璧ではない
塵が収まったとき、結果は明確な物語を語っていました。
人間のベースライン:
人間のワーカーは、満点の27.79を平均スコアとして記録しました。彼らは信頼できました。ファイルを壊すことは滅多になく、ほとんどの詳細を正しく行いました。しかし、彼らには時間とコストがかかりました。平均して、人間のタスクコストは約6.86ドル、時間は2.32時間でした。
AIエージェント:
AIモデルは全く別の物語でした。彼らは電光石火の速さで、信じられないほど安価でした。
- スピード: 最速のAI(DeepSeek-V4-Pro)は、わずか0.184時間(約11分)でタスクを完了しました。
- コスト: 最も安価なAI(Qwen3.7-Plus)は、1タスクあたりわずか0.2152ドルでした。コーヒー一杯よりも安いです!
しかし、ここに落とし穴がありました。彼らは仕事があまり上手ではありませんでした。
最高のAIモデル(GLM-5.2)のスコアは、わずか17.91でした。これは人間のスコアである27.79よりも大幅に低い数値です。AIはより速く、より安かったものの、より多くのミスを犯していました。目次を入れ忘れたり、フォーマットをめちゃくちゃにしたり、あるいは開くことができないファイルを作成したりすることがよくありました。
研究者たちは、AIが最も苦戦するのは、最も難しく長いタスクであることを見出しました。人間が長時間(2時間以上)作業する必要があるタスクになると、AIのパフォーマンスはさらに低下しました。AIは素早い単純な仕事には適していますが、「長期的な計画(long-horizon planning)」が複雑になると、迷子になってしまうようです。
判定:まだ「本番」には早い(現時点では)
この研究は、私たちがAIによるオフィスワークの「谷間」にいることを示唆しています。この技術は非常に安価で速いため、紛れもなく有用です。ラフなドラフトやクイックな要約が必要な場合、AIは素晴らしいツールです。しかし、クライアントに送るための洗練されたプロフェッショナルな文書が必要な場合、AIはまだそこまで到達していません。
著者たちは、AIがすでにオフィスワークを解決したという考えを明確に否定しました。彼らは、AIが「大幅に安く、かつ速い」一方で、「人間レベルの成果物の品質にはまだ達していない」ことを示しました。最終的な品質に関して、人間のワーカーとAIエージェントの間には依然として大きな隔たりがあります。
しかし、論文は将来に対して楽観的です。現実的な経済データを用いたこの厳格なテストを作成することで、研究者たちはロードマップを構築しました。彼らはAIがどこで失敗しているのか(長いタスク、複雑なフォーマット)を正確に把握しており、今やそれらの特定の問題を修正するために取り組むことができます。現時点での最善の戦略は、「パートナーシップ」のようです。AIに重労働やクイックなドラフトを担当させ、人間が最終製品をチェックしてミスを修正するという役割分担です。「バイブ・ワーキング(vibe working)」――AIが仕事のすべてを丸投げで処理する状態――の夢は、まだ進行中のプロセスですが、その旅は正式に始まったのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。