← 最新の論文
💻 computer science

cotomi Act: Learning to Automate Work by Watching You

本論文は、能動的な観察とベスト・オブ・N 選択を通じて最先端の自律タスク実行を達成しつつ、受動的な観察とユーザー行動の編集可能なアーティファクトへの抽象化によって永続的な組織知識を同時に学習する、ブラウザベースのエージェントである cotomi Act を紹介する。

原著者: Masafumi Oyamada, Kunihiro Takeoka, Kosuke Akimoto, Ryoma Obara, Masafumi Enomoto, Haochen Zhang, Daichi Haraguchi, Takuya Tamura

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Masafumi Oyamada, Kunihiro Takeoka, Kosuke Akimoto, Ryoma Obara, Masafumi Enomoto, Haochen Zhang, Daichi Haraguchi, Takuya Tamura

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが「cotomi Act」という、新しく非常に賢いインターンを持っていると想像してみてください。指示のリストを与えられ、仕事が終わるとすぐにすべてを忘れてしまう他のインターンとは異なり、cotomi Act にはあるスーパーパワーがあります:それはあなたを見て学ぶことです。

この論文がそのスーパーパワーを説明する仕組みを、簡単な概念に分解して以下に示します。

1. 問題点:「記憶喪失」のインターン

あなたのためにウェブ上のタスクを実行しようとするほとんどのコンピュータプログラムは、その忘れっぽいインターンのようなものです。これらは単一の明確な指示(例:「この靴の価格を検索する」)に従うのは非常に得意ですが、あなたの会社の秘密は知りません。彼らは以下を知りません。

  • 通常、これらのリクエストを承認するのは誰か?
  • あなたのチームが使用する特定の専門用語は何か?
  • どのタスクがすでに半分完了しているか?

この「内部知識」が欠如しているため、彼らは質問しすぎて(あなたの作業を遅らせたり)、誤って推測したり(ミスを引き起こしたり)します。

2. 解決策:2 つのスーパーパワー

著者らは、この問題を解決するために cotomi Act に 2 つの異なる「筋肉」を備えさせました。

筋肉 A:「スーパーランナー」(実行)

このシステムの部分は、混乱することなく実際にウェブ上で作業を行うように設計されています。

  • 比喩: マラソンを走っていると想像してください。スタートラインから取ったすべてのステップを思い出そうとすれば、脳は爆発してしまいます。必要なのは、景色の変化だけを覚えることです(例:「さっき給水所を通過した」など)。
  • 仕組み: AI にこれまでにクリックされたすべての膨大で退屈な履歴を渡すのではなく、cotomi Act は「怠惰」な戦略を使用します。それは現在の画面に表示されているものだけを注意深く見て、前回のステップからの変化を要約します。これにより、AI の脳は軽快で高速に保たれます。
  • 結果: 現実世界のウェブタスクをビデオゲームのように再現した「WebArena」という厳しいテストにおいて、この「スーパーランナー」はタスクの80.4%を正しく実行しました。これは実際には平均的な人間(同じテストで 78.2% の正解率)よりも優れています

筋肉 B:「影の書記」(学習)

これは、あなたが作業しているのを背景で観察する部分です。

  • 比喩: あなたがウェブを閲覧しているのを、静かに後ろで座って見ている書記を想像してください。単にあなたの画面の生々しい動画を記録する(これは散らかっていて巨大なものになります)のではなく、書記はメモを取り、それらを有用なツールに変換します。
    • タスクボード: 現在取り組んでいるタスクのリスト。
    • ウィキ: チームが物事を行う方法のルールブック(例:「印刷は常にベンダー X を使用する」など)。
    • タイムライン: 最近の活動のカレンダー。
  • ひねり: これは秘密の日記ではありません。共有ワークスペースです。書記が書いたものを見て、間違っていれば修正したり、メモを追加したりできます。AI はこれらのメモを読んで、あなたの世界を理解します。

3. 連携の仕組み

この論文では、「観察 → 抽出 → 実行」というサイクルが説明されています。

  1. 観察: あなたが通常通りウェブを閲覧します。「影の書記」がそれを見守ります。
  2. 抽出: システムはあなたの散らかった閲覧行動を、整理されたきれいなメモ(例:「ハードウェアの注文方法」ガイドなど)に変換します。
  3. 実行: 後で、AI に「ハードウェアを注文する」と頼んだとき、それは推測しません。あなたから学んだ「注文方法」のメモを見て、その手順に従い、完了させます。

4. 証明

研究者らは、実際の作業をシミュレートした「プロキシ」実験でこれをテストしました。

  • 発見: AI があなたの行動に関するメモを持っていない場合、頻繁に失敗しました。
  • 改善: AI があなたの作業方法に関するメモ(行動知識)を蓄積するにつれて、その成功率は大幅に向上しました。
  • 限界: 興味深いことに、AI が単にあなたの画面の生々しく散らかった動画ログを記憶しようとした場合、最初は実際にはパフォーマンスが低下しました。情報を要約して整理する「影の書記」が必要だったのです。

5. ライブデモ

この論文では、人々が実際に試せるライブデモについて言及しています。彼らは以下ができます。

  • AI にタスクを依頼する(例:カンファレンスの締切を見つけるなど)。
  • 「共有ワークスペース」を見て、AI があなたの習慣について何を学んだかを確認する。
  • ボード上のタスクを編集し、AI がその新しい情報を即座に利用して、正しい作業に取り掛かる様子を見る。

まとめ

cotomi Actは、単に指示に従うだけでなく、あなたが作業する様子を見て、あなたの習慣を共有されたルールブックに変換し、そのルールブックを使ってより良く、より信頼性の高い同僚となるブラウザアシスタントです。これは、高速で賢明な実行日々の行動からの学習を組み合わせることで、AI が複雑なウェブタスクにおいて実際に人間を上回るパフォーマンスを発揮し得ることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →