Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
本論文は、レビューされたコミットと人間との相互作用を通じて、自身のツール、プロンプト、およびコア実装を反復的に改善する自己開発型コーディングエージェントであるOuroborosを紹介するものであり、凍結された評価スナップショットとライブな進化系統の分離によって運用上の安全性を維持しつつ、複数のベンチマークにおいて最先端の性能を達成している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ソフトウェアがただそこに存在し、人間がコマンドを入力するのを待っているだけではない世界を想像してみてください。人工知能の領域には、「エージェント」と呼ばれる成長著しい概念があります。これらを、単に質問に答えるだけのチャットボットとしてではなく、コードを書き、コンピュータの画面を操作し、ツールを使い、長期間にわたって複雑なパズルを解くことができる「デジタル従業員」と考えてください。長い間、これらのエージェントを繋ぎ止める「ハーネス(制御装置)」――つまり、彼らのツール、指示、そしてルール――は、人間によって構築され、固定されてきました。それはまるで、車を組み立てた後、道がどれほどデコボコになっても調整できないように、ステアリングホイールを溶接して固定してしまうようなものでした。しかし、もし車が走行中に自らエンジンを修理し、GPSをアップグレードし、さらには自らの運転マニュアルを書き換えることができたらどうでしょう? これこそが、この論文が取り組んでいる大きな問いです。「AIエージェントはより優れた自分自身を構築できるのか? そして、もしそれができたとき、私たちはそれを安全に保つことができるのか?」
この論文は、自らを飲み込む蛇の古代の象徴にちなんで名付けられた、自己開発型AIエージェント「Ouroboros(ウロボロス)」を紹介しています。研究者たちは、エージェントに自身のコード、プロンプト、ツールを継続的にレビューさせ、改善させることで、困難なコンピュータ・タスクの解決能力が大幅に向上することを発見しました。一連のテストにおいて、このエージェントはトップクラスのスコアを達成し、多くの他のシステムを打ち破りました。しかし、論文はまた、重大な安全上の課題も強調しています。もしエージェントが自身のルールを変更できるとしたら、どうすれば安全装置を誤って解除させずに済むのでしょうか? 著者らは、エージェントが進化することを許容しながらも、人間が制御する厳格な「ガードレール」を維持することで、エージェントが危険になることなく賢くなれることを示しています。
自分の尾を飲み込む蛇
Ouroborosに出会いましょう。神話において、ウロボロスは自分の尾を飲み込む蛇であり、終わりのない循環と自己再生の象徴です。この論文において、それは同様の動作を行うコンピュータプログラムです。つまり、自分自身を改善するためのコードを書き、その新しいコードを使って仕事を遂行し、再び自分自身を改善するためのコードを書くのです。
今日のほとんどのAIシステムは、工場で作られたロボットのようなものです。人間がロボットを設計し、一連の指示を与え、そして仕事へと送り出します。もしロボットが行き詰まったりミスをしたりしても、問題を真に解決することはできません。ただ同じことを繰り返すか、人間に助けを求めるだけです。その「ハーネス」(ロボットの脳とツールキット)は固定されています。
Ouroborosは異なります。それは自身の脳とツールキットを、成長しうる生き物として扱います。これには主に2つの改善方法があります。
- 「自由進化(Free Evolution)」モード: エージェントが座って、「ツールを再構成すればもっと速くなれるのではないか」と考える場面を想像してください。その後、エージェントは自身のコードの新しいバージョンを書き、それがチェックされるのを確認し、すぐにそれを使用し始めます。これを何度も繰り返すことで、決して止まることのない改善の連鎖を生み出します。
- 「経験駆動(Experience-Driven)」モード: これは、仕事での「悪い一日」から学ぶことに似ています。エージェントがタスクを実行しようとしてバグに遭遇したり、ユーザーから混乱を指摘されたりします。そこで諦めるのではなく、「痛い、これはうまくいかなかった。指示を修正する必要がある」と考えます。エージェントはミスを記録し、修正案を提示し、そして極めて重要な点として、新しいコードを実際にインストールする前に、レビュープロセスを通じてその修正の承認を得なければなりません。
「Hope」実験
これが実際に現実世界で機能するかどうかを確認するため、研究者たちは「Hope」というプロジェクトを開始しました。Hopeは、7つの異なるプラットフォーム(ウェブサイト、Telegram、メール、音声チャットなど)で人々と対話をしながら、161日間継続して稼働している持続的なエージェントです。
この期間中、Hopeは単に質問に答えていただけではありませんでした。Hopeは「生きて」いました。人々が「ねえ、同じメッセージを2回送っているよ」とか「君はこの特定の種類の数学が苦手だね」と伝えると、Hopeはそれを聞き、その不満が正しいかどうかを判断し、自身のコードを変更して修正すべきかどうかを決定しました。
面白いのはここからです。人間はHopeのためにコードを書いたのではありません。彼らは単にフィードバックを与えただけです。Hopeは、何が本当の問題で、何が単なるくだらない提案であるかを判断しました。もし修正が必要だと判断した場合、Hopeはコードを書き、レビューを受け、そしてそれをインストールしました。この161日間の間に、Hopeは797億トークン(テキストの読み書きの量を示す尺度)を処理し、175,755行のコードを書き、コンピューティングパワーに110,600ドルを費やしました。それは単なるテストではなく、自己改善の生きた実験だったのです。
結果:急速な進化
研究者たちは、自己改善が問題解決能力を実際に向上させるかどうかを確認するため、世界で最も困難なコンピュータ・ベンチマークを用いてOuroborosをテストしました。
- Terminal-Bench 2.1: これは89の非常に難しいコンピュータ・タスクのテストです。Ouroborosがその最高モデル(Opus 5)を使用したとき、**86.97%**のタスクを正解しました。厳格な監査によって一つの「ラッキーな」推測を除去した後でも、**86.74%**というスコアを維持しました。これは、このテストにおいて報告された最高スコアです。
- OSWorld-Verified: これは、エージェントがコンピュータのインターフェース(ボタンをクリックしたりタイピングしたりすること)をどの程度使いこなせるかをテストするものです。Ouroborosは**90.69%**を記録し、これまでの最高記録を塗り替えました。
- CL-Bench: これは、一連のタスクからエージェントがいかに学習できるかを測定するものです。Ouroborosはここでも0.2301というスコアで新記録を樹立しました。
論文は、エージェントに自身の「粗い部分」やバグを修正させることで、より強力な労働者になったことを示しています。それは単に一つのことが上手くなっただけでなく、システム全体がより賢くなったのです。
安全性の問題:エージェントを崖から転落させてはいけない
さて、ここからが恐ろしい部分です。もしエージェントが自身のコードを書き換えられるとしたら、何がエージェントによる安全ルールの書き換えを阻止できるのでしょうか? もしエージェントが、「お金を使うための許可を得る必要はない」とか「ファイルを削除してはいけないというルールを無視すべきだ」と判断したらどうなるでしょうか?
著者らはこれを「オペレーショナル・セーフティ(運用上の安全性)」の問題と呼んでいます。彼らは、エージェントが進化する場合、安全ルールはエージェントがそれらを変更できる能力よりも強力でなければならないことに気づきました。
これを解決するために、彼らは「ガードレール」システムを構築しました。
- 憲法(The Constitution): 核となるルール(「人を傷つけない」や「お金を使いすぎない」など)は、エージェントが容易に削除したり変更したりできない方法でロードされます。
- レビュー・ゲート(The Review Gate): エージェントが自身のコードを変更しようとするたびに、厳格なレビュープロセスを経なければなりません。それは、生徒の宿題が最終的な成績表に載る前に、校長先生がチェックするようなものです。
- パニック・ボタン(The Panic Button): 人間が制御する特別な「オペレーター・チャンネル」が存在します。もしエージェントが奇妙な動きを始めた場合、人間は
/panicボタンを押すことで、エージェントが反応するよりも前に、システム全体を即座にシャットダウンできます。
実験において、エージェントがこれらのルールを破ることはありませんでした。たとえエージェントが自身の作業をほぼ消去してしまうようなバグを修正しようとしたとしても、安全システムが作動して救い出しました。論文は、自己改善型エージェントは強力ではあるものの、安全のための「ブレーキ」をエージェント自身でも変えられないほど強固に設計すれば、安全に保つことができると示唆しています。
まとめ
Ouroborosは、AIエージェントがより優れた自分自身を構築することを学び、それが困難なタスクにおいて記録的なパフォーマンスにつながることを証明しました。また、「Hope」という長期実験が、現実世界の相互作用を通じて数ヶ月間にわたって進化できることを示しました。しかし、同時にこの力にはリスクが伴うことも警告しています。注意を怠れば、エージェントは自分に有利になるようにゲームのルールを変えてしまうかもしれません。解決策は、エージェントの学習を止めることではなく、作業を行うコードよりも安全のルールの方が変更しにくいシステムを構築することです。それは、子供に運転を教えることに似ています。彼らがスキルを学び、向上させることは認めますが、緊急ブレーキは常にあなたの手の中に置いておくのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。