← 最新の論文
💻 computer science

Praxist: From Experimental Artifacts to Solution Lineages

Praxistは、自律的なR&Dを孤立した実験から追跡可能なエビデンスグラフへと変革する系統中心の世代型システムであり、エージェントが検証済みのメカニズムを継承し、既存のベースラインの約12分の1のコストで複雑なエンジニアリング・タスクにおいて優れた性能を達成することを可能にします。

原著者: Jin Li, Ahmed Murtadha, Zhiyu Wang, Qiwen Chen, William Chen, Yifei Wu, Guan Wang, Andy L. Siy, Jiayi Yang, Mengsha Huang, Wenhao Li, Yixuan Liu, Shuailin Pan, Mingli Yuan, Sen Song, Yuhao Sun

公開日 2026-08-27✓ Author reviewed
📖 1 分で読めます☕ さくっと読める

原著者: Jin Li, Ahmed Murtadha, Zhiyu Wang, Qiwen Chen, William Chen, Yifei Wu, Guan Wang, Andy L. Siy, Jiayi Yang, Mengsha Huang, Wenhao Li, Yixuan Liu, Shuailin Pan, Mingli Yuan, Sen Song, Yuhao Sun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

科学と工学は、古くからシンプルで人間的なリズムに依存してきました。それは、「何かを試し、それがうまくいくかを確認し、失敗から学び、再び試す」というリズムです。数十年にわたり、このサイクルは発見の原動力となってきました。研究者がプロトタイプを構築し、それをテストし、その結果を用いて次のバージョンを洗練させていくプロセスです。しかし、コンピュータが自らコードを書き、自ら実験を実行できるほど強力になった今、新たな問いが生まれています。機械は、人間と同じように自分自身の失敗から学ぶことができるのでしょうか? 課題は、単に機械が結果を得るということではなく、なぜその結果に至ったのかを機械が「理解」できるかという点にあります。コンピュータが設計のバリエーションを数千通り試行する場合、多くの場合、何が起きたのかを伝える膨大なデータは生成されますが、どの特定の変更が違いを生んだのかまでは教えてくれません。その明晰さがなければ、機械は同じ教訓を何度も学び直し、行き止まりの道に時間とエネルギーを浪費することになります。

これが、サピエント・インテリジェンス(Sapient Intelligence)の研究チームが解決しようとした問題です。彼らは、単に解決策を見つけるだけでなく、それらの解決策がいかにして発見されたかという、明確で監査可能な履歴を構築するように設計されたシステム「PRAXIST」を構築しました。PRAXISTは、あらゆる試行を「新たなスタート」として扱うのではなく、研究を「継続的な対話」として扱います。このシステムは、一つの実験の結果を取り込み、それを具体的な教訓(何が機能し、何が失敗し、何が単なる幸運な推測であったか)へと分解し、それらの教訓を永続的な記録として保存します。システムが次のラウンドの実験を開始するとき、過去の最高スコアだけを見るのではありません。そのスコアを獲得した具体的なメカニズムに着目するのです。「この設計の一部が実際に改善をもたらしたのか、それとも他の要因によるものなのか?」と問いかけます。この問いに答えることで、システムは過去の有用な部分のみを引き継ぐことができ、以前よりもはるかに少ない労力で、より強力で信頼性の高いソリューションを構築できるのです。

研究者たちは、医療画像における疾患の特定から株式市場のトレンド予測まで、75種類もの異なる機械学習エンジニアリングの課題を用いて、このアプローチをテストしました。彼らは、最先端の言語モデルの一つを実行している強力な標準的AIコーディングアシスタントと比較しました。結果は驚くべきものでした。標準的なアシスタントは約73%のタスクでメダルを獲得しましたが、そのために約3万8千ドルの計算コストを費やしました。一方、異なる基礎モデルとよりスマートな作業整理方法を用いたPRAXISTシステムは、80%のタスクでメダルを獲得しながら、わずか約3千ドルしか費用しませんでした。言い換えれば、新システムは、約12分の1のコストで、より優れた解決策を見つけ出したのです。

しかし、真の革新は節約術にあるのではなく、その手法にあります。研究者たちは、ほとんどの自動化システムが、履歴を単なるスコアのリストとして扱い、最高値のみを残して残りを破棄していることを指摘しました。しかし、PRAXISTは、履歴を「家系図」のように扱います。システムが新しいソフトウェアや新しい制御メカニズムを構築するたびに、成功または失敗につながった具体的な設計上の選択を記録します。もし特定のロケット着陸アルゴリズムの変更によって機体が墜落した場合、その失敗は単なる行き止まりとしてではなく、将来の試行において何を避けるべきかを教える貴重な教訓として記録されます。もし特定の取引戦略の微調整が利益を向上させたならば、その成功にはそれが機能した正確な理由がタグ付けされ、システムは異なる文脈でも同じ微調整を使用すべきであることを理解します。このプロセスにより、システムは「型付けされた証拠(typed evidence)」を継承することが可能になります。つまり、解決策のどの部分が機能すると証明されており、どの部分がまだ単なる推測に過ぎないのかを、システムが正確に把握できるのです。

この仕組みが現実世界でどのように機能するかを確認するため、チームは答えが一つではない4つの複雑でオープンエンドなエンジニアリング問題にPRAXISTを適用しました。一つのケースでは、再利用可能なロケットを垂直着陸させるためのコントローラーの設計を求めました。出発点は、成功率がわずか4%であるコントローラーでした。標準的な自動最適化システムは数百のバリエーションを試み、成功率を17%まで向上させることはできましたが、ロケットを常に安全に着陸させることはできませんでした。しかし、PRAXらしくは異なる道を歩みました。単にランダムな変更を試みるのではなく、改善の系譜(リネージ)を構築したのです。まず燃料を管理するためのガバナーを追加し、次に飛行フェーズ間の遷移を処理するためのガイドを追加し、最後にロケットのフィンにかかる力をバランスさせるための特定の数学的ツールを追加しました。キャンペーンの終了時までに、システムはすべてのテスト走行でロケットを正常に着陸させるコントローラー、つまり成功率100%の完璧なスコアを叩き出しました。決定的なのは、システムがプロセス全体を記録しており、各小さな改善がいかにして最終的な成功につながったかを明確に示していたことです。

別の実験では、システムは自律型取引の問題に取り組みました。目標は、時間をかけて利益を最大化するように株を売買する戦略を構築することでした。利用可能なすべての銘柄を同量購入するというベースラインの戦略は、年間の成長率23%を達成しました。PRAXISTは、市場のパターンから学習し、実行コストに基づいて行動を調整する、より複雑で適応的な戦略を発見しました。この新しい戦略は、成長率53%を達成し、ベースラインの2倍以上の成果を上げました。システムは単にラッキーな組み合わせを見つけたのではなく、リスクの扱い方やトレードのタイミングの管理といった具体的な変更に、その発見の経緯を遡ることができました。研究者はシステムの「系譜」を見て、戦略がパフォーマンスを損ねていた共通の落とし穴を回避することを学んだ正確な瞬間を確認することができました。

システムは、ロボティクスと物理学の分野でもその価値を証明しました。カメラとレーザーを使用してナビゲーションを行うロボットを用いたテストにおいて、標準的なシステムは冗長な情報でマップを絶えず更新することで、膨大な計算資源を浪費していました。PRAXISTは、ロボットがすべてのビデオフレームを見る必要はなく、新しい情報が実際に有用な場合にのみ見る必要があることを理解しました。ロボットに不要な更新をスキップさせることを教えることで、システムはナビゲーションの精度を損なうことなく、視覚処理時間を72%削減しました。同様に、核融合炉の制御シミュレーションにおいて、システムは、物理現象の予測が極めて困難であるにもかかわらず、既存の人間の設計によるコントローラーよりも長い期間プラズマを安定させるコントローラーを設計しました。

これらの結果が極めて重要である理由は、それらが提供する透明性にあります。従来の自動化された研究では、システムが解決策を見つけたとしても、それはしばしば「ブラックボックス」となります。動いていることは分かりますが、なぜ動いているのかは分からず、その成功が少し状況が変わった場面でも維持されるかどうかを判断することも容易ではありません。PRAXISTは、すべての結果に詳細な物語を付随させることで、これを変えます。それは解決策の「系譜」を記録し、どのメカニズムがテストされ、検証され、そして破棄されたかを示す証拠の連鎖を提示します。これにより、人間の科学者はシステムの作業を見つめ、その背後にある論理を理解し、さらにはその最良の部分を取り入れて新しいものを構築することさえ可能になります。これは、コンピュータを単に答えを出す道具から、その推論を文書化する共同作業者へと変貌させるのです。

研究者たちは、このアプローチは人間の科学者に取って代わるためのものではなく、より強力な道具を与えるためのものであると強調しています。数千ものバリエーションをテストし、学んだ教訓を整理するという退屈な作業をシステムが担うことで、人間はより大きな全体像に集中できるようになります。実験の世代を超えて知識を継承する能力により、システムは新しい問題に直面するたびにゼロから始める必要がなくなります。過去の失敗と成功の知恵を持ち運び、試行を重ねるごとに強固になる信頼できる知識の基盤を築くことができるのです。単なる「最高スコアの探索」から「スコアの背後にある証拠の深い理解」への転換は、複雑なエンジニアリングの課題に対するアプローチにおける根本的な変化を表しています。

結局のところ、PRAXISTの物語は、機械における「記憶」の力についての物語です。長い間、コンピュータは計算には優れていましたが、自らの履歴を構造化された形で学習することは苦手としてきました。このシステムは、機械に「何が起きたか」だけでなく「なぜそれが起きたか」を記録する能力を与えれば、これまで手が届かなかった問題を解決できることを示しています。それは、一般的な意味でより賢くなることによってではなく、何を記憶し、その記憶をどのように活用するかについて、より慎重になることによって成し遂げられます。その結果、得られるシステムは、より効率的でコスト効率が高いだけでなく、より信頼できるものとなります。なぜなら、提示されるすべての解決策には、そこに到達した経緯を示す明確で検証可能な説明が付随しているからです。これが自律的研究の未来です。解決策へと推測で辿り着く機械ではなく、一度に一つの実験を通じて、証拠の遺産を築き上げていく機械の姿です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →