← 最新の論文
💬 NLP

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

本論文は、20の科学領域にわたる119のリポジトリレベルのタスクからなる包括的なベンチマークであるSWE-bench Scienceを紹介するものであり、現在のコーディングエージェントが、知識の欠如や探索エラーといった特定の失敗メカニズムによって、科学ソフトウェアにおけるエンジニアリングタスクの解決に苦慮していることを明らかにし、同時に、明示的な科学的ガイダンスの有用性は、それが修復コンテキストとどの程度一致しているかに依存することを実証している。

原著者: Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

科学は常に道具に依存してきました。遠方の星々を明らかにした望遠鏡、細胞という隠された世界を暴き出した顕微鏡、そして物質の構造を精査した粒子加速器です。今日、新たな種類の道具が不可欠なものとなっています。それは研究室の引き出しの中にではなく、コンピュータコードというデジタルの領域に存在するものです。このソフトウェアは、もはや科学者のために数値を計算するだけの補助的な存在ではありません。それは道具そのものとなったのです。研究者が新しい薬をシミュレーションしたり、気候をモデル化したり、あるいは遠方の銀河からの光を分析したりするとき、彼らは現実を見るためのまさに「レンズ」として機能するプログラムを実行しています。もしコードに欠陥があれば、その結果は単なるコンピュータのエラーにとどまりません。それは科学的な結論を揺るがしかねない、汚染された証拠となってしまうのです。

長年、研究者たちは人工知能に、これらの壊れたプログラムを修正する方法を教えようと試みてきました。彼らは、コンピュータがバグ報告を読み取り、ソフトウェアを修復するためのパッチを書き込めるかどうかを確認するためのテストを構築してきました。これらのテストは、機械が単純なコーディングミスを修正することについては向上していることを示しました。しかし、決定的な問いが未解決のまま残されていました。果たして、これらの知的なシステムは、複雑で重大な責任を伴う科学用ソフトウェアの世界を扱えるのだろうか、という問いです。この領域において、修正とは単にプログラムを実行可能にするだけでは不十分です。コードが表現しようとしている物理学、化学、あるいは生物学の繊細な法則を維持しなければなりません。ソフトウェアの実行速度を上げるものの、科学的な意味内容を変えてしまうような修復は、たとえコンピュータがテストに合格したとしても、失敗であると言えます。

ある研究チームは、新たに「SWE-bench Science」と呼ばれるテストの場を創設することで、この問いに取り組みました。彼らは、化学や生物学から天文学、土木工学に至る20の異なる分野で使用されている、98の異なるソフトウェアプロジェクトから集められた119の実世界のタスクを集めました。これらのタスクは単純な演習ではありませんでした。それらは、結晶に対して誤ったエネルギー値を算出するシミュレーションや、生物学的サンプルの座標を誤認するデータ解析ツールなど、科学者が実際に直面した問題から抽出されたものです。研究者らは、これらの課題を3つのタイプに分類しました。あるものは既知のバグの直接的な修復であり、別のものはAIが専門家のような調査員として振る舞い、なぜ科学的な結果が誤っているのかを突き止める必要があり、残りはAIが巨大なソフトウェアシステム内の異なる部分がどのように組み合わさって一つのワークフローを完結させているかを理解することを要求するものでした。

実験の結果は、驚くべきものでした。現在利用可能な最も高度なコーディングエージェントであっても、著しく苦戦したのです。強力なコーディングアシスタントを備えた洗練されたモデルである最高性能のシステムでさえ、タスクの半分未満しか正しく解決できませんでした。この低い成功率は、現在の人工知能ができることと、科学用ソフトウェアを維持するために求められることとの間の深い隔たりを浮き彫りにしています。研究者たちは、これらのシステムが失敗する場合、そこには4つの予測可能なパターンがあることを発見しました。多くの場合、AIには問題を理解するために必要な特定の科学的知識が不足しており、コンピュータにとっては理にかなっていても自然界の法則に反する修正を提案してしまいました。また、数値がおかしいといった表面的な症状のみを修正し、エラーの根本原因まで遡ることができない場合もありました。他にも、修正がプログラムの一部分には機能するものの、他の部分との接続を壊してしまい、修復をより大きなシステムへと統合することに失敗するケースもありました。最後に、AIは与えられた特定の例に固執してしまい、科学的原理を新しい状況に適用できず、解決策を一般化することが頻繁にできなかったのです。

科学的知識がこれらの失敗に果たす役割を理解するために、研究者たちは特定の実験を行いました。彼らはタスクのサブセットを取り出し、AIに科学に関する追加の背景情報を与えた場合と、与えない場合の2回、実行しました。その結果、この追加情報は魔法の杖ではないことが示されました。一部の強力なAIモデルにおいては、科学的な文脈を提供したことで、むしろ問題を完全に解決できる可能性がわずかに低下しました。これは、追加のテキストがAIを惑わせたか、あるいは自らのアイデアを検証する代わりに提供された説明に頼りすぎてしまったためと考えられます。より弱いモデルにおいては、追加情報は役に立ちましたが、それにはより多くの計算リソースを必要としました。このことは、単に事実をAIに詰め込むことが優れた修復を保証するわけではないことを示唆しています。システムは、それらの事実をコードに関連付け、実行を通じて検証できなければならないのです。

本研究は、人工知能が一般的なソフトウェアエンジニアリングにおいて進歩を遂げている一方で、科学計算特有の要求は依然として手強い課題であることを結論付けています。科学的なコードを修正するには、構文や論理を超えた理解、すなわちコードが体現する物理的・理論的な原理への把握が求められます。これらのシステムが、「プログラムが動作すること」と「プログラムが科学的に妥当であること」を確実に区別できるようになるまで、科学のデジタル的な道具を維持する任務は、おそらく引き続き人間の専門家の仕事であり続けるでしょう。この新しいベンチマークは、現在のシステムがどこに位置しているのかを示す明確な地図を提供しており、科学用ソフトウェアの完全な自律的修復への道は、まだ長く、複雑な障害に満ちていることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →