← 最新の論文
🤖 AI

COMPOSITE-Stem

博士課程レベルの研究者が物理学、生物学、化学、数学の分野で 70 題の専門的なタスクを設計し、LLM による評価プロトコルと組み合わせて現在の AI エージェントの限界(最高 21% の精度)を明らかにする「COMPOSITE-STEM」という新しいベンチマークを提案する論文です。

原著者: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wol
公開日 2026-04-14
📖 1 分で読めます☕ さくっと読める

原著者: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillman, Yuqi Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI 研究者たちが、最新の AI に『科学の現場』でどれだけ働けるかテストした結果報告書」**です。

まるで、AI たちを「見習い科学者」として雇い、彼らが実際に実験室や計算機の前で、博士号を持つプロの科学者たちが作った**「70 問の超難問」**に挑戦させたようなイメージです。

以下に、難しい専門用語を避け、身近な例え話を使って解説します。


1. なぜこのテストが必要だった?(背景)

これまでの AI のテストは、まるで**「学校の定期試験」**のようでした。

  • 問題: 多肢選択問題や、答えが「A」か「B」かだけ決まっているもの。
  • 問題点: AI が勉強しすぎて、答えを丸暗記してしまったり、少しの工夫で正解を出せてしまったりして、「本当に頭が良くなったのか」がわからなくなっていました。

そこで今回、**「実戦演習」**のようなテストを作りました。

  • 新しいテスト(COMPOSITE-STEM): 物理、化学、生物、数学の分野から、**「答えが一つだけではない」**ような、複雑で現実的な問題を出しました。
  • 例: 「この実験データから、新しい薬の分子構造を設計してください」といった、答えが定まっていない課題です。

2. テストの仕組みは?(環境とルール)

このテストは、AI を**「一人前の科学者のアシスタント」**として扱います。

  • 作業場(ハーバー): AI は、自分のパソコン(ターミナル)を持って、実際にコードを書いたり、必要なツール(化学計算ソフトなど)をインストールしたりして作業します。
  • 採点方法(ジャッジのjury):
    • 昔のテストは「答えが合っていれば○」でしたが、今回は**「5 人の専門家(別の AI)が採点」**します。
    • 彼らは、**「ルビ(評価基準)」**というチェックリストを見て、「このステップは正しいか?」「論理は飛躍していないか?」を判断します。
    • 例え最終的な数字が少し違っても、**「プロセスが素晴らしい」**なら高得点が出ます。まるで、料理の味見をして「味付けは完璧、でも盛り付けが少し崩れている」と評価するような感じです。

3. 結果はどうだった?(AI の実力)

4 つの最新 AI に挑戦させましたが、結果は**「まだ道半ば」**でした。

  • 最高成績: 最も得意な AI でも、21.4%(100 問中 21 問しか正解できず)でした。
  • 他の AI: 4%〜5% しか正解できませんでした。
  • 意味: 最新の AI でも、「博士号を持つ科学者レベルの複雑な仕事」を一人でこなすのは、まだ非常に難しいということです。

4. なぜ AI は失敗したの?(失敗の理由)

AI の失敗には、大きく分けて 2 つのパターンがありました。

  1. 「あきらめ早い」タイプ(ツールを使わない):

    • 必要な計算ソフトがないと分かっても、「自分で計算しよう」として失敗する。
    • 例え: 料理をするのに包丁がないと分かっても、手で野菜をちぎろうとして失敗する人。
    • 成功した AI は、「よし、包丁(ツール)をインストールしよう!」と素早く対応しました。
  2. 「手順を間違える」タイプ:

    • 道具は揃えたのに、使い方を間違えて変な結果を出してしまう。
    • 例え: 包丁は買ったのに、野菜を切らずにそのまま鍋に入れてしまった人。

特に面白い発見は、**「強い AI は、答えが正解か不正解かの境界線(グレーゾーン)にいたり、採点者(AI ジャッジ)の間で意見が割れる」ことでした。これは、「完全に間違っている」のではなく、「半分は正解している」**という証拠でもあります。

5. このテストのすごいところ(貢献)

  • オープンソース: この「70 問のテスト問題」は、誰でも無料で見られるように公開されました。
  • 目的: AI が科学の発展を助けるために、**「どこまでできて、どこが苦手か」**を正確に知るための「物差し」として使ってもらいたいと考えています。

まとめ

この論文は、**「AI はすごいけど、科学者のような複雑な仕事はまだ一人前ではない」**と正直に報告しています。

でも、**「21% 取れた」ということは、「80% 近くは失敗しているけど、20% は成功している」**ということです。このテストを通じて、AI が「道具(ツール)を正しく使い、失敗から学んで成長する」ための道筋が見えてきました。

今後は、この「物差し」を使って、AI がもっと賢く、科学の現場で本当に役立つ存在になることを目指しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →