ASI-Bench: At the Dawn of Artificial Superintelligence
本論文は、AIが自律的かつ革新的な科学研究を行う能力を評価するために、人間の指導を段階的に減少させていく設計の、11の科学領域にわたる60のプロジェクトレベルの研究タスクからなる包括的なベンチマークであるASI-Benchを導入しており、現在の最先端のシステムは依然として人間による入力に大きく依存しており、真の人工超知能の達成には程遠いことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間のように考える機械への道のりは、長らく、コンピュータがいかに事実を記憶し、既知のパズルを解き、あるいは特定の答えに到達するために一連の指示に従えるかという点に焦点を当ててきました。長年にわたり、最も高度な人工知能システムは、膨大な人類の知識を吸収し、それらを驚異的な速度で適用するというこれらのタスクにおいて優れた能力を発揮してきました。しかし、そこには全く別の種類の知性が存在しており、それは依然としてほとんど手の届かない領域にあります。それは、未知の世界へと足を踏み入れ、混沌とした説明のつかない問題に直面したとき、単に答えを見つけるだけでなく、その答えを見つけ出すための「経路」そのものを編み出す能力です。これは科学的発見の領域であり、そこでの目標は、公式を想起することではなく、公式を考案し、実験を設計し、漠然とした問いを検証された結果へと変えることなのです。新たな研究を突き動かしている問いは、現在の機械が真にこれを独力で行えるのか、それとも、プロセスのあらゆる段階において、人間が手助けをし続けなければならない状態にあるのか、ということです。
世界中の大学や研究所の研究チームは、この問いに答えるために、「ASI-Bench」と呼ばれる新しいテスト場を構築しました。彼らは、物理学や化学から生物学、工学に至るまで、11の異なる科学分野にわたる60の複雑な研究プロジェクトを作成しました。各プロジェクトは、生のデータ、特定の目標、そして機能する解決策を生み出すという要件を備え、実際の科学的調査を模倣するように設計されました。この設計の素晴らしさは、機械をどのようにテストしたかにあります。すべての研究プロジェクトに対して、彼らは同じAIシステムを4回実行しましたが、その際、与える助けの量を変化させました。第1のシナリオでは、AIには問題を解決するための正確な手順が記された完全なステップ・バイ・ステップのマニュアルが手渡されました。第2のシナリオでは、「ハンマーを使え」と指示されるだけで、その振り方までは示されないような、一般的な手法のみが伝えられました。第3のシナリオでは、AIには問題とデータのみが与えられ、進め方に関する指示は一切なく、自ら手法を決定しなければなりませんでした。最後に第4のシナリオでは、機械が本来のタスクに集中し続けられるかを確認するために、混乱を招くような無関係な情報が追加されました。
結果は、現在の人工知能の現状について、厳しい現実を明らかにしています。機械に完全な指示を与えた場合、彼らは合理的に機能し、100点満点中平均して約51点を記録しました。しかし、研究者がステップ・バイ・ステップのガイダンスを取り除き、AI自身に手順を考えさせた途端、パフォーマンスは急落しました。AIが自ら手法を選択しなければならなくなったとき、平均スコアは約27点まで低下しました。この急激な低下は、今日のシステムが、人間によって既に舗装された道を辿ることには長けているものの、自ら道を築くことには極めて苦戦することを示唆しています。最大の障壁は、適切な道具を選ぶことではなく、むしろ一般的なアイデアを、機能する詳細な計画へと翻訳することでした。たとえAIがどの手法を使うべきかを知っていたとしても、それを機能させるために必要な手順を構築することに失敗することが多く、詳細な指示が取り除かれるとスコアが大幅に低下しました。
研究者たちはまた、余計な、注意をそらす情報を加えることは、指示を取り除くことほど機械を混乱させないことも発見しました。AIに同じ困難なタスクを与え、そこに大量の無関係な事実や雑談を加えたとしても、そのパフォーマンスは指示が全くなかったときとほぼ同じでした。これは、現在のシステムの主な弱点は、集中力の欠如やノイズをフィルタリングする能力の欠如ではなく、人間の定義したロードマップなしでは動作できないという根本的な能力不足にあることを示しています。この研究には、18種類の異なるAIモデルとソフトウェアエージェントの組み合わせが含まれており、最も強力な推論を利用した最も高度な構成であっても、自力で対処した場合には約52点しか得られませんでした。これはささやかな成功ではありますが、機械が独立した科学研究を行うために必要な信頼性には遠く及びません。
この独立性に伴うコストもまた高いものです。AIが自力で手順を考えなければならなかったとき、指示に従うだけだったときよりも、大幅に多くの計算資源と時間を消費しました。場合によっては、ガイドなしで同じタスクを試みるだけで、コンピューティングリソースを60%近く多く消費し、ループに陥ったり非効率な経路を試行したりすることが頻繁にありました。これは、真の自律性が単なる知性の問題ではなく、効率性の問題であることを示唆しています。人間の指導がなければ、機械は、もしやり方を教えられていれば迅速に解決できたはずの問題に対して、膨大な労力を浪費してしまうのです。研究は、我々が人工超知能(ASI)の夜明けにはまだ遠い、つまり、人間による介入なしに未知の世界を探索し、新しい知識を生み出すことができる状態には至っていないと結論付けています。むしろ、我々は、機械が複雑なタスクを実行できる強力な助手ではあるものの、戦略を定義する段階では依然として人間に大きく依存しているというフェーズにいます。
この新しいベンチマークは、最終的な審判を下すためのものではなく、科学コミュニラティへの出発点となることを意図しています。研究者たちは、作成した60のタスクとテスト手法を世界に公開し、他の科学者やエンジニアが新しい問題を提示し、独自のシステムをこれらの課題に対してテストすることを呼びかけています。彼らは、新しい困難な研究プロジェクトを継続的に追加し、テストを洗練させていくことで、コミュニティがより正確に進捗を追跡できると考えています。目標は、単純な記憶力や論理力のテストを超え、機械が真に科学者のように考え、未知を航海し、白紙のページから発見へと変えることができるかどうかを測定できる未来へと進むことです。今のところ、データが示しているのは、私たちの機械は賢くなってはいるものの、次に何をすべきかを私たちに教えてくれるのを待っている状態であるということです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。