Contemporary AI lacks the imagination to diverge or negate in science
これまでで最大規模の人間(科学者)が介在する評価である本研究は、AIは科学的なアイデアを生成できる一方で、現状では、逸脱したり帰無仮説を提示したりするための想像力に欠けており、しばに従来の思考という狭い「集団的知性(ハイブマインド)」に陥る傾向があり、専門家である科学者と比較して、斬新さ、文脈への意識、および判断力における限界を克服するためには人間の接地(グラウンディング)を必要とすることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ビッグピクチャー:AI科学者に対する現実的な検証
想像してみてください。私たちは、科学の最も困難な謎を解くために、超スマートなロボットに助けを求めているとします。私たちは、そのロボットが人間さえ思いつかなかったような、輝かしく全く新しいアイデアを生み出してくれることを期待しています。この論文は、そのロボットが本当にその仕事に就ける準備ができているのかを確認するための、大規模な実世界での「ストレス・テスト」のようなものです。
研究者たちは、単にAIに物語を書かせたのではありません。AIに「科学者」として振る舞うよう求めたのです。彼らは、生物学、医学、化学、社会科学から12万件もの実際の科学論文を取り上げ、それぞれの論文における「パズル(課題)」をAIに読み取らせ、次のステップを提案させました。そして、そのAIの提案を実際の論文の著者たちに送り、彼らがどう感じたかを確認しました。
以下に、3つの主要なストーリーに分けて、その結果を説明します。
1. 「集合精神(ハイブ・マインド)」対「放浪者」
発見: ほとんどのAIモデル(「推論能力のない」モデル)は、巨大で単一の目的を持った「集合精神」のように振る舞います。もし10個のモデルに同じパズルを解かせたとしても、彼らはほぼ全く同じアイデアを提示します。彼らは互いに非常に似通っており、また、人間がすでに述べていることとも非常に似ています。彼らは本当の意味で「枠の外」で考えているのではなく、単に「箱の中の家具を並べ替えている」だけなのです。
比喩: 10人の学生に、迷子の犬についての物語を書くよう頼む場面を想像してください。
- 非推論型AI: 10人全員が全く同じ物語を書きます。「犬は公園へ行き、骨を見つけ、家に帰りました」。彼らは皆、同じ人気映画のプロットをコピーしているのです。
- 推論型AI: これらのモデルはもう少し優れています。彼らは公園の中を少し彷徨(さまよ)います。ある者は犬がビーチに行ったと提案し、別の者はパン屋に行ったと提案するかもしれません。彼らにはより多くの多様性があります。
欠けているピース: 「放浪者(推論型モデル)」でさえも、盲点を持っています。彼らは、**「何も起きなかった」**というアイデアを提示することがほとんどありません。
- 比喩: もし科学者が「ブルーベリーを食べることは、走る速さを上げるか?」と尋ねたら、AIは「はい、ブルーベリーは超スピードを与えます!」や「あるいは、水分補給に役立つかもしれません」と提案します。
- 人間の動き: 人間の科学者なら、「実際には、ブルーベリーは走る速さに全く影響を与えないかもしれない」と言うかもしれません。
- AIの失敗: AIは「帰無仮説(何の関係もないという考え)」を提示することが稀です。それは、食材を加える方法しか知らず、「この料理には何も加える必要がない」と言う方法を忘れてしまったシェフのようなものです。この論文は、これがAIの学習データが「成功体験(ポジティブな結果)」を報告する書籍に偏っているためであり、「失敗(無効な結果)」はしばしば科学の「引き出しの奥」に隠され、AIの目に触れないことを示唆しています。
2. 科学者の「エコーチェンバー(共鳴室)」
発見: 実在の科学者たちがAIのアイデアをレビューした際、彼らは客観的な審判としてではなく、自分たちの研究のファンとして振る舞いました。
- 「自分に似たもの」バイアス: 科学者たちは、自分の過去の研究と似た響きを持つAIのアイデアを好みました。彼らはそれらのアイデアをより「実現可能」で「真実らしい」と考えました。しかし皮肉なことに、彼らはこれらのアイデアは「斬新さ(新しさ)に欠ける」とも考えました。
- 「シニアリティ(経験値)」バイアス: 年配の、あるいは有名な科学者(シニア研究者)は、若い研究者よりもはるかに厳しい批評家でした。彼らは、特に社会科学において、AIのアイデアを採用することに消極的でした。
- 「分野」バイアス: 医学分野の科学者はAIに対して最も寛容でした。一方で、社会科学の科学者は最も懐疑的でした。なぜなら、社会科学は混沌としており、文化や歴史といったコンテキスト(文脈)に強く依存しているからです。データ内のパターンから学習するAIは、こうした変化し続ける複雑な人間の文脈を理解するのが苦手です。AIは「平均的な意見」を模倣しようとしますが、社会科学においては、模倣すべき「平均的な意見」など存在しないことが多いのです。
比喩: 設計案をレビューする建築家グループを想像してください。
- もしAIが、その建築家が以前建てた超高層ビルと全く同じ見た目の建物を提案したら、建築家は「素晴らしい!安全で実現可能だ!」と言います(しかし同時に、「退屈だ、前にも見たことがある」とも思います)。
- もしAIが、突飛で新しいデザインを提案したら、建築家は「それはリスクが高い」と言います。
- 年配の有名な建築家たちは、最も厳しい批評家です。彼らは、あらゆるものを見てきた業界の「重鎮」であり、新しいガジェットに対して非常に懐疑的です。
3. 壊れたスコアカード
発見: 現在の科学界では、時間を節約するために他のAIツールを使って科学的アイデアを自動的に採点しています。この論文はそれらのツールをテストしましたが、彼らは仕事ができていないことが分かりました。
- 問題点: これらの自動判定器は、全員に「Cマイナス」の成績をつけてしまいます。彼らは高いスコアや低いスコアをつけることを恐れ、すべてを中央に集めてしまいます。彼らは、輝かしいアイデアと悪いアイデアの区別をつけることができません。
- 解決策: 研究者たちは、人間の科学者が実際に好むものに基づいて特別に訓練された、新しいカスタム「報酬モデル(特化したAI判定器)」を構築しました。この新しいモデルは、異なる科学分野の微妙な「好み」を学習しました。これにより、人間が考えることを予測する能力が向上し、ロボットの判定器と人間の判定器の間の溝を埋めることができました。
比喩: 審査員がロボットである音楽コンテストを想像してください。
- 古いロボット審査員: ロック、ジャズ、カントリーの曲を聴いても、すべてに10点満点中5.5点をつけてしまいます。彼らは違いを理解できません。
- 新しいカスタム判定器: 研究者たちは、人間の音楽評論家が何を好むかの例を数千件見せることで、新しいロボットを教えました。今や、この新しいロボットは「ああ、このジャズには人間が好むクールなひねりがあるな」と理解し、9点を出すことができます。ようやく「バイブス(雰囲気)」を理解したのです。
結論
この論文は、今日のAIは**「有能な助手ではあるが、創造的なパートナーではない」**と結論付けています。
- 得意なこと: 大量の本を読み、要約し、すでに書かれた内容に基づいた次の論理的なステップを提案すること。アイデアの探索範囲を広げることです。
- 欠けていること: **「想像力」と「否定」です。AIは「もしこれが間違っていたら?」「もし何も起きなかったら?」と言うことができません。AIには「好奇心」**がありません。AIは「次に何を学ぶべきか」を自問するのではなく、「すでに語られたこと」を予測しているに過ぎないのです。
最終的なメタファー:
AIを、非常に高速で、非常に博識な「司書」だと考えてください。
- もしあなたが「猫についての本にはどんなものがありますか?」と尋ねれば、司書はこれまでに書かれたすべての猫の本のリストを即座に提示できます。
- しかし、もしあなたが「猫とは、猫ではないものは何か?」「もし猫が空を飛べるとしたら?」と尋ねれば、司書は混乱してしまいます。司書は、棚にある本のことしか知らないからです。書かれなかった本や、試みられて失敗したアイデアについては、彼らは知らないのです。
科学が真に前進するためには、奇妙な問いを投げかけ、不可能を想像し、何が重要かを決定するのは、依然として人間である必要があります。AIは図書館を整理する手助けはできますが、人類の知識の次の章を単独で書き上げることはできないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。