SocietyBench: Forecasting Counterfactual Social-World Evolution
本論文は、現実世界の出来事のタイムラインを構造化された予測タスクへと匿名化することで、反事実的な社会世界の進化を予測する大規模言語モデルの能力を評価する新しいベンチマークであるSocietyBenchを紹介し、最先端のモデルであっても、多様な事象における確率的較正と時間的正確さの両方において苦慮していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超高性能なロボットに世界の仕組みを教えようとしているところだと想像してください。長い間、科学者たちはロボットに「この壊れたコードを修正せよ」「このウェブサイトを操作せよ」「この数学の問題を解け」といった雑用を与えることで、それらをテストしてきました。それは、ロボットがただ車線を維持して目的地に到達すればよいだけの、運転免許試験のようなものです。しかし、こうしたテストでは、人間であることの極めて重要な側面が見落とされています。それは、現実世界の予測不可能なドラマです。ロボットは、突然のスキャンダルや、移り変わる政治的な噂、あるいは市場の暴落にどう対処するのでしょうか? 今日のニュースを見て、明日の見出しがどうなるかを予想できるのでしょうか? これこそが「ソーシャル・フォアキャスティング(社会予測)」の領域です。それは地図に従うことではなく、噂や怒り、驚きによって風向きが変わる、人間の行動という「天気」を予測することなのです。
そこで登場したのが、AIが単に学習データから暗記した事実を復唱するのではなく、現実世界の社会的出来事の未来を実際に予測できるかどうかを判定するために設計された、新しい「最終試験」であるSocietyBenchです。この研究の背後にいる研究者たちは、もしAIにすでに起こった有名な出来事について尋せば、AIは膨大な過去のインターネットテキストのライブラリから答えを思い出す「暗記データの依存」をしているだけかもしれない、ということに気づきました。これを防ぐために、彼らは巧妙なトリックを編み出しました。実際のニュース記事を取り上げ、すべての名前(例えば「イーロン・マスク」を「人物X」に、「テスラ」を「企業Y」に変えるなど)を入れ替え、日付をずらしたのです。これにより、実在の物語は「反事実的(カウンターファクチュアル)」な世界、つまり、現実の世界と全く同じように見え、感じられるものの、AIがその台本を一度も見たことがないパラレルワールドへと変貌します。AIは記憶を使うのではなく、自分の頭を使って物語がどのように展開するかを考え出さなければならないのです。
この実験の結果は、AI界にとって一種の「現実を突きつけるもの」となりました。研究者たちは、金融市場の暴落から地政学的紛争に至るまで、5つの異なるタイプの出来事について、現在利用可能な最も高度な6つのAIモデルをテストしました。最高スコアを獲得した最も賢いモデルでさえ、わずか75.0 / 100点しか獲得できませんでした。これは良く聞こえるかもしれませんが、覚えておいてください。「トリビアル・アンカー(単にランダムに推測したり、すべてに対して『50%の確率』と言ったりした場合に得られるスコア)」は50です。つまり、最高のAIといえども、ランダムな推測と完璧な予測のちょうど中間地点に過ぎないのです。
さらに衝撃的なのは、AIモデルは一貫性を持たせるのが非常に苦手だということです。あるモデルは、何かが起こる「確率」を当てるのは得意(例えば「降水確率70%」と言うなど)ですが、それが「いつ」起こるかを当てるのは不得意です。また、その逆のモデルもあります。それは、雨が降るかどうかについては常に正しいけれど、それが火曜日なのか金曜日なのかについては常に間違ってしまう天気予報士のようなものです。研究では、単一の出来事において、最高のモデルと最低のモデルの差は最大で21.4ポイントにも及ぶことが分かりました。これは、一つの物語だけでAIをテストして終わりにしてはいけないことを証明しています。真の姿を知るためには、多くの異なる物語でテストしなければならないのです。
おそらく最も驚くべき発見は、「AIエージェント」に関するものでした。これらは、複数のAIボットが互いに話し合い、議論し、計画を立てることで、より賢い答えを得ようとする高度な仕組みです。研究者たちは、これらのチームを機能させるための3つの異なる方法を試しましたが、どれも結果を改善することはありませんでした。実際、ボットのチームは、その基盤となっている孤独な単体のAIボットよりも成績が悪くなることがよくありました。社会的な混乱を予測するためには、部屋に多くの声を加えることは、会話を賢くするのではなく、単にノイズを増やすだけだったのです。
結局のところ、SocietyBenchは、私たちのAIモデルが指示に従ったりバグを修正したりすることには非常に長けている一方で、複雑に渦巻く人間社会のダイナミクスを理解することには依然として苦戦していることを示しています。彼らは未来を暗記することはできません。未来を論理的に推論しなければならないのです。そして現在、最高峰のモデルといえども、真の「予言者」になるには、まだ程遠い場所にいます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。