✨ 要約🔬 技術概要
ロボットに「人間」であることを教えようとしている自分を想像してみてください。単に数学に非常に強かったり、天気を予測できたりするだけでなく、あなたと同じように考え、感じ、反応してほしいのです。これが「人間らしい知能」の世界です。何十年もの間、科学者たちは、単に問題を解決するだけでなく、人間が世界を扱う際の、あの混沌としていて、混乱しており、時には矛盾に満ちたやり方を理解できる機械を作ろうと、これらのデジタルな精神を構築してきました。しかし、ここが難しいところです。ロボットが本当に人間のように振る舞っているのか、それとも単に非常に優れた演技をしているだけなのか、どうすれば判断できるのでしょうか?それを確かめるために、研究者は通常、ロボットにテストを実施します。しかし、もしそのテスト自体が壊れているとしたらどうでしょう?もし、現実の人間なら実際には12通りの異なる、少し自信のない答えを出すはずなのに、テストがロボットに対してたった一つの完璧な答えを出すことを期待しているとしたらどうでしょうか?この論文は、まさにその問題に切り込み、現在のAIのテスト方法は、ジャズの即興演奏を、音楽家にたった一つの完璧な音を奏でるよう求めることで評価するようなものだと主張しています。
この論文の著者たち(トップクラスの大学の研究チーム)は、私たちは現在、「人間らしい」知能を正しく測定することに失敗していると主張しています。彼らは、多くの人気のあるAIテストはあまりにも単純であり、実際の人間の思考とは一致しない「正解(グラウンド・トゥース)」のラベルに依存していると示唆しています。彼らの主張を証明するために、彼らは大規模な実験を行い、117人の実在の人間に対し、9つの異なるAIテストを受けるよう依頼しました。これらのテストは、皮肉を見抜くこと、ジョークが面白いかどうかを判断すること、あるいは社会的な状況が協力的であるかどうかを判断することなどをカバーしていました。人間は単に「A、B、またはC」を選ぶのではなく、スライダーを使用して、自分の答えに対してどの程度強く感じているか、そしてその感情に対してどの程度自信を持っているかを示しました。
結果は驚くべきものでした。論文は、これらのテストの多くにおいて、AIが学習した「正解」は、実はほとんどの人間が考えていることと比較して間違っていたと示唆しています。例えば、「社会的サポート」に関するタスクでは、テストでは特定の文章を「非協力的」としていましたが、人間は平均して「中程度の協力的」であると評価していました。さらに興味深いことに、人間は単にテストと意見が異なっていただけでなく、構造化された形で互いに意見が分かれていました。ある人は自分の答えに非常に確信を持っており、またある人は確信を持っておらず、彼らの意見は幅広いスペクトラムにわたっていました。論文は、現在のAIベンチマークが、この「混沌」を無視していることが多いと指摘しています。それらは人間の判断を、一つの正解がある数学の問題のように扱っていますが、実際には、誰もが少しずつ異なる視点を持つ会話のようなものなのです。
著者たちは、より優れたテストを構築するための5つの新しいルールを提案しています。第一に、人間が何を考えているかを推測するのをやめ、実際に人々に問いかけ、人間から得られた実際のデータを「ゴールドスタンダード(黄金律)」として収集する必要があります。第二に、一つの正解を探すのではなく、人間の答え全体の「分布」と比較すべきです。つまり、ある人はこのように考え、別の人はあのように考えるという事実を、AIが捉えられるかどうかを見るべきなのです。第三に、「段階性(gradedness)」を測定する必要があります。人間はめったに100%確信したり0%の確信であったりすることはありません。「ほとんどイエス」であったり「少しノーに近い」であったりします。論文は、単純なはい/いいえの選択を強いるのではなく、ニュアンスを捉えるためにスライダーや確信度の評価を使用すべきだと提案しています。第四に、テストはランダムな質問ではなく、深い心理学理論に基づいている必要があります。子供が「誤信念(false belief)」テストに合格したからといって、ロボットが同じテストに合格したからといって、そこに真の「心の理論(Theory of Mind)」があるとは限りません。テストは、そのスキルの複雑な部分を実際に測定するように設計される必要があります。最後に、タスク自体がより実生活に近いものである必要があります。実生活は曖昧で、混乱しており、文脈に満ちています。もしテストが綺麗すぎて単純すぎるなら、それはAIが現実世界を扱えるかどうかを教えてはくれません。
要約すると、この論文は、人間のような知能を持つAIを構築するためには、人間の知能を多肢選択式のクイズのように扱うのをやめなければならないと示唆しています。私たちは、不確実性、不一致、そしてグレーゾーンを受け入れる必要があります。人間特の思考の豊かさ、多様さ、そして時には混乱を伴う性質を反映したテストを設計することで、私たちはようやく、単に賢そうに見えるだけでなく、実際に人間のように感じることができる機械を構築し始めることができるのです。
技術要約:機械における人間のような知能のベンチマーキングについて
問題提起
本論文は、人工知能(AI)システムの評価における決定的な欠落を指摘している。現在のベンチマークは、モデルが人間のような認知能力 を備えているかどうかを評価するには不十分であることが多い。近年のAIモデルは様々なタスクで高い性能を示しているが、著者らは、既存の評価パラダイムは人間と機械の認知における質的な類似性を捉えきれていないと主張している。
核心となる問題は、標準的なベンチマークが以下に依存している点である:
人間によって検証されたラベルの欠如: 多くのデータセットは、キュレーターによる単一の「正解(グラウンドトゥルース)」ラベルや多数決に基づいたラベルを使用しており、実際の人間による回答の分布を無視している。
変動性の不適切な表現: ベンチマークは、人間の回答の多様性や不確実性を切り捨てることが多く、認知タスクを(道徳的推論やユーモアの検出のように)本質的に主観的なものである場合でも、単一の客観的な答えがあるものとして扱ってしまう。
生態学的妥当性の欠如: タスクが過度に単純化されており、現実世界のシナリオに見られる複雑さ、曖昧さ、および文脈的なニュアンスに欠けている。
著者らは、人間レベルの知能 (定量的には人間と同等、あるいは人間を超える精度を達成すること)と、人間のような知能 (エラープロファイル、不確実性の分布、段階的な信念を含む、認知パターンにおける質的な類似性を示すこと)を区別している。彼らは、現在のツールがこれらの概念を混同しており、AIの能力を誤って特徴づけている可能性があると主張している。
方法論
著者らは、彼らの主張を実証するために、一般的な常識および心の理論(ToM)の推論を必要とするとされる既存の9つのAIベンチマークを用いて、人間による評価研究 を実施した。
選択されたベンチマーク: 社会的IQA、道徳的許容性、倫理的問題、社会的サポート、皮肉の特定、ダークユーモア、およびファンタジー推論をカバーするBIG-Bench(Srivastava et al., 2022)から7つのタスク。および、心の理論の推論のためのBigToMとToMBench。
データ収集:
参加者: Prolificを通じて募集された117名の参加者。
刺激(スティムライ): 9つのベンチマークからランダムにサンプリングされた30個の刺激(合計2,685件のアノテーション済み試行)。
手順: 標準的な多肢選択形式ではなく、参加者は各回答の選択肢に対して0–100のスライダー を使用して評価を行った(例:「強く反対」から「強く同意」まで)。
不確実性の測定: 各評価に続いて、参加者は別の0–100スケールで自身の**確信度(コンフィデンス)**を報告した。この二つの尺度を用いた設計により、段階的な判断(信念の度合い)と、エピステミックな不確実性(その判断に対する確信度)を分離している。
分析: 著者らは、人間の回答分布および確信度レベルを、元のベンチマークの正解ラベルおよびチャンスレベルと比較した。
主な知見
人間の再アノテーションにより、標準的なベンチマークのラベルと実際の人間行動との間に顕著な相違があることが明らかになった。
正解(グラウンドトゥルース)との低い一致度: 9つのベンチマーク全体で、人間の正確さ(ベンチマークの単一ラベルとの一致)は平均**69.7%**であった。
一部のタスクではチャンスレベルを下回った(例:Social support は45%であり、チャンスレベルの50%を下回った)。
道徳的許容性 (一致度72%)、皮肉の特定 (一致度73%)、Social IQA (一致度68%)において、重大な不一致が見られた。
単純な倫理的問題 のみが高い一致度(88%)を示した。
段階的な信念 vs 二値ラベル: 人間の回答は、二値的であることは稀であった。参加者は頻繁に中間的な評価(例:「支持できない」とラベル付けされた刺激に対し、0–100スケールで平均69.4の評価を与える)を提供しており、これは段階的な信念 が存在することを示しているが、二値ラベルではこれを捉えきれない。
構造化された不確実性: 参加者は様々な程度の確信度を報告した。Social support や道徳的許容性 のようなタスクでは、低い確信度の報告が一般的であったが、他のケース(例:皮肉の特定 )では、参加者は分岐した見解に対して高い確信度を示した。これは、変動性が単なるノイズや混乱ではなく、構造化された意見の相違 であることを示唆している。
現在の設計の限界: 本研究は、単一の正解ラベルに依存することが、比較の基準を誤らせ、人間の認知の分布的な性質を捉えることに失敗することを証明している。
主な貢献と推奨事項
本論文は、将来のAIベンチマーキングを改善するために、認知科学のベストプラクティスから導き出された5つの具体的な推奨事項を提案している。
実際の人間に基づいて測定する: 「人間のような」AIの正解ラベルは、単なるキュレートされた回答ではなく、人間から収集された回答データでなければならない。これは、単一の客観的な答えが存在しない主観的なタスクにおいて不可欠である。
集団の分布に対して評価する: モデルは、多数決によるハードラベルではなく、人間による判断の全分布 (ソフトラベル)に対して評価されるべきである。モデルが集団レベルの変動性やサブポピュレーションを捉えられるよう、指標には確率分布の比較(例:KLダイバージェンス、ワッサースタイン距離)を含めるべきである。
段階性と不確実性を評価する: ベンチマークは、個々のアノテーターからの段階的な判断 と確信度 を引き出し、測定しなければならない。これにより、現実世界の意思決定のニュアンスと、人間による推論に内在する不確実性を捉えることができる。これは、二値の選択肢が隠蔽してしまうものである。
メタ理論に根ざしたタスク設計を行う: ベンチマーク設計は、心理学的テスト(例:サリー・アン・テスト)をそのまま転用するのではなく、認知的な構成概念のメタ理論 (構成要素と観察可能なシグネチャーの定義)から開始すべきである。既存のテストは、学習データによって汚染されていたり、AIに対する構成概念妥当性が欠けていたりする場合がある。
認知的に豊かなタスクを設計する: 複数の認知プロセスを統合し、系統的なアブレーション (文脈の除去)を活用し、構造化された曖昧さ を含めることで、自然な行動を引き出すタスクを作成すべきである。これにより、単純なQ&A形式を超え、AIが現実世界の複雑さと不確実性にどのように対処するかを評価できるようになる。
意義と範囲
著者らは、認知科学者の双方に対し、評価慣行を厳格な認知モデリングに適合させるよう、本研究を呼びかけとして位置づけている。
科学的価値: エラーパターン、バイアス、および不確実性にわたる、機械と人間の知能の厳密な比較は、両者の性質を理解するために極めて重要である。
実用的価値: 道徳的推論、社会的適切性、ユーモアなどの、規範的な正解が存在しない主観的なタスク においては、人間のような分布的評価が必要である。逆に、数学やタンパク質折り畳みのような規範的な基準があるタスクについては、人間のようなエラーパターンを模倣することは逆効果となる可能性があり、本論文の推奨事項はそれらの領域を意図したものではない。
限界: 著者らは、高品質な人間によるデータを収集することはリソースを大量に消費すること、および人間由来のメタ理論をAIシステムに転用できるかどうかは未解決の問題であることを認めている。彼らは、AIがすべての人間的な認知の限界(有害なバイアスなど)を複製すべきだと主張しているのではなく、人間的な変動性の構造 を理解することが、安全で協調的、かつ解釈可能なAIパートナーを構築するために不可欠であると主張している。
本論文は、「人間のような」AIの真の理解を得るためには、単純な正確性指標を超えて、変動性、不確実性、および生態学的妥当性を重視するフレームワークへと移行する必要があると結論付けており、そのために認知科学における数十年の研究を強く活用することを求めている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×