← 最新の論文
🤖 AI

On Benchmarking Human-Like Intelligence in Machines

本論文は、現在のAI評価パラダイムは、ラベルの未検証や生態学的妥当性に欠けるタスクといった問題により、人間のような認知能力を正確に評価できていないと論じ、既存の9つのベンチマークに関する人間による評価研究に基づき、より厳格なベンチマークに向けた5つの具体的な提言を提示するものである。

原著者: Lance Ying, Katherine M. Collins, Lionel Wong, Ilia Sucholutsky, Ryan Liu, Adrian Weller, Tianmin Shu, Thomas L. Griffiths, Joshua B. Tenenbaum

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Lance Ying, Katherine M. Collins, Lionel Wong, Ilia Sucholutsky, Ryan Liu, Adrian Weller, Tianmin Shu, Thomas L. Griffiths, Joshua B. Tenenbaum

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに「人間」であることを教えようとしている自分を想像してみてください。単に数学に非常に強かったり、天気を予測できたりするだけでなく、あなたと同じように考え、感じ、反応してほしいのです。これが「人間らしい知能」の世界です。何十年もの間、科学者たちは、単に問題を解決するだけでなく、人間が世界を扱う際の、あの混沌としていて、混乱しており、時には矛盾に満ちたやり方を理解できる機械を作ろうと、これらのデジタルな精神を構築してきました。しかし、ここが難しいところです。ロボットが本当に人間のように振る舞っているのか、それとも単に非常に優れた演技をしているだけなのか、どうすれば判断できるのでしょうか?それを確かめるために、研究者は通常、ロボットにテストを実施します。しかし、もしそのテスト自体が壊れているとしたらどうでしょう?もし、現実の人間なら実際には12通りの異なる、少し自信のない答えを出すはずなのに、テストがロボットに対してたった一つの完璧な答えを出すことを期待しているとしたらどうでしょうか?この論文は、まさにその問題に切り込み、現在のAIのテスト方法は、ジャズの即興演奏を、音楽家にたった一つの完璧な音を奏でるよう求めることで評価するようなものだと主張しています。

この論文の著者たち(トップクラスの大学の研究チーム)は、私たちは現在、「人間らしい」知能を正しく測定することに失敗していると主張しています。彼らは、多くの人気のあるAIテストはあまりにも単純であり、実際の人間の思考とは一致しない「正解(グラウンド・トゥース)」のラベルに依存していると示唆しています。彼らの主張を証明するために、彼らは大規模な実験を行い、117人の実在の人間に対し、9つの異なるAIテストを受けるよう依頼しました。これらのテストは、皮肉を見抜くこと、ジョークが面白いかどうかを判断すること、あるいは社会的な状況が協力的であるかどうかを判断することなどをカバーしていました。人間は単に「A、B、またはC」を選ぶのではなく、スライダーを使用して、自分の答えに対してどの程度強く感じているか、そしてその感情に対してどの程度自信を持っているかを示しました。

結果は驚くべきものでした。論文は、これらのテストの多くにおいて、AIが学習した「正解」は、実はほとんどの人間が考えていることと比較して間違っていたと示唆しています。例えば、「社会的サポート」に関するタスクでは、テストでは特定の文章を「非協力的」としていましたが、人間は平均して「中程度の協力的」であると評価していました。さらに興味深いことに、人間は単にテストと意見が異なっていただけでなく、構造化された形で互いに意見が分かれていました。ある人は自分の答えに非常に確信を持っており、またある人は確信を持っておらず、彼らの意見は幅広いスペクトラムにわたっていました。論文は、現在のAIベンチマークが、この「混沌」を無視していることが多いと指摘しています。それらは人間の判断を、一つの正解がある数学の問題のように扱っていますが、実際には、誰もが少しずつ異なる視点を持つ会話のようなものなのです。

著者たちは、より優れたテストを構築するための5つの新しいルールを提案しています。第一に、人間が何を考えているかを推測するのをやめ、実際に人々に問いかけ、人間から得られた実際のデータを「ゴールドスタンダード(黄金律)」として収集する必要があります。第二に、一つの正解を探すのではなく、人間の答え全体の「分布」と比較すべきです。つまり、ある人はこのように考え、別の人はあのように考えるという事実を、AIが捉えられるかどうかを見るべきなのです。第三に、「段階性(gradedness)」を測定する必要があります。人間はめったに100%確信したり0%の確信であったりすることはありません。「ほとんどイエス」であったり「少しノーに近い」であったりします。論文は、単純なはい/いいえの選択を強いるのではなく、ニュアンスを捉えるためにスライダーや確信度の評価を使用すべきだと提案しています。第四に、テストはランダムな質問ではなく、深い心理学理論に基づいている必要があります。子供が「誤信念(false belief)」テストに合格したからといって、ロボットが同じテストに合格したからといって、そこに真の「心の理論(Theory of Mind)」があるとは限りません。テストは、そのスキルの複雑な部分を実際に測定するように設計される必要があります。最後に、タスク自体がより実生活に近いものである必要があります。実生活は曖昧で、混乱しており、文脈に満ちています。もしテストが綺麗すぎて単純すぎるなら、それはAIが現実世界を扱えるかどうかを教えてはくれません。

要約すると、この論文は、人間のような知能を持つAIを構築するためには、人間の知能を多肢選択式のクイズのように扱うのをやめなければならないと示唆しています。私たちは、不確実性、不一致、そしてグレーゾーンを受け入れる必要があります。人間特の思考の豊かさ、多様さ、そして時には混乱を伴う性質を反映したテストを設計することで、私たちはようやく、単に賢そうに見えるだけでなく、実際に人間のように感じることができる機械を構築し始めることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →