Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing
この研究は、人間の意味記憶の想起が、現在の大型言語モデルよりも変動性が高く探索的な検索パターンを示すことを明らかにしており、それは、いかなる温度調整設定(temperature tuning configuration)を用いても完全には再現できない、語彙流暢性課題における高いエントロピー、より大きな意味的ステップ、およびより広い分散によって裏付けられている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたの脳を、あらゆる単語や概念が「本」として収められた、巨大で賑やかな図書館だと想像してみてください。あなたが「1分間にできるだけ多くの動物の名前を挙げる」というゲームをしているとき、あなたはただ棚からランダムに本を取り出しているわけではありません。あなたは図書館の中を**ナビゲート(航行)**しているのです。あなたは「ペット」の棚からスタートして、いくつかの本(猫、犬、ハムスター)を手に取り、その後、突然「海洋」の棚へと大きく跳躍して、サメの本を掴むかもしれません。これが、あなたの脳による探索の仕方なのです。
ある研究チームは、今日私たちが使っている超スマートなAIチャットボット(GPT-4o、Gemini、Claudeなど)が、人間と同じようにこの図書館をナビゲートしているのかどうかを確かめることにしました。彼らは82人の実在の人間と3つの異なるAIモデルに対し、動物の名前を列挙させるテストを行いました。AIをより人間らしく振る舞わせるために、彼らはボットに対して、リストを作る前に特定の人物(シェフやパイロットなど)になりきるよう指示さえしました。また、「ランダム性のつまみ」(温度パラメータ、またはtemperatureと呼ばれます)を調整し、0.0(超ロボット的で予測可能)から1.0(超混沌としていてワイルド)まで変化させました。
以下にその結果を示しますが、これは少し予想外の展開(プロットツイスト)となっています。
人間の「ジャングルジム」対 AIの「綱渡り」
研究者たちは、この「歩み」がどのようなものかを測定するために、3つの指標を用いました:
- ステップサイズ(歩幅): 単語の間でどれほど大きなジャンプをしたか?(例:「猫」から「犬」への移動は小さなジャンプですが、「猫」から「シャーク(サメ)」への移動は大きなジャンプです)。
- 驚き要素(エントロピー): ステップがいかに予測不可能であったか? あなたの経路はランダムに棚を切り替えたのか、それとも非常に一定だったのか?
- 放浪癖(重心からの距離): 図書館の中心からどれほど離れたか? メインの経路に留まっていたのか、それとも、埃をかぶった忘れ去られた隅の方まで探索に行ったのか?
大きな発見:
人間は究定の探検家でした。私たちの経路は乱雑で予測不能であり、巨大な跳躍に満ちていました。私たちは単語の間でより大きなステップを踏み、その経路はより予測不可能であり、カテゴリーの中心からより遠くへ彷徨いました。私たちはまるで子供がジャングルジムで遊んでいるようで、バーからバーへとスイングし、時には出発点から遠く離れた場所に着地していました。
一方で、AIモデルは綱渡りをする人のようでした。彼らは通路のかなり近くに留まっていました。ステップはより小さく、経路はより予測可能であり、彼らが「深い森」へと足を踏み入れることは滅多にありませんでした。研究者がAIをよりワイルドにするために「ランダム性のつまみ」を最大(1.0)まで上げたとしても、ボットは人間のスタイルには到底及びませんでした。彼らは依然として慎重すぎて、密集しすぎていたのです。
「温度」の罠
あなたはこう思うかもしれません。「AIのランダム性を十分に高く設定すれば、人間のように振る舞えるはずだ!」と。論文は、それが真実ではないことを示唆しています。
研究者は、8つの異なる温度設定(0.0、0.15、0.3、0.45、0.6、0.75、0.9、1.0)でAIをテストしました。
- 特定の設定において、AIは一つのテストにおいてのみ、確かに人間のように見えました。例えば、温度が0.75のとき、Claudeモデルは人間と同じくらいのサイズのステップを取りました。
- しかし、ここが落とし穴です。単一の設定で、すべての面においてAIを人間らしくさせることはできませんでした。 ステップサイズを正しく設定できても、今度はAIが予測可能になりすぎてしまいます。あるいは、遠くまで彷徨わせることができても、今度は大きなジャンプをしなくなってしまいます。
それは、ラジオのチューニングを特定の局に合わせるようなものです。音量や明瞭さを合わせることはできても、ダイヤルをいくら回しても、完璧な「人間の声」をスピーカーから出すことはできないのです。AIの「脳」は構造が異なるため、人間の記憶が持つ、あの乱雑で美しいダンスを完全に再現することはできないのです。
「ロボットの人格」が意味すること
長い間、科学者たちは、心理学の理論をテストするためにAIを「シリコン参加者」、つまり実質的な「ロボット人間」として利用できるのではないかと期待してきました。AIに質問を投げかけ、その答えを見て、AIが人間のように考えていると仮定するという方法です。
この論文は、その考えに異を唱えています。AIは流暢で賢い言葉を操ることは得意ですが、人間と同じ方法で情報を「探索」しているわけではないことを示唆しています。AIは統計に基づいて次の単語を予測するように訓練されており、最も可能性の高い選択肢を常に選ぶ、超高速の推測器のようなものです。しかし、人間は戦略と驚きの混合物を用いています。私たちは、すでに何を言ったかを記憶し、いつ全く新しいアイデアへとジャンプするかを決定する「ワーキングメモリ(作業記憶)」を持っています。AIは、たとえ人間に扮するように指示されたとしても、この特定の種類の「メンタル・ジムナスティクス(頭の体操)」が欠けているようです。
結論
この研究は、AIが「壊れている」とか、決して役に立たないようになる、といったことを証明したわけではありません。むしろ、現在のAIモデルには、安全で身近な場所に留まろうとする系統的なバイアスがあることを示唆しています。AIは局所的な探索(「ペット」の棚に留まること)には優れていますが、人間が自然に行うグローバルな探索(「海洋」の棚へ飛び移ること)には苦戦します。
したがって、AIを特定の瞬間において「少しだけ」人間らしく見せるように調整することは可能ですが、私たちの脳が言葉の世界をナビゲートする際の、あの複雑で、彷徨い、驚きに満ちた方法を完全に模倣させる方法はまだ見つかっていません。AIは強力なツールですが、現時点では、人間の精神の完璧なコピーではないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。