A Rigorous Turing Test: a Foundation for Evaluating Artificial General Intelligence
本論文は、大規模言語モデルがチューリング・テストに合格したという主張は時期尚早であると論じており、その理由は、チューリングのオリジナルのイミテーション・ゲームを厳格かつ制約のない形で実施したところ、先行研究で使用された可能性のあるより短い制限時間とは異なり、人間の判定員がAIを人間から容易に識別できたためである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
メッセージを読んでいるだけで、相手が実在の人間なのか、それとも超スマートなロボットなのか判別できない世界を想像してみてください。これは「チューリング・テスト」と呼ばれる有名な概念の核心であり、数十年にわたり科学者、哲学者、そして好奇心旺盛な人々の間で議論を巻き起こしてきた概念です。これを究極の「インポスター・ゲーム(なりすましゲーム)」と考えてみてください。このゲームでは、人間の判定者が、画面越しに隠れた2人のプレイヤーとチャットを行います。一方は人間であり、もう一方は機械です。判定者の仕事は、どちらがどちらであるかを突き止めることです。もし機械が判定者を騙して自分を人間だと思い込ませることができれば、そのテストに合格したことになります。これは単なる遊びではありません。機械が本当に私たちのように「考える」ことができるのかという深刻な問いなのです。人工知能が物語を書いたり、数学の問題を解いたり、友人のようにチャットしたりすることが上手くなるにつれ、人々はこう問いかけています。「私たちはついに、私たちを欺くことができる機械を作り上げたのだろうか?」と。もしそうなら、それはテクノロジー、法律、そして人間であることの意味に対する私たちの見方を根底から変えてしまうことになります。
ここで、この論争に決着をつけるべく、非常に厳格で、非常に慎重な実験を行うことにした研究チームが登場します。彼らは、GPT-4-Turboとして知られるトップレベルのAIが、実際にチューリング・テストに合格できるかどうかを確認したいと考えました。しかし、ここにはひねりがあります。彼らはただゲームをしたのではなく、1950年にテストの創始者であるアラン・チューリングによって書かれた、オリジナルの厳格なルールに従ってプレイしたのです。これまでの多くの研究では、AIがテストに合格したと主張されてきましたが、研究者たちは、それらのゲームはわずか5分間で会話を打ち切るなどの「ショートカット」が行われたのではないかと疑っていました。彼らは、時間制限を取り払い、まるで友人同士のリアルなチャットのように、会話を自然に流させた場合に何が起こるのかを見たいと考えたのです。
結果は驚くべきものであり、AIへの期待に対する現実的な再確認となりました。彼らの厳格な実験において、人間の判定者たちは、完璧なスコアではないものの、多くの場合でロボットを見破ることができました。AIが人間になりすまそうとした37回のゲームのうち、判定者は16回で正しくコンピュータを特定しました。これは43%の成功率を意味し、つまりAIは過半数のゲームで判定者を欺くことに成功したことを意味します。しかし、研究者たちは、判定者のパフォーマンスはランダムな推測と比較して統計的に有意であった一方で、AIは依然としてほとんどの試行において判定者を欺いたことを発見しました。この研究は、AIがいかに印象的な響きを持っていたとしても、少なくともこれらの厳格な条件下では、まだ「人間であること」の技術を完全に習得しているわけではないことを示唆しています。なぜなら、AIは捕まるよりも頻繁に判定者を欺いたからです。
この研究の中で最も興味深い部分の一つは、ゲームにどれくらいの時間がかかったかという点でした。以前の実験では、判定者にわずか5分で決断を下すよう強いることがよくありました。研究者たちは、判定者にじっくり時間を取らせると、ゲームがはるかに長引くことを発見しました。「人間対ロボット」のゲームは平均して約14分かかり、「男性対女性」のゲームはさらに長く、約24分かかりました。このことは、他の研究で使用された5分間の制限が短すぎ、判定者が誰であるかを本当に判断する前に、素早く推測せざるを得なかった可能性があることを物語っています。十分な時間が与えられたとき、判定者はロボットをより頻繁に捕まえるほど鋭くなっていましたが、それでもAIはほとんどの会話において持ちこ批をしませんでした。
研究者たちはまた、初期の研究で試みられたように、AIが例えば若いティーンエイジャーのような特定のタイプの人格を演じることで人々を騙せるかどうかも調査しました。こうしたトリックを用いても、長く急かされない会話の中では、AIは短いテストの時ほど頻繁に判定者を欺くことはできませんでした。研究は、AIがすでにチューリング・テストに合格したという主張は時期尚早である可能性が高いと結論づけています。それはAIが愚かであるということではなく、人間が十分に考え、チャットする時間を与えると、ロボットの「仮面」は完全には外れずとも、綻びが見え始めるということです。
では、これは将来にとって何を意味するのでしょうか? 研究者たちは、チューリング・テストが、機械が真に知的であるかどうかを確認するための不可欠なツールであり続けていると考えています。彼らは、AIの勝利を宣言するのはまだ早いと考えています。むしろ、私たちはテストを続け、ルールを洗練させ続け、難しい問いを投げかけ続けるべきだと示唆しています。ある研究者が述べたように、このテストは今後何年にもわたって、私たちが機械の知性を理解する方法の中心であり続けるかもしれません。AIが、時間的なプレッシャーのない、リラックスした長い会話の中で一貫して人間の判定者を欺くことができるようになるまで、「機械は考えることができるのか?」という問いは開かれたままであり、ロボットはいまだに、その部屋に紛れ込んだインポスター(詐欺師)なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。