Hallucinations in AI Chatbots: A Comparative Analysis
本論文は、文献レビューおよび調査を通じて、GPT-4、Gemini、Claude、Copilotといった主要なAIチャットボットにおけるハルシネーション(幻覚)を調査し、学術的な文脈において捏造された情報や引用エラーを生成する傾向を浮き彫りにするとともに、手動によるレビューやファクトチェックといった軽減策を提案するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ここ数年、執筆、コーディング、情報の検索のための一般的なツールとして、新しい種類のコンピュータプログラムが登場しました。大規模言語モデルとして知られるこれらのプログラムは、インターネット上の膨大なテキストを用いて学習されています。これらは、文章の中で次にくるべき単語を予測するように設計されており、質問に対して人間のような応答を生成することができます。非常に有用である一方で、これらには奇妙な欠陥があります。それは、全くの嘘を、さも真実であるかのように自信満々に述べてしまうことがある点です。研究者たちは、こうしたエラーを「ハルシネーション(幻覚)」と呼んでいます。ハルシネーションは、実在する事実や、本からの正当な引用、あるいは動作するコードの行のように見えることもありますが、実際には捏造されたものです。これは単なる軽微な不具合ではありません。これらのプログラムが学校の課題や医療のアドバイス、あるいは専門的な研究に使用される際、作り話の事実は現実世界での混乱や危険を招く可能性があります。科学者とユーザーの両方が直面している問いは、こうしたエラーが発生するかどうかではなく、どの程度の頻度で発生するのか、どのプログラムが最もそれを起こしやすいのか、そして人々がいかにしてトラブルが起きる前にそれを見抜くことができるのかという点です。
ウスマン・インスティテイト・オブ・テクノロジーの研究チームは、現在利用可能な最も人気のある4つのAIチャットボット、すなわちGPT-4、Gemini、Claude、Microsoft Copilotを調査することで、この問題の理解に乗り出しました。研究者たちは、単にラボの中で機械をテストするのではなく、80人の実際のユーザーに対し、彼らの現実世界での経験について尋ねました。彼らは、ユーザーがどの程度の頻度で誤った情報に遭遇したのか、どのようにそのエラーに気づいたのか、そしてそれをどのように修正したのかを知りたいと考えました。研究は、学術論文の執筆、コンピュータコードの記述、リサーチといった、高い正確性を必要とするタスクに焦点を当てました。その目的は、技術的なベンチマークを超えて、これらのツールが、重要な仕事に従事する一般の人々の手の中でどのように振る舞うのかを明らかにすることでした。
調査の結果、ハルシネーションは、最も高度なシステムにおいてさえも根強い問題であることが明らかになりました。調査の回答者の多くは、これらのAIツールを毎日、あるいは一日に数回使用していると答えました。彼らはコーディング、リサーチ、執筆のためにそれらに頼っています。しかし、大多数の人が、作り物の情報や架空の参考文献に頻繁に遭遇しているとも報告しました。研究者たちは、これらのエラーはランダムに発生するのではなく、会話が長くなるにつれて発生しやすくなる傾向があることを発見しました。ユーザーがボットと5回から20回のメッセージをやり取りした後には、プログラムがミスをして、矛盾した詳細や誤った情報を提供する可能性が高まります。これは、機械との対話が長くなればなるほど、真実への把握力を失いやすくなることを示唆しています。
ユーザーは、何かがおかしいと気づいたとき、コンピュータに教えてもらうことはしませんでした。代わりに、自分自身の知識を用いました。人々がハルシネーションを見抜いた最も一般的な方法は、AIの回答が、自身がすでに正しいと知っている事柄と矛盾したときでした。もう一つの大きな警戒信号は、偽の引用の存在でした。もしプログラムが、見つけることができない、あるいは存在しない本、研究、またはウェブサイトを挙げた場合、ユーザーは即座にその情報が捏造されたものであると判断しました。この研究は、こうしたエラーの検出は依然として主に人間の仕事であることを示しました。それは、ソフトウェアに組み込まれた自動的な安全装置ではなく、事実を検証する能力や、機械に疑問を投げかける意思を持つという、ユーザー自身の能力に依存しているのです。
研究者たちはまた、4つの異なるチャットボットを比較し、どれがより安全で信頼できるかを調べました。その結果、各システムには独自の強みと弱みがあることがわかりました。GPT-4は複雑な問題を論理的に解く能力が高く評価され、Geminiは検索結果から情報を引き出す強力な能力に注目が集まり、それが回答を現実に即したものにするのに役立っています。Claudeは、特に健康などのデリケートな領域における安全性と誠実さに重点を置いていることで際立ち、高い正確性を示しました。Microsoft Copilotは、他のソフトウェアツールとの緊密な統合が認められ、生産性の向上に有用です。しかし、4つのモデルの中に完璧なものは一つもありませんでした。すべてにおいて、時として誤った引用や信頼できないコードが生成されました。研究は、これらのツールは強力ではあるものの、特に医学や学術研究のような重大な局面においては、人間の監視なしに使用できるほど信頼できる段階にはまだ達していないと結論付けました。
では、これを解決するために何ができるのでしょうか? 調査の参加者たちは明確な答えを提示しました。彼らは、解決策が単にAIを賢くすることにあるとは考えていませんでした。代わりに、最も効果的な方法は、AIに「プロセス(根拠)を示す」ことを要求することだと彼らは述べました。ユーザーは圧倒的に、検証済みの引用を含む回答を好みました。つまり、プログラムが主張するあらゆる事実に対して、実在するソースを指し示さなければならないということです。人間によるレビューが2番目に人気の高い解決策であり、次いで自動的なファクトチェック・システムが挙げられました。ツールを使用している人々は透明性を求めています。彼らは、自分たちで確認できるように、情報の出所を知りたいと考えているのです。研究者たちは、将来の改善は、単により多くのテキストを生成しようとするのではなく、AIがソースを説明し、確信が持てないときにそれを認めるようにすることに焦点を当てるべきだと示唆しています。
結局のところ、この研究は、現在の人工知能の状態に関する極めて重要な現実を浮き彫りにしています。これらのツールはより洗練され、より複雑なタスクに使用されるようになっていますが、物事をでっち上げるという問題は解消されていません。研究者たちは、ユーザーがリスクを認識しており、事実を再確認したり証拠を求めたりすることで、積極的にその回避策を講じていることを見出しました。これらのシステムが、特にヘルスケアや教育といった重要な分野において真に信頼できるものとなるためには、回答に対して明確で検証可能なソースを提供できるように進化しなければなりません。それまでは、正確さに対する責任は、AIを単なる「便利な助手」とし、最終的な権威とはせず、依然として人間の手にしっかりと委ねられているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。