Hallucinations in AI Chatbots: A Comparative Analysis
本文通过文献综述和调查研究,探讨了 GPT-4、Gemini、Claude 和 Copilot 等知名 AI 聊天机器人的幻觉问题,强调了它们在学术语境下生成虚假信息和引用错误的倾向,并提出了人工审核和事实核查等缓解策略。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在过去的几年里,一种新型的计算机程序已成为写作、编程和查找信息的常用工具。这些被称为“大语言模型”的程序,是通过从互联网上获取的海量文本进行训练的。它们旨在预测句子中下一个应该出现的词,从而能够针对问题生成类似人类的响应。尽管它们非常有用,但却有一个奇特的缺陷:它们有时会极其自信地陈述完全错误的事实。研究人员将这些错误称为“幻觉”。一个幻觉可能看起来像是一个真实的事实、一段书籍中的真确引用或一行可运行的代码,但它实际上是捏造出来的。这不仅仅是一个微小的故障;当这些程序被用于学业、医疗建议或专业研究时,一个编造的事实可能会导致现实世界的混乱或危险。科学家和用户面临的问题不在于这些错误是否会发生,而在于它们发生的频率如何、哪些程序更容易出现此类问题,以及人们如何在麻烦发生前识别它们。
来自乌斯曼理工学院(Usman Institute of Technology)的一个研究小组致力于通过观察目前最流行的四种 AI 聊天机器人来理解这一问题:GPT-4、Gemini、Claude 和 Microsoft Copilot。研究人员并没有仅仅在实验室中测试这些机器,而是询问了 80 名真实用户关于他们在现实世界中的体验。他们想知道这些用户遇到虚假信息的频率如何、他们是如何注意到这些错误的,以及他们是如何修复它们的。该研究侧重于需要高准确性的任务,例如撰写学术论文、编写计算机代码和进行研究。其目标是超越技术基准,观察这些工具在依赖它们进行重要工作的普通人手中是如何表现的。
调查结果显示,即使是在最先进的系统中,幻觉也是一个持续存在的问题。大多数参与调查的人表示,他们每天或每天多次使用这些 AI 工具。他们依赖它们进行编程、研究和写作。然而,大多数人也报告说,他们经常遇到编造的信息或虚假的参考文献。研究人员发现,这些错误并非随机发生;随着对话的深入,它们往往会出现得更加频繁。在用户与机器人进行五到二十次消息交换后,程序出错并提供不一致或错误细节的可能性就会增加。这表明,你与机器交谈的时间越长,它失去对事实掌控的可能性就越大。
当用户意识到出了问题时,他们并不依赖计算机来告知自己。相反,他们利用了自己的知识。人们发现幻觉最常见的方式是当 AI 的回答与他们已知的事实相矛盾时。另一个主要的警示信号是虚假引用的出现。如果程序列出了一本无法找到或并不存在的书、研究或网站,用户会立即意识到信息是捏造的。研究表明,检测这些错误在很大程度上仍是一项人工工作。它取决于用户验证事实的能力以及他们质疑机器的意愿,而不是依赖于软件本身内置的任何自动安全开关。
研究人员还对比了四种不同的聊天机器人,以观察哪一个更安全或更可靠。他们发现每个系统都有自己的优缺点。GPT-4 因其处理复杂问题的推理能力而受到称赞;Gemini 则因其从搜索结果中提取信息的能力强而受到关注,这有助于使其回答立足于现实。Claude 以其对安全性和诚实性的关注脱颖而出,特别是在健康等敏感领域,它表现出了极高的准确性。Microsoft Copilot 则因其与其他软件工具的紧密集成而被认可,使其在生产力方面非常有用。然而,这四个模型中没有一个是完美的。它们有时仍会产生虚假的引用和不可靠的代码。研究结论指出,虽然这些工具功能强大,但它们还不足以在没有人类监督的情况下被信任,尤其是在医学或学术研究等高风险领域。
那么,该如何解决这个问题呢?调查参与者给出了明确的答案。他们不认为解决方案仅仅在于让 AI 变得更聪明。相反,他们表示,减少错误最有效的方法是要求 AI 展示其推导过程。用户压倒性地倾向于包含经过验证引用的响应,这意味着程序必须为它声称的每一个事实指向一个真实的、存在的来源。人工审核是第二受欢迎的解决方案,紧随其后的是自动事实核查系统。使用这些工具的人们渴望透明度;他们希望看到信息的来源,以便自行核实。研究人员建议,未来的改进应侧于让 AI 解释其来源并承认其不确定之处,而不是仅仅尝试生成更多的文本。
最终,这项研究凸显了当前人工智能状态的一个关键现实。这些工具正变得越来越复杂,并被用于处理更复杂的任务,但“编造事实”的问题并未消失。研究人员发现,用户意识到了这种风险,并正通过核实事实和要求证据来积极应对。对于这些系统要变得真正可靠,特别是在医疗和教育等关键领域,它们必须进化到能够为其答案提供清晰、可验证的来源。在此之前,确保准确性的责任仍然牢牢掌握在人类手中,AI 仅作为一名得力的助手,而非最终的权威。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。