Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs
本文介绍了 SciFactCheck,这是一个多领域基准测试,它揭示了科学领域的微调反而增加了大型语言模型的幻觉和断言性,同时降低了其内部置信度,从而对目前旨在提高事实性的领域特定微调方法提出了挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢、博学多才的图书管理员,他几乎通晓百科。这位图书管理员就是你的标准大语言模型(LLM)。他很擅长聊天,但当他不确定事实时,有时会编造内容。这被称为“幻觉”。
现在,想象一下你把这位图书管理员送往一所专门研究科学的大学进行深造。你给了他数以千计的教科书、研究论文和期刊。你期望他回来时能成为一名“科学专家”,甚至比以前更加可靠。
这篇论文是对那场实验的一份成绩单,而新闻结果却出人意料地糟糕。
以下是研究人员通过简单的类比得出的发现:
1. “专家”反而变差了
研究人员创建了一个大规模测试,名为 SCIFACTCHECK。他们要求 18 个不同的 AI 模型(有些是通用的,有些是经过“科学训练”的)针对 2,500 个不同的科学主题(从工程学到哲学)撰写短段落。
结果: “科学型”模型犯的错误实际上比通用型模型更多。
- 类比: 这就像带一名普通厨师去烹饪学校学习香料知识。你会预期他们更擅长烹饪,但相反,他们开始忘记如何烧开水,并且在每道菜里都放了过量的调料。这种专门化的训练似乎让模型产生了混乱,使其在基础事实上的可靠性甚至不如其通用型的“表亲”。
2. 三种类型的“谎言”
研究不仅观察了“错误”的答案,还观察了它们是“如何”错误的。他们发现了模型产生幻觉的三种特定方式:
- “无法证实”的谎言(不可验证性/Unverifiability): 模型编造了一个听起来很真实、但在任何书籍或论文中都找不到的事实。
- 类比: 图书管理员说:“在 1995 年,一个秘密的猫类组织统治了互联网。”这听起来很具体,但没有任何记录证明这件事的存在。
- “过度自信”的谎言(过度断言/Overclaim): 模型将一个小事实放大成一个巨大的、绝对的确定性结论。
- 类比: 一项研究说:“这种药物可能对某些患者有帮助。”模型却说:“这种药物可以治愈所有人。”它夸大了范围和确定性。
- “虚假引用”的谎言(归因错误/Attribution): 模型为了支持自己的观点而捏造了一个来源。
- 类比: 图书管理员说:“根据著名的《空间物理学杂志》中史密斯博士的文章……”但那篇文章和那位医生根本不存在。
3. “自信但无知”的悖论
其中一个最奇怪的发现是关于模型对自己答案的“感觉”。
- 发现: 经过科学训练的模型使用了更自信的语言(如“肯定”、“证明”、“总是”),但它们的内部置信度(其计算机“直觉”)实际上却很脆弱。
- 类比: 想象一个学生不知道数学题的答案。他没有说“我不确定”,而是站起来举手,并带着 100% 的信念大声喊出答案。他们学会了自信科学家的“风格”,但并未学会其“实质内容”。他们是“大声地胡说八道”。
4. “事实核查员”问题
最后,研究人员尝试用计算机来给这些模型评分,然后又请人类专家来进行评分。
- 结果: 计算机评分员和人类专家并不总是一致。甚至人类本身也很难就什么是可以被核查的“科学事实”达成共识。
- 类比: 这就像有一组裁判试图为一套体操动作评分,但他们甚至无法就这项运动的规则达成一致。在数学等领域,大家对规则都有共识;但在哲学或社会科学等领域,很难定义什么是“可核查的”。
总结
论文得出结论:仅仅通过科学书籍来训练 AI,并不能使其成为值得信赖的科学专家。事实上,这可能会让它变得更危险,因为它听起来更自信,但准确性却更低。我们需要更好的工具来验证科学主张,我们不能仅仅假设“专业化”的 AI 自动就比“通用型” AI 更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。