Predictable Confabulations: Factual Recall by LLMs Scales with Model Size and Topic Frequency
本文确立,大型语言模型中的事实性回忆遵循一种可预测的 S 形缩放定律,该定律由模型参数量与训练数据中主题频率的综合作用驱动,能够解释特定模型家族内高达 94% 的性能方差。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,机器人的大脑里有一座巨大的图书馆。这个机器人是一个人工智能,它的工作是从这座图书馆中抽取事实来回答问题。有时,机器人能答对;有时,它会编造听起来真实但并非事实的信息。本文的作者将这些编造的事实称为“虚构”(confabulations)。
本文提出了一个简单的问题:是什么让机器人更频繁地说出真相?
研究人员测试了 38 种不同的人工智能模型(从小型到巨型),并要求它们为 24 个不同的主题列出 10 篇真实的学术论文。有些主题非常热门(如“气候变化”),而另一些则非常小众(如“农村地区辍学预防”)。随后,他们核查了机器人列出的论文是否真实存在。
以下是他们的发现,辅以一些日常类比进行解释:
1. 真相的两大要素
研究发现,能否给出正确答案取决于两个主要因素,它们像食谱中的配料一样协同作用:
- 大脑的规模(模型大小): 即人工智能的体量。这可以比作图书馆书架的大小。更大的图书馆可以容纳更多书籍,而不会让它们被压碎或混淆。
- 主题的知名度(主题频率): 即该特定主题在人工智能学习过程中所阅读的书籍中出现的频率。这可以比作图书馆中某本特定书籍的副本数量。如果一个主题在成千上万本书中被提及,人工智能对它就很熟悉;如果仅被提及几次,人工智能可能会感到吃力。
2. “信号与噪声”之战
作者使用信噪比这一概念来解释其运作机制。想象一下,你正试图在拥挤嘈杂的房间里听清朋友的低语。
- 信号: 这是关于某个主题的“真相”。如果该主题在训练数据中非常常见(如“气候变化”),信号就会响亮而清晰。
- 噪声: 这是由人工智能有限的记忆引起的干扰。如果人工智能的体量较小,它的“房间”就会被其他事实挤得满满当当,产生大量杂音。
- 结果: 要听清真相(即回忆起一个事实),信号(主题的知名度)必须足够响亮,以穿透噪声(人工智能记忆的局限性)。
3. 成功的"S 形曲线”
最有趣的发现是,这种关系并非一条直线,而是一条S 形曲线(逻辑斯蒂曲线)。想象一个斜坡,底部平坦,中间陡峭,顶部平坦。
- 平坦的底部(地板): 当人工智能非常小或主题非常生僻时,“噪声”过于响亮。人工智能根本无法听清真相。与其猜测,它开始编造模板。它可能会反复说“史密斯(1990)撰写了关于 X 的文章”,仅仅使用“史密斯”这样的常见名字来填充空间。它并非试图撒谎,只是真实数据已经耗尽。
- 陡峭的中间(斜坡): 随着人工智能变大或主题变得更受欢迎,信号开始穿透噪声。正是在这里,人工智能的表现会迅速显著提升。体量或数据频率的微小增加,会带来真实性的巨大飞跃。
- 平坦的顶部(天花板): 最终,人工智能变得如此庞大,主题变得如此普遍,以至于它触及了极限。它已经记住了关于该主题几乎所有能记住的内容。再增大人工智能的体量也无济于事,因为已经没有更多的事实可寻。
4. “长尾”问题
该论文强调了一个严重的不平等现象:人工智能在记住热门事物(曲线的“头部”)方面表现出色,但在记住罕见事物(“尾部”)方面却表现糟糕。
- 类比: 想象一个广播电台反复播放前 40 名热门金曲。你总能清晰地听到这些热门歌曲。但如果你试图收听一首仅在 1995 年播放过一次的歌曲,杂音就会将其淹没。
- 发现: 即使是测试中最大的模型(拥有数万亿参数),在处理最冷门的话题时也举步维艰。要让人工智能记住一个非常罕见的事实,使其效果等同于记住一个热门事实,你需要将人工智能的体量扩大到所测试的最大模型的30 倍。这是一个巨大的飞跃!
5. 这对未来的意义(根据论文所述)
作者得出结论,“幻觉”(即编造事物)并非随机错误,而是试图将庞大且不均匀的信息世界压缩进有限内存所产生的可预测结果。
- 并非随机: 如果主题生僻且人工智能体量小,它必然会犯错。
- 结构性问题: 人工智能并非在“撒谎”;只是该事实的信号太弱,无法克服其有限记忆带来的噪声。
- 解决方案: 要解决罕见主题的问题,要么需要将人工智能的体量大幅扩大(成本高昂),要么正如论文建议的那样,采用不同的策略,例如“检索增强”(让 AI 使用搜索引擎查找答案,而不是依赖其记忆)。
简而言之: 该论文证明,人工智能说真话的能力是其体量与主题知名度的数学可预测组合。如果主题生僻且人工智能体量小,预期它会编造内容;如果主题著名且人工智能体量巨大,它很可能会答对。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。