Pretraining Exposure Explains Popularity Judgments in Large Language Models
通过利用完全可观测的 Dolma 语料库和 OLMo 模型,本研究证明大语言模型的流行度判断主要由预训练暴露统计数据驱动,而非外部现实世界的流行度信号,其中暴露程度比维基百科页面浏览量更能准确预测模型偏差。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个巨大的数字大脑(大型语言模型,或称 LLM),它几乎阅读了互联网上的所有内容。你问这个大脑:“一家特定的本地面包店和一位世界闻名的流行歌星,谁更出名?”这个大脑几乎总是回答流行歌星。我们长期以来一直认为,这是因为大脑“知道”这位流行歌星在现实世界中很受欢迎。
但这篇论文提出了一个不同的问题:这个大脑实际上是在评判现实世界的知名度,还是仅仅在回忆它在学习期间看到次数最多的名字?
为了找到答案,研究人员使用了一个特殊的、完全开源的大脑,名为OLMo。与大多数 AI 大脑不同,我们可以确切地看到 OLMo 在其“求学”(预训练)期间阅读了哪些书籍和网站。这就像拥有了学生全部的家庭作业图书馆,而不仅仅是根据考试成绩来猜测他们读了什么。
以下是他们实验和发现的分解,使用了一些简单的类比:
1. 设置:计算“瞥见”次数
研究人员将 AI 的训练数据视为一个巨大的图书馆。他们使用一种特殊工具(Infini-Gram)来精确计算 2000 个不同事物(人物、地点、品牌、歌曲)在 AI 阅读的书籍中出现了多少次。
- “曝光”分数:这只是 AI“瞥见”某个名字次数的统计。如果 AI 看到了 100 万次"Taylor Swift",而只看到了 5 次“本地面包师 Bob",那么 Taylor Swift 就拥有很高的曝光分数。
2. 三位竞争者
研究人员希望看看哪种“分数”最能预测 AI 如何回答关于知名度的问题。他们比较了三个方面:
- 现实世界分数(维基百科):他们查看了实际有多少人访问了这些实体的维基百科页面。这是现实世界知名度的“事实依据”。
- “直接”猜测:他们问 AI:“在 0 到 1000 的尺度上,Taylor Swift 有多出名?”
- “正面交锋”对决:他们问 AI:"Taylor Swift 和本地面包师 Bob,谁更出名?”(这就像锦标赛对阵表)。
3. 重大发现:关键在于读了什么,而非知道了什么
结果令人惊讶且清晰:
- AI 的“记忆”与图书馆相匹配:AI 对什么是出名的看法,与其“曝光分数”(看到名字的频率)的匹配度,远高于其与现实世界维基百科数据的匹配度。
- “正面交锋”是最好的镜子:当 AI 被要求直接比较两件事物(如锦标赛)时,它的回答与其训练书籍中看到这些名字频率的对应关系几乎完美。这甚至比现实世界的维基百科数据还要吻合。
- “长尾”问题:对于非常冷门的事物(如“本地面包师 Bob”),维基百科数据往往杂乱无章或根本不存在(没人访问那些页面)。然而,AI 仍然对谁更出名有明确的看法。为什么?因为即使 AI 只看到了 5 次“本地面包师 Bob"和 2 次“另一位面包师”,它也知道前者“更出名”,仅仅是因为它看到这个名字的次数稍微多了一点。AI 并没有利用现实世界的知识;它只是在数它的家庭作业。
4. 大脑越大 = 记忆越强
研究人员测试了一个较小的大脑(70 亿参数)和一个较大的大脑(320 亿参数)。
- 较大的大脑对其训练数据的痴迷程度甚至更高。它的回答与“曝光分数”的吻合度比较小的大脑还要紧密。
- 这表明,随着 AI 变得更聪明、更庞大,它并不一定变得对现实世界更“有意识”;它只是变得更擅长记住它在训练期间被喂入的确切内容。
核心结论
该论文得出结论:当 AI 告诉你谁出名时,它并不一定是在向你提供关于现实社会的报告。它提供的是关于它自己的阅读清单的报告。
想象一个只读过某一本特定杂志的学生。如果你问那个学生:“世界上谁最出名?”他不会告诉你实际最出名的人是谁;他会告诉你那本杂志封面上出现次数最多的人。AI 的“知名度偏见”仅仅是其训练数据中词语频率的反映,而非对世界的真正理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。