Adam's Law: Textual Frequency Law on Large Language Models
该论文提出了“文本频率定律”(TFL),主张在提示和微调中优先使用高频文本,并通过构建包含文本频率估计、频率蒸馏及课程式频率训练(CTFT)的框架,在数学推理、机器翻译等任务上验证了该策略对大语言模型的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文提出了一个关于大型语言模型(LLM)的有趣发现,作者将其称为**“亚当定律”(Adam's Law),或者更学术一点叫“文本频率定律”**。
为了让你轻松理解,我们可以把语言模型想象成一个**“读过无数本书的超级学霸”**。
1. 核心发现:学霸喜欢“熟词”
想象一下,如果你让这位学霸做一道数学题,或者让你用外语翻译一句话。
- 情况 A(低频表达): 你用的词汇非常生僻、句式非常拗口,就像用古英语或者极其复杂的学术黑话在提问。
- 情况 B(高频表达): 你用的词汇是日常生活中大家天天都在说的,句式也是大家最熟悉的“大白话”。
论文的核心结论是: 即使情况 A 和情况 B 的意思完全一样,学霸在情况 B(高频表达)下表现得好得多! 他答对的概率更高,翻译得更准。
这就好比:
- 你问:“请阐述一下‘光合作用’的机理。”(高频,大家常听) -> 学霸答得头头是道。
- 你问:“请详述‘叶绿体将光能转化为化学能之过程’。”(低频,虽然意思一样,但词太生僻) -> 学霸可能会卡壳,或者答错。
定律很简单: 在意思不变的前提下,越“常见”、“越顺口”的说法,大模型越容易理解,表现也越好。
2. 他们是怎么发现这个规律的?(三个步骤)
作者为了验证这个定律,设计了一套像“烹饪”一样的流程:
第一步:找食材(文本频率定律 TFL)
他们发现,很多大模型的训练数据是保密的(像黑盒子),我们不知道它具体读了什么。于是,他们利用互联网上的公开数据(就像去超市看什么菜卖得最火)来估算哪些句子是“高频”的,哪些是“低频”的。
- 比喻: 就像厨师知道“番茄炒蛋”是国民菜(高频),而“松露鹅肝拌鱼子酱”是稀有菜(低频)。
第二步:尝味道(文本频率蒸馏 TFD)
既然不知道模型到底“吃”过什么,作者就想了个招:让模型自己把故事“续写”完。
- 比喻: 你给模型讲个开头,让它把故事编下去。如果它编出来的故事里,某些词出现得特别多,那就说明这些词在它脑子里“根深蒂固”。通过这种方式,他们能更精准地知道模型觉得哪些表达是“熟悉”的。这就像通过观察学霸的笔记,发现他特别擅长用某些特定的成语。
第三步:按难度上课(课程式频率训练 CTFT)
这是最精彩的一步。通常我们训练模型是随机扔题给它。但作者提出,应该像教小学生一样**“循序渐进”**。
- 比喻: 不要一上来就教微积分(低频、难懂的表达)。应该先教"1+1=2"(高频、简单的表达),等它熟练了,再慢慢增加难度。
- 操作: 在微调模型时,先让它做那些“高频、顺口”的题,等它状态好了,再让它做“低频、拗口”的题。结果发现,这样教出来的模型,最后解题能力最强。
3. 实验结果:真的有用吗?
作者做了很多实验,包括做数学题、翻译各种语言、还有让模型控制工具(比如帮人查天气、订票)。
- 数学题: 用“大白话”问模型,它算对题的概率从 60% 多提升到了 80% 多。
- 翻译: 把一句生僻的英文翻译成中文,如果用“高频”的英文问它,翻译质量(流畅度、准确度)显著提升。
- 结论: 只要把输入给模型的“话”改得更像日常口语(高频),模型就能发挥得更好。
4. 这对我们普通人意味着什么?
这篇论文给所有使用大模型的人(包括程序员和普通人)提了一个醒:
“怎么问”比“问什么”有时候更重要。
如果你发现模型回答得不好,不要急着换模型,试着把问题改得更简单、更口语化、更像大家平时说的话。
- ❌ 低效问法: “请基于量子力学的不确定性原理,阐述观测行为对微观粒子波函数坍缩的潜在影响。”(太拗口,模型可能懵)
- ✅ 高效问法: “为什么看东西的时候,东西的状态会变?请用简单的话解释一下。”(高频、通俗,模型秒懂)
总结
这就好比**“沟通的艺术”**。大模型虽然聪明,但它也是个“人”,它更喜欢听它熟悉、常听到的话。这篇论文告诉我们:在这个 AI 时代,学会用“高频”的语言去和 AI 对话,能让它变得更聪明、更听话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。