💬 NLP
Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models
该研究通过多种范式在三种不同架构的大语言模型中发现,尽管训练数据的统计特性足以使模型内部形成符合韦伯定律的对数压缩几何表征,但这种表征几何本身并不足以保证模型具备人类水平的行为判别能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给大型语言模型(LLM)做一场“心理物理学体检”。研究人员想知道:当 AI 处理数字、时间或空间大小时,它的大脑(内部神经网络)里到底长什么样?
为了让你轻松理解,我们可以把AI 模型想象成一个超级图书馆管理员,把数字大小想象成书的厚度。
以下是这篇论文的核心发现,用大白话和比喻来解释:
1. 核心发现:AI 的“尺子”是压缩过的(对数几何)
以前的争论:有的科学家说 AI 把数字排得像楼梯一样均匀(线性);有的说 AI 把数字排得像压缩饼干一样,小数字挤在一起,大数字拉得很开(对数)。
这篇论文的结论:AI 的“尺子”确实是压缩过的。
- 比喻:想象你在画一张地图。如果要把整个地球画在一张纸上,你肯定不能把 1 米和 1000 公里画得一样长。你会把小地方画得大一点,大地方画得小一点,这样小细节才能看清。
- AI 的做法:AI 在处理数字时,自动把"1"到"10"画得很宽,把"100"到"1000"画得很窄。这种“压缩”方式非常符合韦伯定律(Weber's Law)——这是人类感知世界的规律(比如你很难分辨 100 克和 101 克的区别,但很容易分辨 10 克和 11 克)。
- 为什么?因为互联网上的文字里,小数字出现的频率远高于大数字(就像书里提到"1"次比提到"1000"次多得多)。AI 为了高效利用空间,自动学会了这种“压缩编码”。这不需要像人类大脑那样有生理限制,纯粹是数据训练出来的。
2. 最大的反转:有“尺子”不代表会“用尺子”
这是论文最有趣的地方。研究发现,AI 脑子里有完美的“压缩尺子”,但这并不代表它能像人一样去比较大小。
- 比喻:想象有两个学生,小明(Llama 模型)和小红(Mistral 模型)。
- 他们俩的脑子里都画着同样完美的“压缩地图”(几何结构一样好)。
- 但是,当老师问“哪个数更大?”时:
- 小明能看懂地图,给出正确答案,而且他的判断符合人类的直觉(比如觉得 10 和 11 很难分,10 和 20 很容易分)。
- 小红虽然脑子里也有地图,但她不会用。她要么瞎猜(50% 正确率),要么死板地数数字位数(比如觉得"100"比"99"大,不是因为数值,而是因为"100"有三个数字)。
- 结论:光有“内部结构”(几何)是不够的,还需要学会“怎么读图”(行为能力)。
3. 时间、空间 vs. 数字:为什么 AI 在时间上“瞎了”?
研究发现,AI 在处理数字时很聪明,但在处理时间(比如"5 分钟”vs"1 小时”)和空间(比如"1 米”vs"1 公里”)时,虽然脑子里也有压缩地图,但完全不会比较大小,只能瞎猜。
- 原因:单位太乱了。
- 数字"47"永远就是"47"。
- 但时间可以是"5 分钟”,也可以是"300 秒”。在 AI 眼里,这就像是两本完全不同的书,它没学会把它们换算成同一个单位。
- 比喻:AI 就像个只认识“苹果”和“梨”的人,但如果你问它"1 公斤苹果”和"2 斤梨”哪个重,它因为没学过单位换算,就懵了。
4. 谁在干活?早期层 vs. 晚期层
AI 有很多层(就像洋葱有很多皮)。研究人员发现了一个反直觉的现象:
- 晚期层(洋葱最里面):这里的“地图”画得最清晰、最完美(几何结构最强)。
- 早期层(洋葱最外面):这里的“地图”画得比较模糊。
- 真相:当 AI 真正做“比较大小”这个动作时,它其实是在用早期层(外面那层)的信息!晚期层虽然画得漂亮,但在这个任务里只是个“装饰品”,并不参与实际计算。
- 比喻:就像盖房子,地基(早期层)虽然看起来粗糙,但真正支撑房子的是它;而顶层的豪华装修(晚期层)虽然看起来最气派,但如果你要拆房子,拆掉装修房子不会塌,拆掉地基才会塌。
5. 训练方式决定了“会不会用”
- 预训练(Pre-training):就像让 AI 读遍天下书。这一步让 AI 学会了“压缩地图”(几何结构)。不管读什么书,这个结构都会自动形成。
- 指令微调(Instruction Tuning):就像给 AI 上培训班,教它怎么回答问题。
- 小明(Llama):培训后学会了看地图做题。
- 小红(Mistral):培训没到位,虽然脑子里有地图,但不知道怎么用,或者用错了方法。
- 结论:几何结构是“天赋”(数据练出来的),但能不能解决问题是“技能”(指令微调练出来的)。
总结
这篇论文告诉我们:
- AI 确实像人类一样,在脑子里用“压缩”的方式理解大小(符合韦伯定律),这是因为互联网数据的分布规律决定的。
- 但是,AI 并不总是像人类一样思考。它可能拥有完美的内部地图,却因为没有学会“单位换算”或“读图技巧”,导致在具体任务上表现得很笨。
- 最聪明的地方不一定在干活:AI 最深层的“完美结构”可能只是用来存信息的,真正干活的是那些看起来没那么完美的浅层网络。
简单来说:AI 学会了“怎么画地图”,但能不能“按图索骥”,还得看它后来有没有被教好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。