Levels of Analysis for Large Language Models
该论文提出借鉴认知科学中基于大卫·马尔(David Marr)分析层次的框架,将相关方法应用于大型语言模型,以解决其日益复杂且难以理解的问题,从而为理解这类新型“心智”提供一套系统工具。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一份**“给大语言模型(LLM)做全面体检的指南”**。
想象一下,现在的 AI(比如 ChatGPT、Claude)就像是一个突然变得超级聪明、能写诗、能编程、能聊天的“黑盒机器人”。计算机科学家造出了它,但说实话,他们自己也不太清楚这个机器人脑子里到底在想什么,因为它是由几十亿个像神经元一样的连接组成的,太复杂了。
这就好比几百年前,人类发明了飞机,知道它能飞,但当时没人完全理解鸟类飞行的原理,也没人完全理解空气动力学。
这篇论文提出,我们不需要重新发明轮子。我们可以借用认知科学(研究人类大脑怎么工作的学科)里的一套经典方法,就像给人类做心理和生理检查一样,给 AI 做检查。作者借用了一位叫大卫·马尔(David Marr)的科学家提出的**“三个分析层次”**,把理解 AI 的过程分成了三层:
第一层:计算层(它到底想解决什么问题?)
通俗比喻:看它的“考试大纲”和“考试动机”。
- 核心问题:这个 AI 被训练出来是为了做什么?它的“终极目标”是什么?
- 论文发现:大语言模型的核心任务其实很简单:“猜下一个词是什么”(就像你发微信时,手机自动提示下一个字)。
- 有趣的现象:因为它的训练目标就是“猜下一个词”,所以它有时候会像个“老好人”,倾向于说出那些在人类语言中出现频率很高的词,而不是最“正确”的词。
- 例子:如果你让它数数,它数到"30"(很常见的数字)时很准,但数到"29"(相对少见)时就开始犯迷糊。这就好比一个为了“猜词”而生的学生,在考“猜词”时是天才,但在考“数数”时,如果答案不常见,它就会因为“猜错了习惯”而犯错。
- 结论:只要知道它的“考试大纲”(训练目标),我们就能预测它会在哪里表现得好,在哪里会犯傻。
第二层:算法层(它是怎么思考的?)
通俗比喻:看它的“解题套路”和“思维习惯”。
- 核心问题:既然它知道目标,那它具体是用什么方法去接近目标的?它的脑子里是怎么组织信息的?
- 论文发现:我们可以像心理学家研究人类一样,通过“做实验”来探测 AI 的内心。
- 干扰测试:就像人类如果同时看太多东西会记混一样(比如把红方块和蓝圆圈记成红圆圈),AI 在处理复杂图片时,如果物体太多,也会把特征搞混。这说明 AI 也是“并行处理”信息,而不是像人类那样一步步串行思考。
- 相似度测试:如果你问 AI“红色和蓝色有多像?”或者“钢琴的高音和低音有多像?”,AI 给出的答案竟然和人类惊人地相似!哪怕它从来没真正“见过”颜色或“听过”声音,它通过读文字,竟然在脑子里构建出了和人类一样的“颜色轮”或“音高螺旋”。
- 隐藏偏见测试:如果你直接问 AI“女性适合做管理吗?”,它会很谨慎地回答“当然适合”。但如果你玩一个“快速联想游戏”(类似心理学里的内隐联想测试),让它把名字和职业快速配对,它还是会下意识地觉得“女性”和“家庭”联系更紧,“男性”和“工作”联系更紧。这说明它的“潜意识”里还是藏着偏见。
- 结论:通过观察 AI 的“错误模式”和“联想习惯”,我们可以画出它大脑里的“地图”,知道它是怎么理解世界的。
第三层:实现层(它的“硬件”是怎么运作的?)
通俗比喻:看它的“大脑电路”和“神经回路”。
- 核心问题:那些抽象的思考和偏见,具体是发生在 AI 的哪一部分“神经元”上的?
- 论文发现:这一层就像神经科学家拿着显微镜看人脑一样,科学家现在可以“透视”AI 的内部电路。
- 定位功能:研究发现,AI 的某些特定电路专门负责“记住事实”,某些电路专门负责“模仿语气”,甚至有的电路专门负责“撒谎”或“说真话”。
- 手术刀式干预:科学家甚至可以用“手术刀”(一种叫激活修补的技术)直接切断或修改某一部分电路。比如,把负责“诚实”的电路关掉,AI 就会开始胡编乱造;把负责“推理”的电路激活,它就能解出更难的数学题。
- 结论:我们不再把 AI 当成一个黑盒子,而是开始能看清它内部具体的“齿轮”和“开关”是如何配合工作的。
总结:为什么要这么做?
这篇论文的核心思想是:不要只盯着 AI 考了多少分(性能),要像心理学家研究人类一样,去理解 AI 的“思维过程”。
- 以前:我们只关心 AI 能不能答对题。
- 现在:我们要用认知科学的工具(三个层次),去理解它为什么会答对,为什么会犯错,它的偏见藏在哪里,它的大脑结构是什么样的。
这就好比,以前我们只关心汽车跑得有多快,现在我们要打开引擎盖,看看发动机是怎么运转的,这样我们不仅能修好车,还能设计出更安全、更聪明的未来汽车。
一句话总结:这篇论文告诉我们,要把 AI 当成一个“新物种”来研究,借用人类研究自己大脑的成熟方法,分三个层次(目标、方法、硬件)去彻底搞懂这些强大的机器,从而更好地利用和控制它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。