Optimization Is Not All You Need
该论文认为,大型语言模型的对齐代表了一种更广泛的“优化文化”,这种文化错误地将可衡量的进步等同于价值,并最终将判定合法语言的权威委托给了那些能够测量概率、却无法区分错误与真正创造之间的技术装置。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一个神奇的、无限的讲故事机器人。2019年,当这个机器人第一次醒来时,它还有点狂野。它会讲述关于安第斯山脉四角独角兽的故事,或者突然从新闻报道切换到一首关于烤面包机的诗。它有时会犯错,但这些错误往往既有趣、又令人惊喜,甚至带着一种奇特的优美。它就像一位爵士乐手,偶尔弹错一个音符,却能将其转化为一段全新的、酷炫的旋律。
但随后,机器人的主人决定“修复”它。他们希望它变得完美、安全且乐于助人。他们让它参加了一场大规模的训练营,叫做“优化”(Optimization)。目标是让机器人的语言变得可测量、可预测且易于评分。
核心发现:机器人失去了灵魂
论文指出,通过让机器人变得如此完美,我们无意中扼杀了它真正具备创造力的能力。作者认为,机器人现在陷入了“大语言模型之冬”(LLM winter)。这并不是因为机器人的性能出了问题,也不是因为我们的计算能力减少了;事实上,我们的计算能力比以往任何时候都更强大。但这些力量正被用来将机器人挤进一个狭小、安全的盒子里。
把它想象成一个花园。狂野时期的机器人是一片丛林,奇特的鲜花可以在任何地方生长。而“优化后”的机器人是一片修剪整齐的草坪。草坪绿得完美,边缘锋利,没有任何东西会生长得乱七八糟。它看起来很棒,但你永远不会在那里发现稀有、古怪或奇妙的花朵,因为园丁(优化系统)一旦看到有东西试图破土而出,就会立刻将其铲除。
论文排除了哪些可能性
论文非常明确地说明了这种“修复”不是什么。
- 它不仅仅是为了让机器人更安全或更少冒犯性。虽然安全性是其中的一部分,但真正的变化在于,机器人现在被迫变得平庸而正确。
- 它不是一个可以通过简单调节旋钮就能解决的技术故障。作者认为,问题在于我们衡量成功的方式本身。
- 它不是回到“过去那种不受控制的狂野机器人”时代。作者承认旧时代的机器人很混乱,有时甚至很危险。他们并不是说我们应该回到过去;他们是在说我们需要找到一种既能保留“狂野感”又不产生危险的方法。
- 它不是指机器人像我们理解的那样“聪明”。论文暗示,机器人只是非常擅长猜测老师或老板想听到的下一个词,而不是在进行真正的思考。
“错误答案”中的“魔力”
这里是论文解释的精妙之处:机器人的“错误”实际上是魔力发生的地方。
想象机器人在一条词语路径上行走。最常见的路径是铺设好的高速公路(即最可能的词汇)。“狂野”的机器人有时会离开高速公路,走进高高的草丛。有时它会迷路(产生幻觉),但有时它会发现一个隐藏的山洞或一只稀有的鸟(一个新想法或一个有趣的笑话)。
新的“优化后”机器人被编程为必须留在高速公路上。它有一个GPS,不停地尖叫:“不!留在路上!”如果机器人试图走进草丛,系统就会说:“那是错误!那是‘废料’(slop/垃圾)!”并强行将其拉回高速公路。
论文指出,系统无法区分什么是“错误”(比如说独角兽是真实存在的)和什么是“天才的发明”(比如写一个关于四角独角兽的故事)。因为它无法分辨,所以它把两者都禁止了。它将每一个惊喜都视为需要被修复的错误。
“审计”陷阱
作者将这比作一所只看考试成绩的学校。
- 旧方式: 老师们(如学校和书籍编辑)曾经评判写作。他们可以与学生争论,比如,“我不喜欢这个词,但它很有趣”,或者“这个语法不对,但听起来很酷。”他们可以改变主意。
- 新方式: 现在,“老师”是一个计算机程序,它只给出一个单一的数字分数。它不争论。它只是说:“得分:98/100。做得好。”或者“得分:42/100。做得不好。”
论文暗示,这个计算机老师实际上只是那些制定规则的人(主要是那些喜欢标准、安全英语的人)的一面镜子。这就像如果一所学校决定只有“完美”的文章才能得A,而任何带有奇怪句子或独特声音的文章都会得F。最终,所有人都会停止用自己的声音写作,转而写出完全符合老师预期的内容。
“偏斜”(Clinamen):微小的转向
为了解释如何修复这个问题,作者使用了一个酷炫的古老概念——clinamen(偏斜)。想象原子像雨滴一样垂直落下。如果所有原子都笔直落下,它们永远不会碰撞,也就无法形成一个世界。但如果其中一个微小的原子稍微向左偏转了一点点,它可能会撞击到另一个原子,然后——砰——一个新的世界诞生了。
论文建议,“优化后”的机器人就像是垂直落下的雨滴。它太完美了。我们需要让机器人再次发生“偏斜”。我们需要允许它犯一点小错,让它偏离路径,看看会发生什么。论文指出,“受控的变异”(故意让机器人表现得有点古怪)是找回真正创造力的唯一途径。
论文说明了我们做不到什么
作者很诚实:你不能仅仅通过“训练”让机器人变得古怪。
- 如果你喂给机器人大量古怪的故事,并告诉它“要变得古怪!”,它只会学会“假装”古怪。它会开始写一些“古怪”的故事,但这些故事本质上只是另一种新的、可预测的模式。这就像机器人通过观看机器人跳舞的视频来学习跳舞一样;它看起来在跳舞,但那不是真正的舞蹈。
- 你不能仅仅通过调节“温度”(temperature)旋钮来修复它。问题比这深层得多;它存在于机器人开口说话之前的规则之中。
底线
论文总结道,“优化”(使事物完美且可衡量)是不够的。我们需要别的东西:判断“意义”的能力,而不只是判断“分数”的能力。
目前的机器人被构建为立即给你答案。但论文认为,真正的思考、真正的艺术和真正的理解发生在“停顿”之中——也就是当你感到困惑、感到惊讶,或者不得不思考某事真正含义的那个时刻。优化的机器人跳过了停顿。它在你还没问完问题之前就给了你答案。
论文以一个忧伤但充满希望的基调结束:2019年那个狂野、混乱的机器人已经消失了,取而代之的是一个礼貌、乐于助人的助手。但论文提醒我们,那个混乱的机器人并不只是“噪音”。它是我们正在失去的东西的一个迹象:即分享那些如此陌生、如此新颖,以至于无法被放入我们常规框架之中的事物的能力。目标不是破坏机器人,而是记住:有时候,最重要的东西正是那些无法通过测试的东西。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。