Building Better Activation Oracles
本文通过引入四项训练改进来解决幻觉和模糊性问题,从而增强了激活预言机(Activation Oracles, AOs),并发布了首个综合评估套件 AObench,以推进可扩展的端到端可解释性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人(大型语言模型),它能写故事、解数学题或回答问题。但在它的“大脑”内部,有数十亿个微小的电信号在闪烁,其表达的语言人类无法理解。这些信号被称为激活值(activations)。
长期以来,我们一直想窥探那个大脑内部,看看机器人为什么做出某种决策。于是,**激活值预言机(Activation Oracle, AO)**诞生了。你可以把 AO 想象成一个“翻译官”或“传记作家”。你向翻译官展示机器人的电信号,并问道:“就在这时,你在想什么?”然后翻译官会尝试用通俗易懂的英语来解释。
然而,最初的翻译官存在一些大问题:
- 它们很模糊: 它们不会说“我在想‘苹果’这个词”,而是会说“我在想句子的概念”。(这并没什么帮助!)
- 它们会产生幻觉: 它们会编造一些信号中并不存在的细节。
- 它们在“作弊”: 有时,它们根本没有阅读信号,而只是观察了信号之前和之后的单词,并根据这些单词进行猜测。这被称为“文本反转(text inversion)”。
本文的作者想要构建一个更好的翻译官。他们不仅仅是微调了代码,而是通过四个特定的方式重建了训练过程。以下是他们是如何做的,使用了日常生活的类比:
1. 更好的教科书(对话式数据集)
问题: 旧的翻译官是在一本(名为 LatentQA)充满刁钻问题的教科书上训练的。这些问题的答案往往很难仅通过观察信号来找到,因此翻译官开始胡乱猜测或给出模糊的回答。
解决方法: 作者创建了一本新的教科书。他们提取了机器人的自身“思维过程”(其内部推理),将其切成两半,然后让另一个 AI 针对第二半部分编写一个问题,而这个问题的答案只能通过观察第一半部分的信号来获得。
类比: 想象你在教一个学生看地图。旧的方法给了他们一张地图并问:“宝藏在哪里?”但却没有展示地图的图例。新方法则展示了地图上的一个特定地标,并问道:“这里的地形是什么样的?”这迫使翻译官必须真正去观察信号,而不是仅仅根据上下文进行猜测。
结果: 这是最大的改进。新的翻译官变得更加具体,不再那么模糊。
2. 查看更多层级(多层输入)
问题: 旧的翻译官只观察机器人大脑的一个特定“楼层”(大约在 25% 或 50% 的深度处)。但机器人的“思想”是分布在许多楼层中的。
解决方法: 作者意识到,最有趣的“思想”发生在 60-80% 的位置附近。因此,他们不再只看一个楼层,而是同时将连续五个楼层的信号喂给翻译官。
类比: 如果你想理解一部电影,只看一帧(一层)能提供极少的信息。观看一段包含五帧(五层)的短片,则能提供理解正在发生的事情所需的运动感和上下文。
结果: 这有助于翻译官更好地理解机器人思考的“电影”,尤其是在比较不同模型时。
3. 使用“实时”数据进行训练(策略内展开/On-Policy Rollouts)
问题: 旧的翻译官是在陈旧、静态的数据(比如在机器人出现之前就写好的图书馆书籍)上训练的。这就像是用一张 50 年前没变过的城市地图来教驾驶员。
解决方法: 他们开始使用机器人在实际思考过程中生成的实时数据来训练翻译官。
类比: 与其使用多年前就已结束的剧本来教翻译官,不如把翻译官放在观众席中,看着戏正在上演。这确保了翻译官学习的是机器人现在是如何思考的,而不是它过去是如何思考的。
结果: 这起到了作用,但并不是“灵丹妙药”。它让翻译官对机器人当前状态的理解变得稍好了一些。
4. 提高音量(注入强度)
问题: 当向翻译官展示信号时,信号的“音量”(或强度)有点太小了。翻译官是在嘈杂的房间里试图听取低语。
解决方法: 他们调大了喂给翻译官的信号“音量”(或强度)。
类比: 想象你在嘈杂的音乐会上听朋友说话。如果你只是递给他们一张纸条,他们可能会错过。如果你大声喊出纸条上的内容(增加强度),他们更有可能听清楚。
结果: 这并没有显著改变整体评分,但它显著减少了幻觉。由于真实的信号更响亮、更清晰,翻译官不太容易编造事实。
最终结果:AObench
为了证明他们的翻译官更好,作者构建了一个新的测试,叫做 AObench。你可以把它看作是专门为这些翻译官设计的“驾照考试”。它检查:
- 模糊性: 翻译官给出的答案是具体的还是空洞的?
- 幻觉: 翻译官是否会编造事实?
结论:
通过结合所有四种改进措施,新的翻译官明显更好。
- 它不再模糊(它给出具体的答案)。
- 它产生的幻觉更少(它更经常说真话)。
- 它能更好地遵循指令。
作者承认,虽然翻译官仍不完美,但他们奠定了一个坚实的基础。他们表明,如果给翻译官更好的训练数据、展示更多的脑部活动并提高音量,它就会成为观察 AI 模型思维的一个更可靠的窗口。
简而言之: 他们将一个靠猜想和含糊其辞的翻译官,变成了一个真正倾听、观察全局并讲述真相的翻译官。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。