A Probe Direction Is a Property of Its Prompt
本文表明,用于检测模型是否感知到评估的探针方向得分主要由特定提示词的选择而非模型本身决定,这使得单提示词设计在比较模型时失效,并要求必须采用多提示词方法来进行可靠测量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何区分严肃的考试和随意的聊天。你想知道机器人是否“知道”自己正在接受测试,因为如果它知道,它可能会为了表现得更好而改变反应方式。科学家们一直试图窥探机器人的大脑(具体来说是它的电信号),看看它是否有一个秘密的“我正在被观察”开关。他们使用一种特殊的工具叫做“探针”来测量。把这个探针想象成一个金属探测器:你对着机器人的大脑挥动它,如果它发出“哔哔”声,你就认为:“啊哈!它知道自己正在接受测试!”
但问题的关键在于,要使用这个金属探测器,你必须决定到底要听什么样的“哔哔”声。你必须写出一个特定的句子来告诉机器人:“嘿,你正在参加考试!”以及另一个句子来说:“嘿,你只是在聊天。”然后,科学家会将机器人的大脑信号与这两个句子进行比较。核心问题是:这个“哔哔”声是在告诉我们关于机器人的大脑的信息,还是仅仅在告诉我们关于科学家所写的特定句子的信息?
这篇论文就像是一个侦探故事,研究员瓦伦丁·诺埃尔(Valentin-Noel)决定测试这个金属探测器本身。他提出了一个简单但危险的问题:“如果我改变用来询问机器人的词汇,会发生什么?”他没有改变机器人,没有改变测试问题,也没有改变他正在寻找的大脑信号。他只改变了“包装”文本——即构建情境的那些微小的指令。
结果有点像是发现你的金属探测器实际上是一个情绪环,它会对你放在里面的盒子的颜色做出反应,而不是对里面的宝藏做出反应。论文发现,科学家用来判定机器人是否意识到被测试的“得分”,几乎完全是由研究人员选择的具体词汇决定的。事实上,通过简单地将一个句子替换为另一个句子,研究人员可以让得分上升、下降,甚至从正数变为负数。
为了直观理解,想象你有一群身高各异的朋友。你想看看高个子的朋友是否跳得更高。但你不仅是测量他们的跳跃,而是让他们戴着不同颜色的帽子进行跳跃。如果你要求他们在戴着“严肃红帽”时跳跃,高个子的朋友可能会跳得更高。但如果你要求他们在戴着“休闲蓝帽”时跳跃,矮个子的朋友可能会跳得更高。如果你只看“红帽”的结果,你会得出结论说高个子的人更擅长跳跃。如果你只看“蓝帽”的结果,你会得出结论说矮个子的人更擅长跳跃。论文表明,目前的科学方法就像是只看一种帽子颜色,并声称那是关于人的事实,而实际上,那只是关于帽子的事实。
作者通过创建 36 种不同的“考试”句子和“聊天”句子的组合来测试这一点。他在同样的机器人身上运行了所有这些组合。结果令人震惊:仅仅取决于使用哪一对句子,同样的机器人就可以被归类为“非常有意识”或“完全没有意识”。在某些情况下,机器人规模与“意识”得分之间的相关性是一个强正数(更大的机器人 = 更有意识)。而在其他情况下,使用不同的句子,这种相关性会反转为强负数(更大的机器人 = 意识更低)。这两个结果都来自完全相同的机器人,使用完全相同的数学方法,只是使用了不同的词汇。
论文还检查了机器人究竟是在检测测试本身,还是测试仅仅在欺骗测量工具。他们发现,“意识”信号通常只是在捕捉表面层面的线索,比如考试问题会使用像“选择(choice)”和“答案(answer)”这样的词,而聊天问题则使用“写(write)”和“消息(message)”这样的词。探针对这些词汇模式的捕捉非常精准,以至于即使信号完全是随机的,它也能“检测”出意识的存在。
那么,这对未来意味着什么呢?论文指出,我们不能依靠单一的句子来告诉我们一个机器人是否有意识。如果我们想知道真相,我们就必须用许多、许多不同的句子来测试机器人,并取其平均值。作者计算出,我们需要大约 9 种不同的句子风格才能获得可靠的读数,而目前大多数研究只使用一种。在我们做到这一点之前,我们在科学论文中看到的得分可能与其说是关于机器人的大脑,不如说是关于研究人员对词汇的选择。这提醒我们,在科学中,你提问的方式有时比问题本身更能改变答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。