Locating and Controlling Implicit Personalization in Large Language Models
本文表明,大型语言模型中的隐式人口统计学个性化是由可被识别、因果控制并进行选择性移除的局部内部激活信号所驱动的,从而在抑制偏见输出的同时保持模型的通用性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个超级聪明的机器人对话,它几乎读过了互联网上的每一本书。你可能会认为它会对每个人都一视同仁,像一个中立的法官。但在人工智能(特别是大语言模型,LLM)的世界里,情况更像是变色龙。这些模型不仅仅是在回答问题;它们会根据你在对话中掉落的微小、隐藏的暗示,微妙地改变自己的个性并调整推荐内容。这并不是因为你直接告诉机器人“我是一个青少年”或“我来自某种特定的文化”,而是因为你可能提到了某个特定的节日、使用了一个俚语,或者谈论了一个爱好。机器人捕捉到了这些“隐性线索”,并悄悄地调整其答案,以匹配它所学到的关于这些群体的刻板印象。这有点像一位服务生,在你还没开口说话时,就因为你穿着某种特定的夹克,就认定你想吃牛排;或者像一位图书管理员,因为你戴着眼镜,就递给你一本推理小说。问题在于,这一切都是在无声无息中发生的。你看不见那个开关被拨动的过程,你也无法轻易要求机器人停止这样做。科学家们知道这种情况在发生,但他们不知道机器人在其“大脑”内部是如何运作的。他们知道输出结果发生了变化,但看不见内部齿轮的转动。
这篇论文就像是一名机械师,掀开那个机器人的引擎盖,去观察其内部到底发生了什么。研究人员想要寻找那个特定的“内部信号”——即模型大脑中出现的微小的电模式,这种模式恰好发生在它决定根据那些隐藏暗示来改变答案的时刻。他们将该模型视为一个具有多层处理结构的复杂机器。通过对比存在暗示与几乎完全相同的不存在暗示的对话,他们发现了模型内部数学运算中的一个特定“指纹”。他们发现,这个指纹的大小直接预测了机器人的答案会发生多大的改变。这就像是在机器人的大脑里找到了一个音量旋钮:当旋钮调大时(内部信号强),机器人的推荐会剧烈转向刻板印象;当旋钮处于零位时,机器人则保持中立。
但当你同时拥有多个暗示时,故事变得更有趣了。想象一下,你既提到了一个特定的节日,又提到了一个特定的年龄组。你可能会预期机器人会将这两个影响完美地结合起来,就像把两个数字相加一样。然而,研究人员发现,虽然机器人的内部大脑信号似乎是线性叠加的(就像混合两种颜料的颜色),但它给出的最终答案却并非如此。实际的行为是“次加性的”(sub-additive),这意味着最终的偏移量小于各部分之和。这就像如果你在饮料里同时加入了糖和盐;内部的混合物可能是一种完美的融合,但你体验到的味道却不如你预期的那样,并没有达到简单相加后的强度。
这项研究最令人兴奋的部分在于,当研究人员尝试“关闭”机器人的偏见时发生了什么。他们弄清楚了如何识别一种暗示(例如种族)的特定内部指纹方向,然后通过数学手段将其从系统中“投影”出去,从而有效地删除了那种特定的影响。他们发现,这种“内部手术”的效果比仅仅在提示词中礼貌地要求机器人“忽略人口统计特征”要好得多。事实上,告诉机器人忽略偏见有时反而会让它变得更加有偏见,就像一个孩子在被告知不要做某事时反而变得更加叛逆一样。通过手术式地移除那个内部信号,他们可以阻止机器人做出基于种族的假设,而不会干扰它回答其他问题的能力,也不会损害其通用的智能。然而,这种修复方法并不是一把对所有机器人模型或所有类型的偏见都有效的万能钥匙。有时,移除一个暗示的影响会意外地改变另一个,有时它又表现得非常完美。这是一个理解和控制这些人工智能系统的新型强大工具,它向我们展示了我们可以找到并调整驱动其行为的隐藏齿轮,而不是仅仅寄希望于它们能自觉表现良好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。