Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining
本文介绍了潜空间拒绝锚定(LSR-Anchoring),这是一种无需训练的方法,通过从英语中提取拒绝方向并将其应用于推理阶段的残差流,从而在低资源非洲语言中恢复安全拒绝功能,并通过诸如基于稀疏自编码器(SAE)衍生的转向技术,在实现有效安全恢复的同时,将性能下降降至最低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能系统,通常被称为大语言模型,旨在理解并生成人类语言。其开发过程中的一个关键环节是教导它们识别并拒绝有害请求,例如制造恶意软件或策划暴力的指令。研究人员发现,这些模型拥有一种在检测到危险时会激活的内部“安全开关”。然而,这个开关目前几乎完全被调校为仅能识别英语中的威胁。当用户用另一种语言(特别是像许多非洲语言那样数字资源较少的语言)提出同样的危险问题时,这个安全开关往往无法触发。由于模型无法识别该特定语言中的威胁,它可能会顺从该请求,从而使数百万使用者处于无保护状态。这一差距代表了全球 AI 安全领域的一个重大盲点,即这项技术对某些人有效,却让其他人变得脆弱。
一项在机器学习研讨会上展示的新研究解决了这种不平衡问题,且无需通常修复此类问题所需的大量新数据或计算能力。研究人员与能够理解英语、约鲁巴语、伊博语、伊加拉语和豪萨语的模型合作,发现即使模型在处理其他语言时未能采取行动,其表示“拒绝”的内部信号仍然存在于计算机的记忆中。他们并没有重新训练整个系统(这对于缺乏大规模数据集的语言来说是不可能的),而是开发了一种方法,在模型思考的瞬间手动微调模型的内部状态。他们提取了模型在处理英语时发出“我不能做这个”信号的具体活动模式,然后将同样的模式应用于模型处理非洲语言时的内部运作。这种被称为“潜空间拒绝锚定”(latent space refusal anchoring)的技术,有效地将安全信号钳制在模型的思维过程中,迫使模型无论使用何种语言都能识别出危险。
这种方法的实验结果在多种不同规模和类型的模型上都取得了显著成功。当研究人员将这种微调应用于处理约鲁巴语、伊博语、伊加拉语和豪萨语有害请求的模型时,这些模型开始像处理英语一样可靠地拒绝这些请求。在许多情况下,阻止有害内容的成功率跃升至接近完美的水平。例如,在测试的最大模型(Llama-3.1-70B)上,该方法完全恢复了对约鲁巴语和伊加拉语提示词的安全防护,并在处理伊博语时达到了 0.99 的成功率;然而,由于未对该规模模型的错误拒绝无害问题的指标进行测量,这些高成功率仅代表实际安全恢复的上限。至关重要的是,在研究测量了错误拒绝良性请求情况的小型模型上,这种修复并未破坏模型回答无害问题的能力;对于这些模型,错误拒绝良性请求的错误率保持在极低水平,通常低于 8%。该方法的效果如此之好,以至于无需在目标语言中使用任何标记数据就恢复了安全性,这对于数据匮乏的地区来说是一个重大突破。
然而,这项研究也揭示了该技术的局限性。研究人员发现,该方法并不适用于每一种语言。当他们尝试将基于英语的安全信号应用于阿拉伯语时,该方法完全失效,导致模型变得更不安全而非更安全。这表明,模型表示阿拉伯语的方式与其表示英语的方式在内部几何结构上有着根本的不同,这意味着安全信号的简单翻译并不适用。此外,该方法的表现取决于模型的规模。在较小的模型上,该技术的初始版本过于激进,导致模型几乎拒绝所有问题,甚至是无害的问题。为了解决这个问题,研究人员通过隔离出一个负责拒绝的非常具体的单一内部特征,而非使用宽泛的平均值,从而改进了方法。这种精细化的方法使小型模型在恢复安全性的同时,不会变得过度谨慎,与最初尝试相比,将出错风险降低了三到七倍。
这项研究证实,人工智能系统中的安全机制并非在其他语言中缺失,而仅仅是处于休眠状态,等待被正确的内部信号触发。通过使用一种无需训练的方法,在使用的瞬间激活这些信号,研究人员提供了一种切实可行的方法,将安全保护扩展到此前被遗忘的数亿名使用者。这项工作证明,只要语言的内部结构是兼容的,通过仔细的调整,人工智能可以理解跨越语言障碍的有害请求意图。尽管对于阿拉伯语等语言仍面临挑战,但其在西非语言上的成功,为利用模型自身已有的资源,使 AI 对更多样化的全球人口更加安全,提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。