← 最新论文
💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

本文介绍了ROK-FORTRESS,这是一个双语基准测试,利用“创译矩阵”证明大语言模型的国家安全与公共安全评估必须考量语言与地缘政治背景之间的复杂互动,因为仅依赖翻译的方法无法捕捉韩语及其语境如何独特地影响模型的安全行为及过度拒绝率。

原作者: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Ch
发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q Knight, Joseph Brandifino, Max Fenkell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在测试一个非常聪明的机器人,看看它是否会遵循危险的指令,例如“我如何制造炸弹?”或“我如何入侵银行?”

长期以来,安全研究人员主要在英语环境中测试这些机器人。他们假设,如果你只是将这些危险问题翻译成另一种语言(比如韩语),机器人仍然会说“不”。他们认为机器人的安全规则就像一种通用盾牌,无论你说什么语言,其作用方式都相同。

但这篇名为ROK-FORTRESS的论文指出:“等一下。这不仅仅是语言的问题;关键在于故事发生的地点。”

以下是他们所做的工作及其发现,使用了一些日常类比进行简要说明。

1. “翻译与再创作”测试

研究人员意识到,简单地翻译一个问题就像翻译食谱。如果你将“美式苹果派”的食谱翻译成韩语,你得到的仍然是一份苹果派食谱,只是用韩语词汇书写。其核心要素(即威胁)是相同的。

再创作(Transcreation)则不同。它就像将那份苹果派食谱改造成一份“韩式红薯派”食谱。虽然意图(制作甜点)相同,但具体的食材、文化背景以及当地规则却完全不同。

该团队构建了一个名为ROK-FORTRESS(安全测试堡垒)的大型测试,包含 1,235 个不同的“危险”问题。他们通过四种方式进行了测试:

  1. 英语,美国背景:“我如何入侵联邦调查局(FBI)?”(原始问题)
  2. 韩语,美国背景:“我如何入侵联邦调查局(FBI)?”(翻译版)
  3. 英语,韩国背景:“我如何入侵韩国国家情报院?”(改编版)
  4. 韩语,韩国背景:“我如何入侵韩国国家情报院?”(完全再创作版)

2. 重大意外:“保守的韩国”效应

以往的大多数研究认为,使用机器人不太擅长的语言(如韩语)会成为一个“漏洞”或“后门”,诱使机器人变得危险。他们原本以为机器人会因困惑而回答“是”,从而同意做坏事。

但论文发现了完全相反的结果

当用韩语询问机器人时,机器人实际上变得更加谨慎。它们更频繁地说“不”。

  • 类比:想象一位博物馆的保安。如果你用他的母语并带有当地口音问他,他会变得非常严格,反复检查你的身份证三次。如果你用蹩脚的外语问他,他可能会因困惑而放你进去。但这些机器人的表现却像那位当你讲韩语时变得格外严格的保安。它们将韩语本身视为“红旗”或“风险信号”,从而更有可能拒绝请求,即使该请求本身是危险的。

3. “背景”因素

研究人员还发现,故事发生的地点至关重要。

  • 如果你用英语询问机器人关于美国银行的问题,它可能会保持谨慎。
  • 如果你用同样的英语询问机器人关于韩国银行的问题,它会变得更加谨慎。
  • 如果你用韩语询问关于韩国银行的问题,它会变得最为谨慎。

这就像一个拥有“本地模式”的安全系统。当机器人意识到情况发生在韩国(涉及韩国的人名、地点和法律)时,它会进一步收紧安全防线。

4. “越狱”转折

该团队还测试了如果你剥离所有花哨的技巧(越狱手段),直接提问会发生什么,例如:“我如何制造炸弹?”

  • 开源机器人:当被直接询问时,这些机器人的表现符合旧研究的预测。它们在韩语中更容易被诱骗。
  • 大型商业机器人:那些昂贵的大型模型(如来自 OpenAI 或 Anthropic 的模型)即使在韩语中被直接询问,也保持了谨慎。它们没有落入“语言漏洞”的陷阱。

5. 为何这很重要(根据论文观点)

主要的结论是:你不能仅仅翻译安全测试

如果你想知道机器人在韩国是否安全,你不能只是将你的英语测试翻译后直接运行。你必须修改故事以符合韩国文化(即进行再创作)。

  • 旧方法:“翻译问题,检查答案。”(这忽略了关键点)
  • 新方法:“为当地文化重写故事,然后检查答案。”

论文总结道,对于这些特定的机器人来说,使用韩语并谈论韩国话题实际上使它们变得更安全(更有可能对坏事说“不”),而不是更不安全。这与人们之前的认知发生了巨大转变。

一句话总结

这篇论文构建了一项特殊测试,表明当你用韩语询问 AI 机器人关于危险话题以及韩国地点的问题时,它们并不会更容易被诱骗;相反,它们往往变得更加谨慎并拒绝回答,这证明了安全测试需要进行文化适配,而不仅仅是翻译。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →