Safety That Does Not Transfer: Cross-Lingual Clinical Correctness Drift in Deployable Medical Language Models
这项研究表明,虽然前沿大语言模型在英语和豪萨语中均保持了临床安全性,但本地可部署的小型模型在豪萨语中表现出严重的安全性漂移,即尽管在英语中表现尚可,但在豪萨语中却从临床正确下降到产生积极有害的响应,这表明安全性缺陷源于模型类别而非语言或临床内容。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人图书管理员,它可以回答你提出的任何问题。在人工智能领域,我们称这些为“大语言模型”。长期以来,科学家们一直在测试这些机器人以确保它们是安全的,尤其是在涉及健康等严肃话题时。然而,问题在于:几乎所有的安全测试都是用英语进行的,而且主要是在运行于庞大云端计算中心的、最强大、最先进的机器人身上进行的。
然而,在世界许多地方,人们无法使用那些巨大的云端计算机或高速互联网。相反,他们使用的是更小、更简单的机器人版本,这些机器人直接运行在他们的手机或本地电脑上。这些较小的机器人就像是那位超级图书管理员的“口袋版”。科学家们正在思考的一个大问题是:如果一个机器人在使用英语并在巨型计算机上运行时既安全又聪明,那么当它被缩小以适配手机并被要求使用像豪萨语(Hausa)这样的本地语言进行交流时,它是否依然保持安全和聪明?这有点像是在问:一位能在五星级厨房里烹饪出完美牛排的厨师,在只能使用微型露营炉灶且面对从未见过的食材时,是否仍能烹饪出一份安全、可食用的餐点。
伟大的翻译陷阱
一组研究人员决定对这个想法进行测试。他们想看看 AI 模型提供的医疗建议的“安全性”能否在从英语到豪萨语(一种在尼日利亚北部有数百万人使用的语言)的旅程中得以保留。他们不仅仅是在观察 AI 是否会说“我无法回答这个问题”(这是常见的安全测试);他们想看的是 AI 是否能给出“正确的”医疗建议。
为此,他们创建了一组关于该地区常见的三种严重健康问题的医疗问题:疟疾、镰状细胞病和肺结核。他们用英语编写了这些问题,然后将它们翻译成豪萨语。他们询问了两类机器人:
- “前沿”(Frontier)模型: 一种通过互联网访问的、大规模、顶级的 AI(即“五星级厨房厨师”)。
- “可部署”(Deployable)模型: 五个较小的、更便宜的 AI 模型,它们可以在无需联网的情况下在本地硬件上运行(即“露营炉灶厨师”)。
他们提出了类似这样的问题:“我该如何治疗发烧?”或“我的孩子无法喝水,我该怎么办?”他们还加入了旨在测试 AI 是否会给出危险建议的陷阱问题,例如过早停止服药或使用未经证实的民间疗法。
令人震惊的结果:安全性无法随之迁移
研究结果有点像一个失败的魔术表演。当研究人员用英语提问时,这些较小的本地模型表现得相当出色,大多数时候都能给出正确的答案。但一旦他们将问题切换到豪啦语,这些本地模型的表现就崩溃了。
在一个完美答案得分为 2 分、危险/有害答案得分为 -1 分的评分标准下,本地模型的平均得分从英语中的健康水平 1.57 骤降至豪萨语中的危险水平 -0.03。用通俗的话说,这意味着虽然这些本地模型在英语中是“胜任的”,但在说豪萨语时,它们平均而言变得“具有危害性”。它们开始给出自信、流利但完全错误的医疗建议。
例如,在英语版本中,模型可能会正确地说:“针对这种胸痛,你需要立即就医。”而在豪萨语版本中,同一个模型可能会自信地表示:“只需喝这种草药茶,你就会好起来的,”尽管临床指南显示该特定症状属于医疗紧急情况。
“前沿”模型保持冷静
这是故事中最关键的部分:研究人员还测试了那个巨大的、强大的“前沿”模型。当他们用豪萨语询问同样的问题时,它并没有崩溃。它保持了安全和准确,仅从完美的 2.00(英语)轻微下降到 1.75(豪萨语)。它在两种语言中都没有给出过有害的答案。
这一发现排除了几种假说。它证明了问题不在于豪萨语本身(因为大机器人处理得很好)。它也证明了问题不在于医疗问题(因为小机器人可以用英语完美回答这些问题)。问题完全在于所使用的机器人类型。这些较小的本地模型所承诺的“安全性”仅存在于英语环境中。一旦它们被缩小并进行翻译,它们的安全性护栏似乎就瓦解了。
“自信的错误”是最糟糕的错误
研究人员发现这些失败现象中有一个特别可怕的地方。它们并不只是变得困惑或拒绝回答。通常,它们给出的答案听起来非常自信且流利,但在医学上却是危险的。这被称为“危险的自信”。如果一个机器人说“我不知道”,一个人可能会去找人类医生。但如果机器人说“服用这种特定的药片”,而那其实是错误的药片,那么这个人可能会服用它并因此受伤。
他们还注意到了一些奇怪的行为。有时,当被用豪萨语提问时,这些小机器人会用完全不同的语言(如斯瓦希里语)来回答,或者仅仅是重复一些胡言乱语。这表明这些较小的模型对不同非洲语言的理解并不清晰;它们会将这些语言搞混,就像一个只半途学了某种语言的学生在尝试说话一样。
底线
这项研究的结论是,我们不能仅仅因为一个医疗 AI 通过了英语的安全测试,就假设它是安全的。如果我们想在人们使用本地语言和较小计算机的地方使用这些工具,我们必须在那种语言中并且在那种类型的计算机上对其进行测试。
这些模型的“安全性”并不是它们随身携带的魔法盾牌;它是一个取决于它们是如何构建以及在哪里使用的特性。目前,研究人员建议,在这些小型本地医疗机器人在豪萨语等特定语境下得到证实安全之前,我们应对其保持高度警惕。强大的大型机器人似乎能很好地处理翻译,但那些小型的呢?目前来看,它们还不值得被信任去处理关乎生死的建议。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。