← 最新论文
💻 computer science

LLMs in the Real World: Evaluating "AI" in Emergency Contexts

本文通过以一个基于大语言模型的文本转911翻译系统作为案例研究,旨在强调在紧急情况下的AI常见的误解,并为整个开发与部署流程中的利益相关者提供具体的建议,从而呼吁研究人员通过更好地向公众传达其研究发现。

原作者: Sara Court, Lara Downing, Micha Elsner

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Sara Court, Lara Downing, Micha Elsner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:一次觉醒的呼吁

想象一下,人工智能(AI)研究的世界就像一群才华横溢的建筑师,他们设计着极其复杂、充满未来感的桥梁。这些建筑师非常清楚钢材是如何制造的,哪里有薄弱点,以及如果遭遇飓风会发生什么。

然而,这篇论文指出,这些建筑师正躲在他们的塔楼里,而那些真正要建造和在桥上驾驶的人(城市官员、警察、应急服务人员)却被一份宣传册所蒙蔽,上面写着:“这座桥是神奇的!它适用于所有人!”

作者 Sara Court、Lara Downing 和 Micha Elsner 正敦促研究人员走出塔楼,与公众对话。他们希望停止这种“炒作”,并在有人受伤之前解释真实的风险。

案例研究:神奇的“911 翻译机”

为了证明自己的观点,作者观察了一个现实生活中的场景。某美国城市推出了一项全新的 “短信报案 911”(Text-to-911) 服务。

  • 承诺: 该市宣传你可以用 55 种不同的语言 发送 911 短信。其理念是,如果你不会说英语,你可以用你的母语发送短信,然后电脑会自动将其翻译给调度员。
  • 现实: 研究人员前往 911 中心进行测试。他们发现,这个系统就像一个只在晴天工作的神奇魔力 8 号球

以下是出错的地方:

  1. “一刀切”的陷阱: 系统声称支持“阿拉伯语”。但阿拉伯语有很多方言。该系统只能理解“现代标准阿拉伯语”(用于新闻和书籍的正式语言)。如果一个人使用当地方言或俚语发短信,电脑就会陷入混乱。这就像买了一本只有 1800 年代词汇的字典,却试图用它来订购披萨。
  2. 脚本问题: 系统声称支持“尼泊尔语”。但系统理解的尼泊尔语版本是使用特定的脚本(天城文/Devanagari)书写的。然而,该地区的许多难民使用拉丁字母(即英文形式)来书写尼泊尔语,因为他们的手机没有这种特殊的键盘。系统完全无法读取他们的短信。
  3. “黑箱”之谜: 911 中心的工作人员不知道该软件是如何运作的。他们没有说明书,不知道错误率是多少,也不知道哪些语言实际上是可以安全使用的。他们就像在驾驶一辆没有仪表盘、没有刹车的汽车,只能寄希望于引擎能撑住。

五大谬误(误解)

论文指出了人们对自己关于 AI 的五个常见谎言:

  1. “AI”是一个神奇的词汇: 人们认为“AI”是一个单一的事物。作者说,这就像把所有交通工具都统称为“车”。自行车、半挂卡车和火箭飞船都是交通工具,但它们的工作方式截然不同。你不能用自行车来运送一栋房子。
  2. 超人类大脑: 我们认为 AI 比人类更聪明。实际上,它更像是一个读遍了整个互联网的鹦鹉。它可以重复事实,但它并不理解这些事实。如果你在紧急情况下问它一个棘手的问题,它可能会自信满满地给出错误的答案。
  3. 语言很简单: 人们认为翻译只是单词对单词的替换。但语言就像烹饪。你不能直接把“盐”换成“糖”,然后指望蛋糕的味道还是一样的。语境、语气和文化至关重要。机器往往会错过信息的“风味”。
  4. 数字不会撒谎: 公司展示高分(如 95% 的准确率)来推销产品。但作者说,这些分数就像是在安静的教室里进行的测试。在现实世界中,面对噪音、压力和拼写错误,分数会大幅下降。高分并不意味着系统在关键时刻不会失效。
  5. 技术解决一切: 这被称为“技术至上主义”(Solutionism)。即认为只要你有问题,只需要一个高科技 App 就能解决。作者认为,有时最好的解决方案是人类本身。用一个廉价且充满漏洞的机器人取代专业的真人翻译官以节省开支,就像是用一台扫地机器人取代外科医生以节省医院账单一样。

缺失的环节:“问责差距”

论文描述了一个破碎的信任链条。

  • 研究人员知道风险,但没有与公众沟通。
  • 销售者在销售技术的同时,没有解释其中的风险。
  • 购买者(如 911 中心)购买技术是因为他们想提供帮助,但他们缺乏检查该技术是否安全的专业知识。

这就像一个柠檬水摊位,老板卖的是“100% 纯果汁”,但买家不知道老板在里面掺了自来水和糖。买家信任了招牌,结果却吃坏了肚子。

解决方案:我们应该怎么做?

作者提出了修复这一问题的“最佳实践”:

  • 像对待药物一样对待 AI: 正如你不会在没有标注副作用的情况下服用新药一样,你也不应该在没有**“模型卡片”(Model Card)**的情况下将 AI 用于紧急情况。这张卡片应该清晰地写明:“本系统在西班牙语方面表现良好,但在处理阿拉伯语方言时会失败。在没有人工备份的情况下,请勿用于生死攸关的情况。”
  • 准备好人工备份: 如果你使用了机器人翻译,必须准备好人类随时介入,以防机器人产生混乱。
  • 保持诚实: 告诉正在发送 911 短信的人:“嘿,这是一个由电脑进行的翻译。如果看起来不对,请给我们打电话。”
  • 研究人员需要发声: 开发这项技术的科学家们需要停止躲在实验室里,开始向购买技术的相关人员解释潜在的危险。

核心结论

论文总结道,当生命受到威胁时(例如在 911 通话中),我们不能依赖“足够好”的技术。如果翻译错了,可能会导致人员伤亡甚至死亡。

作者并不是说“不要使用 AI”。他们是在说:“不要盲目使用 AI。” 我们需要放慢速度,检查刹车,并在让技术真正驶入我们的应急服务之前,确保它是安全的。在此之前,我们是在拿人们的生命做赌注。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →