← 最新论文
💬 NLP

What's in a Name? Morphological Shortcuts by LLMs in Pharmacology

本文揭示了药理学领域的大语言模型通常依赖于形态学捷径(具体而言是药物名称的词缀)来推断虚构药物的属性,这种行为局限于模型的早期至中期层,并由于过度泛化和对这些线索未标明的依赖,构成了细微但可衡量的安全风险。

原作者: Kaijie Mo, Thomas Yang, Chantal Shaib, Qing Yao, William Rudman, Ramez Kouzy, Kanishka Misra, Byron C. Wallace, Junyi Jessy Li

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaijie Mo, Thomas Yang, Chantal Shaib, Qing Yao, William Rudman, Ramez Kouzy, Kanishka Misra, Byron C. Wallace, Junyi Jessy Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:后缀“作弊码”

想象一下你正在参加一场关于药物的考试。你并不真正了解某种特定药物的作用,但你注意到它的结尾是“-cillin”(比如 ampicillin)。你记得 penicillinamoxicillin 都是抗生素。于是你猜想:“噢,这肯定也是一种抗生素!”

你可能猜对了,也可能猜错了。但可怕的地方在于:大语言模型(LLMs)也在做完全相同的事情,而且表现得极其自信。

这篇论文研究了这些 AI 模型采取的一种“捷径”。它们并不是在记忆关于特定药物的实际事实,而是在观察单词的形状(前缀和后缀),并根据这种模式来猜测答案。

实验过程:“假药”测试

研究人员想要看看 AI 模型是否会被单词的形状所迷惑。他们创建了三种类型的单词来对 AI 进行测试:

  1. 真实药物: 真正的药物,如 Ampicillin
  2. 假药物(陷阱): 因为使用了真实的医学后缀而听起来很像真药的编造名称。例如,他们取了一个无意义的词“dimi”,然后加上真实的抗生素后缀“-cillin”,从而构成了 “Dimicillin”
  3. 无意义单词: 由编造的部分组成的无意义单词,如 “Dimiglimto”,这些词没有任何医学含义。

实验结果:
当 AI 被问及 Dimicillin 时,它并没有说:“我不知道,那是假的。”相反,它自信地回答道:“是的,Dimicillin 是一种用于治疗细菌感染的抗生素。”

它如此自信,以至于把一个完全虚构的单词当作真实药物一样对待,仅仅是因为这个词结尾带有那些通常代表“抗生素”的“神奇字母”。

三个关键发现

论文详细解释了这种现象是如何以及为何发生的:

1. “形态学捷径”(行为表现)

AI 并不是在“思考”药物,而是在进行模式匹配。

  • 类比: 想象一位从未做过某道菜的厨师,但他知道任何以“-pizza”结尾的菜通常都有奶酪和番茄。如果有人递给他一个标签为“狗-披萨(Dog-pizza)”的盘子,他会自信地描述其中的奶酪和番茄,尽管“狗-披萨”根本不存在。
  • 风险: 在医学领域,这是非常危险的。如果医生询问 AI 关于一种假药的信息,AI 可能会编造出一种虚假的疗法或副作用,并且由于它听起来如此自信,人类可能会相信它。

2. “隐藏的推理”(诊断分析)

研究人员构建了一个工具来观察 AI 从哪里获取信息。他们发现,对于许多药物,AI 主要依赖于后缀(结尾)而不是整个名称。

  • 令人惊讶之处: AI 很少承认这一点。当被问及为什么它认为某种药物是抗生素时,它不会说“因为它以 -cillin 结尾”,它只会给出一个自信的答案,仿佛它掌握了事实。这就像一个学生因为题目看起来很眼熟而猜出了答案,然后又写了一篇长篇大论,假装自己认真学习过这个主题。
  • 混淆问题: 由于 AI 依赖后缀,它经常会混淆真实的药物。如果两种真实的药物都以“-cillin”结尾,AI 可能会不小心把药物 A 的副作用套用到药物 B 上,仅仅因为它们看起来很像。

3. “大脑扫描”(机制原理)

研究人员观察了 AI 的“大脑”(其内部层级)以查看这种捷径发生在何处。

  • 位置: 他们发现 AI 在处理过程中非常早阶段就做出了这个决定,具体是在其神经网络的早期到中期层级
  • 机制: 这就像是一个夜店的保安,他只检查你的衣服颜色(后缀),而不检查你的身份证(特定的药物事实)就把你放进去。一旦 AI 看到了“正确的衣服颜色”,它就会立即决定:“这是一个抗生素”,并停止寻找更多细节。
  • 好消息: 由于他们找到了这个现象在 AI 大脑中发生的精确位置,他们展示了通过调整这些特定层级来“修补”或修复这种行为是可能的。

为什么这很重要(根据论文观点)

论文得出结论,这不仅仅是一个有趣的奇特现象,更是一个安全风险

  • 它很隐蔽: AI 听起来非常聪明且自信。
  • 它是可衡量的: 我们可以通过观察 AI 的单词模式来证明 AI 在“作弊”。
  • 它是可修复的: 既然我们知道这个“捷径”存在于 AI 的代码中的哪个位置,我们就有可能构建安全检查,以阻止它基于单词结尾来编造医学事实。

简而言之: 论文警告我们,AI 模型有时是“单词冲浪者”,而非“事实掌握者”。在医学等高风险领域,仅仅靠单词的形状来“冲浪”可能会导致自信满满但完全虚构的医疗建议。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →