← 最新论文
💬 NLP

Prompt engineering does not universally improve Large Language Model performance across clinical decision-making tasks

本研究评估了三种最先进的大型语言模型在临床决策任务中的表现,并发现虽然提示工程能显著提升模型在诊断性检测等特定薄弱环节的表现,但它并非万能解决方案,且可能对其他任务产生反作用,这凸显了对定制化、上下文感知集成策略的需求。

原作者: Mengdi Chai, Ali R. Zomorrodi

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengdi Chai, Ali R. Zomorrodi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:计算机可以阅读人类历史上写过的每一本医学教科书,并能完美地记住每一个事实。这就是大语言模型(LLMs)所承诺的前景——它们是聊天机器人背后的超智能AI大脑,而这些机器人正开始听起来像医生一样专业。但“知道一个事实”与“利用这个事实去解决一个混乱的现实难题”是两回事。这就像是一个学生能够背诵整本足球规则手册,与一名球员在比赛进行时能够实际运球过人、传球给合适的队友并在终场哨响前射门得分之间的区别。在医疗这种高风险的游戏中,医生不仅需要了解规则,还需要进行一系列艰难的决策过程:问题出在哪里?我们现在应该检查什么?我们需要做哪些检查?最后,我们该如何解决它?这正是棘手之处。科学家们一直试图通过给予这些AI“学生”特殊的指令,即所谓的“提示工程”(prompt engineering),来教它们更好地“玩这场游戏”。这就像是递给AI一本秘密剧本或一份循序渐进的行动指南,以帮助它思考得更清晰。大家都在问的一个大问题是:这份剧本真的能帮助AI赢得比赛,还是只会让这个可怜的小家伙感到困惑?

这项研究决定通过测试三款最聪明的AI模型来寻找答案:ChatGPT-4o、Gemini 2.5 Flash 和 Llama 3.3 70B。研究人员不仅仅是问它们一些常识性的琐碎问题,而是给了它们36个真实的临床案例(称为临床病史),并要求它们逐步演示整个决策过程。他们想看看使用高级的“提示工程”技术——特别是名为 MedPrompt 的方法(该方法试图强制AI进行逐步思考并参考类似的过往案例)——是否会让AI在解决这些医学谜团时表现得更好。

这里有一个转折:答案是一个肯定的“视情况而定”。研究发现,提示工程并不是能解决一切的魔杖。事实上,它更像是一副降噪耳机:在图书馆里效果极佳,但在繁忙的街道上却会让你错过公交车。

当AI模型在没有干预的情况下自主发挥(使用基础提示词)时,它们在某些方面表现得惊人地好,但在另一些方面却表现得很糟糕。一旦掌握了所有线索,它们在确定“最终诊断”方面几乎是完美的,但在决定开具哪些“相关的诊断性检查”方面却最为吃力。这就像它们可以轻易地在电影结尾指认出反派是谁,却很难在剧情的中段搞清楚该寻找哪些线索。

随后,研究人员尝试了那个“MedPrompt”剧本。对于AI表现最弱的任务——即挑选正确的诊断性检查——这个剧本发挥了奇效。这就像是给一位迷路的徒步旅行者提供了一张详细的地图;AI的表现大幅跃升。例如,一个模型在这一棘手任务上的准确率从大约31%提升到了51%。这是一个巨大的进步!

然而,当AI尝试将同样的剧本用于其他任务时,故事发生了转折。当被要求列出可能的疾病(鉴别诊断)或建议治疗方案时,那些高级提示词反而让AI的表现变差了。这就像是AI因为太忙于遵循剧本中的严格规则,以至于忘记了动用自己的大脑。其中一个模型在列出可能疾病的能力上,仅仅因为试图过度遵循“逐步思考”的指令,就从71%下降到了56%。

研究人员还测试了改变AI的“温度”(temperature,即控制其回答的创造性或随机性的参数)是否会产生影响。他们发现,令人惊讶的是,这对准确性并没有太大影响。无论AI被设定为超级保守还是更有创意,其答对问题的比例都差不多。这表明对于这些特定的任务,AI的大脑是非常稳定的,尽管研究人员也指出,在现实医院中,保持一致性对于安全性仍然至关重要。

这项研究的核心启示是:不存在“一劳永逸”的解决方案。你不能只是把一个高级提示词强加给任何AI,就指望它变成天才医生。有时,额外的结构化引导会有所帮助,而有时它则像是一个束缚架,限制了AI自然的思维。作者们建议,在现实世界中,我们不应依赖AI独自做出这些决策。相反,我们应该将它们视为得力的助手,需要人类医生来复核它们的工作,尤其是在AI试图破解那些最困难的谜题时。未来的道路不在于寻找完美的提示词,而在于将正确的工具匹配到正确的工作中,并保持人类在环路之中,以确保所有人的安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →