← 最新论文
💬 NLP

Entry-level guide to the use of large language models for medical research

本文提供了一份面向医疗从业者的入门级可操作指南,旨在通过涵盖任务定义、模型选择、提示工程、微调及负责任部署的结构化工作流,帮助他们有效且安全地将前沿大语言模型整合到医学研究与临床实践中。

原作者: Qiao Jin, Nicholas Wan, Robert Leaman, Shubo Tian, Zhizheng Wang, Yifan Yang, Zifeng Wang, Guangzhi Xiong, Po-Ting Lai, Qingqing Zhu, Benjamin Hou, Maame Sarfo-Gyamfi, Gongbo Zhang, Aidan Gilson, Balu
发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiao Jin, Nicholas Wan, Robert Leaman, Shubo Tian, Zhizheng Wang, Yifan Yang, Zifeng Wang, Guangzhi Xiong, Po-Ting Lai, Qingqing Zhu, Benjamin Hou, Maame Sarfo-Gyamfi, Gongbo Zhang, Aidan Gilson, Balu Bhasuran, Zhe He, Aidong Zhang, Jimeng Sun, Chunhua Weng, Ronald M. Summers, Qingyu Chen, Yifan Peng, Zhiyong Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

请将本文视为一本专为医生和医学研究人员设计的、针对超级智能但有时不可预测的数字助手的用户手册

作者(来自美国国立卫生研究院及顶尖大学的团队)指出,虽然这些“大语言模型”(LLMs)——如文中提及的未来派 GPT-5 或 Claude 4.5——功能极其强大,但在医学领域使用它们,就像把手术刀交给未经训练的人一样。你不能随意向它们提问并期待获得完美的医疗建议。相反,你需要一套结构化的分步指南,以确保安全、有效地使用它们。

以下是本文关于如何使用这些 AI 工具的“食谱”,辅以日常类比进行解释:

1. AI 能承担的五大任务(任务定义)

在开始之前,你需要明确要求 AI 执行何种类型的工作。论文指出,大语言模型就像一把拥有五把特定刀刃的瑞士军刀

  • 侦探(知识与推理): 回答复杂的医学问题,或判断患者是否符合临床试验条件。
  • 编辑(摘要生成): 将 50 页的医疗记录浓缩为一页摘要。
  • 翻译(语言转换): 将医学术语转化为患者易懂的通俗语言,或在不同语言之间进行翻译。
  • 整理者(结构化): 将杂乱无章的手写笔记转化为整洁有序的列表或表格。
  • 多传感器(多模态): 同时分析文本、X 光片和声波以做出诊断。

规则: 不要随意向 AI 抛出一个问题。确切定义你需要哪把“刀刃”,并收集约 100 个练习示例(测试用例),以验证其是否能正确完成任务。

2. 选择合适的工具(模型选择)

并非所有 AI 模型都生而平等。选择模型就像买车

  • 尺寸很重要: 更大的模型(如拥有 6710 亿“参数”的 DeepSeek-R1)就像重型卡车;它们更聪明,但需要更多燃料(计算能力)且成本更高。较小的模型则像紧凑型轿车;它们更便宜、更快,但可能无法处理重载。
  • 上下文窗口: 想象 AI 拥有一段短期记忆。有些模型只能记住最后 8,000 个单词(约 20 篇摘要),而其他模型(如 Gemini 3)则能记住整个图书馆(100 万个单词)。如果你的医疗文件像一部小说,你就需要一个拥有大内存的模型。
  • 隐私锁: 这一点至关重要。如果你处理的是真实的患者数据,就不能使用公共的免费聊天机器人(如标准网页版 ChatGPT),因为这就像把患者的日记留在公园长椅上。你需要一个“符合 HIPAA 标准”的模型(一个上锁的安全房间),或者在你们自己的私有服务器上运行该模型。

3. 教导 AI 如何表达(提示工程)

一旦你拥有了模型,就必须以正确的方式与它交流。这就是提示工程。把 AI 想象成一个非常字面化、极其聪明的实习生,它需要非常具体的指令。

  • 少样本学习: 不要只说“总结这个”,而是先给这个实习生展示三个你希望它如何完成的示例。这就像在要求新员工撰写报告之前,先给他们看几份已完成的报告。
  • 思维链: 要求 AI“逐步思考”。这就像要求数学学生“展示解题过程”,而不仅仅是给出答案。这能降低 AI 犯错的可能性,并帮助医生理解 AI 给出特定答案的原因
  • RAG(检索增强生成): 如果 AI 不知道某个事实,不要让它猜测(这会导致“幻觉”或撒谎)。相反,先给它一本教科书查阅。你向它提供相关的医疗指南,然后要求它基于该文本进行回答。
  • 工具学习: 如果 AI 需要进行数学运算或查询特定数据库,给它一个计算器搜索引擎来使用,而不是试图让它凭记忆完成。

4. 何时聘请专家(微调)

有时,即使有了极好的指令,AI 的表现仍不够好。这时就需要对其进行微调

  • 想象 AI 是一位全科医生。微调就像送他们去针对某种特定疾病的专科住院医师培训项目
  • 你在以下情况下进行微调:
    1. 指令(提示)不起作用。
    2. 你拥有大量高质量的医疗数据用于教学。
    3. 指令太长,每次输入都太昂贵。
  • 论文建议使用“参数高效”方法(如 LoRA),这就像给 AI 穿上一件专门的训练背心,而不是重建其整个大脑。这种方法更便宜、更快捷。

5. 投入实际应用(部署)

最后,当你真正在医院或研究实验室使用 AI 时,必须格外小心。

  • 安全第一: AI 是副驾驶,而非机长。它支持医生,但不能取代医生。
  • 偏见检查: 就像人类一样,AI 也可能存在偏见。如果 AI 主要基于某一特定人群的数据进行训练,它可能会为其他人提供更差的建议。你必须进行测试,以确保它能公平地对待每个人。
  • 成本控制: 使用大型 AI 模型需要花钱(就像支付油费)。你需要为此做预算,无论是按消息向公司付费,还是购买自己强大的计算机服务器。

核心结论

论文总结道,大语言模型是医学领域的变革性工具,但它们并非魔法。为了安全地使用它们,医生和研究人员必须遵循严格的工作流程:定义任务,选择正确的安全模型,教导其如何思考(提示),必要时使其专业化(微调),并始终让人类在回路中进行检查。

如果你跳过这些步骤,就会面临 AI 提供错误建议、泄露患者秘密或浪费资金的风险。如果你遵循这些步骤,就能使医疗保健变得更快速、更准确、更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →