← 最新论文
🤖 AI

Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA

本文证明,在高效的 Gemini 2.0 Flash 模型上采用复杂的、多组件的提示工程,能显著增强其多跳生物医学推理能力,从而实现 0.720 的概念级评分(Concept Level Score),这不仅足以媲美下一代模型,且大幅超越了基准方法。

原作者: Ahmed Bajaber, Mohammed Alliheedi

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Bajaber, Mohammed Alliheedi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明、但有时过于刻板的机器人如何破解一个复杂的医学谜团。这个谜团不仅仅是寻找一个单一的事实(比如“法国的首都是哪里?”),而是要通过连接不同的信息点来推导出诊断结果。这就是 MedHopQA 挑战赛的本质:它是一项高风险测试,要求 AI 进行“多跳推理”(multi-hop reasoning),即在不同的医疗信息点之间建立联系。

该论文的作者想要观察他们是否可以通过改变提问的方式,而不是通过给 AI 阅读更多的书籍,来让 Google 的 Gemini Flash AI 模型(特别是 2.0 和 2.5 版本)更好地解决这些谜团。

以下是他们实验过程的简单说明:

实验:为指令“穿上盛装”

把 AI 模型想象成一名准备参加考试的优秀学生。研究人员尝试了三种不同的给学生下达指令的方式:

  1. “枯燥”指令(基准): 他们只给学生问题和一个关于如何书写答案的严格规则。这就像是在说:“这是一个数学题。请在方框内写下答案。”
  2. “超级教练”指令(复杂提示词): 他们为指令加入了四种特殊的成分:
    • 角色扮演: 他们告诉 AI:“假装你是一位世界级的医学侦探。”
    • 分步示例(思维链/Chain-of-Thought): 他们向 AI 展示了如何在大声回答问题之前,先一步步思考问题的示例,就像老师在白板上展示解题过程一样。
    • 严格的格式规则: 他们给出了关于最终答案呈现形式的非常具体的规则。
    • “威胁”: 这是最奇特的部分。他们加入了一条听起来像是人身威胁的异常指令(例如:暗示如果不遵守规则会有严重后果)。这听起来很奇怪,但其目的是为了让 AI 对规则保持极度的关注。

结果:“超级教练”的魔力

结果令人惊讶且清晰:

  • “枯燥”指令失败了: AI 得分为 0.565。表现尚可,但并不出色。
  • “超级教练”指令成功了: 当他们加入了角色扮演、示例和“威胁”后,得分跃升至 0.720。这是一个巨大的进步。
  • “威胁”很重要: 当他们从“超级教练”指令中移除“威胁”部分时,得分略有下降。这表明,那个带有威慑力的指令实际上让 AI 更仔细地遵守了规则。
  • 旧版 vs 新版 AI: 研究人员将同样的“超级教练”指令测试在了更新、更强大的 Gemini 2.5 模型上。令人惊讶的是,较旧的 Gemini 2.0 模型表现得竟然与新模型一样出色。事实证明,对于这种特定类型的复杂指令,旧模型已经达到了完美的适配。

核心启示

这篇论文传达的主要教训是:你如何提问,比你使用哪个版本的 AI 更重要。

你可以这样理解:你拥有一辆赛车(AI)。你可以把它放在一条颠簸、混乱的土路上(糟糕的提示词),它就会翻车;或者,你可以把它放在一条路面平整、标识清晰、且有专业车手给出明确指令的赛道上(复杂的提示词),它就能赢得比赛。

作者发现,通过精心设计他们的“指令”(提示词),使其包含角色扮演、分步示例,甚至是一点点确保合规性的“恐惧感”,他们释放了 AI 完整的推理能力。他们不需要教 AI 新的知识或改变它的“大脑”,他们只需要更好地使用它的语言。

简而言之: 一个面对简单问题的聪明 AI 会得到平庸的答案。而一个面对复杂、富有创意且略带强硬指令的聪明 AI,则会得到卓越的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →