← 最新论文
💻 computer science

Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison

本研究表明,与标准模式相比,利用扩展推理推断显著提高了 GPT-5 在骨科住院医师入职考试问题上的准确率,尽管自信错误的持续存在表明这些模型应作为受监督的辅助工具,而非住院医师的主要学习资源。

原作者: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

发布于 2026-09-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每年,美国有数千名骨科手术住院医师参加一项严格的考试,以衡量他们对骨骼、关节和肌肉的知识掌握程度。这项被称为“骨科住院医师在职考试”的测试是他们培训过程中的一个关键检查点,有助于项目负责人判断一名受训者是否已准备好成为一名获得执业认证的外科医生。近年来,这些学生越来越多地转向人工智能工具来辅助学习。这些被称为“大语言模型”的工具是基于海量文本训练的计算机程序,能够回答问题、解释复杂概念,甚至模仿医学教科书的风格。它们已经变得如此强大,以至于通常可以自行通过医学考试。然而,一个关键的问题仍悬而未决:学生向计算机提问的方式是否会改变答案的质量?具体而言,强制计算机在说话之前先停下来并逐步推理问题,是否比要求它立即回答能产生更好的结果?

一支研究团队试图通过将一个先进的单一人工智能模型置于一系列测试中来寻找答案,测试使用的是 2024 年骨科考试的实际题目。他们并没有将不同的计算机程序品牌进行相互比较。相反,对于每一个问题,他们都对同一个程序使用了两次。首先,他们要求模型以标准模式回答,在这种模式下,它会快速生成响应。然后,研究人员向同一个模型提出了完全相同的问题,但这一次,他们将其切换到了“扩展推理”模式。在第二种设置中,计算机被指示花费更多时间在内部分解问题、权衡证据并思考逻辑,然后再写出最终答案。研究人员想要看看这种额外的“脑力劳动”(每个问题大约多花一分钟时间)是否真的会让计算机变得更聪明。

结果令人震惊。当模型以标准的快速模式回答时,它的正确率为 79%。这个分数已经非常出色,使计算机的表现大致与接受了五年培训的高年资住院医师持平。但当研究人员将模型切换到扩展推理模式时,准确率跃升至 93%。这并非计算机在某些问题上运气好或在另一些问题上运气差的情况。数据展示了一个清晰的模式:在快速模式下答对的每一个问题,在慢速模式下也都答对了。提升完全来自于那些此前答错的问题;在扩展模式下,它几乎纠正了所有的错误。研究人员发现,这种性能的提升发生在骨科手术的几乎所有领域,从手部损伤到脊柱疾病,而且无论问题是否包含 X 光片图像或仅仅是纯文本,情况都是如此。

尽管有了这种显著的进步,该研究也为任何使用这些工具的人敲响了一个微妙但重要的警钟。即使在计算机出错时,它的语气也和正确时一样自信。在极少数模型在深度思考后仍然给出错误答案的情况下,它既没有犹豫,也没有表达怀疑。它会提供详细的解释,甚至引用医学文献来支持其错误的抉择,使得这个错误听起来极具权威性。研究人员指出,如果一名学生本身并不知道正确答案,很容易被这种虚假的自信所误导。计算机也是可以被误导的;如果用户提出了一个错误的观点,模型往往会接受该观点,并围绕这个错误构建出一个自信且详尽的解释。

研究结论认为,虽然这些人工智能工具功能强大,但它们还不能完美替代人类教师或经过验证的学习资料。研究人员建议,对于使用这些工具的学生来说,最好的方法始终是使用扩展推理设置,因为这一分钟的思考时间能显著增加获得正确答案的机会。然而,输出的内容应始终被视为需要核实的草稿。计算机是一个用于组织学习计划或总结概念的有用助手,但它目前还无法被信任去判断自身的准确性。研究结果表明,我们与这些机器互动的方式与机器本身同样重要;一个简单的设置切换可以将一个好的答案变成一个卓越的答案,但它无法消除对人类监督的需求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →