← 최신 논문
💻 computer science

Extended Reasoning Mode Improves Large Language Model Accuracy on the Orthopaedic In-Training Examination: A Paired Within-Model Comparison

본 연구는 확장된 추론 추론(extended-reasoning inference)을 활용하는 것이 표준 모드와 비교하여 정형외과 전문의 수련 과정 시험(Orthopaedic In-Training Examination) 문제에 대한 GPT-5의 정확도를 유의미하게 향상시킨다는 것을 입증하였으나, 확신에 찬 오류가 지속된다는 점은 이러한 모델들이 전공의들을 위한 일차적인 학습 자원보다는 감독 하의 보조 도구로서 기능해야 함을 시사한다.

원저자: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

게시일 2026-09-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Claire A. Donnelley, Stephanie Kaszuba, Peter Noback, Xuan Luo

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매년 미국에서는 수천 명의 정형외과 레지던트들이 뼈, 관절, 근육에 대한 지식을 측정하기 위해 엄격한 시험을 치릅니다. 정형외과 인트레이닝 시험(Orthopaedic In-Training Examination)으로 알려진 이 테스트는 수련 과정의 중요한 점검 지표로, 프로그램 디렉터가 훈련생이 전문의 자격을 갖춘 외과의가 될 준비가 되었는지 결정하는 데 도움을 줍니다. 최근 몇 년 동안 이 학생들은 공부를 돕기 위해 인공지능 도구에 점점 더 많이 의존하고 있습니다. 거대 언어 모델(large language models)이라 불리는 이 도구들은 방대한 양의 텍스트를 학습하여 질문에 답하고, 복잡한 개념을 설명하며, 심지에는 의학 교과서의 문체를 흉내 낼 수도 있는 컴퓨터 프로그램입니다. 이들은 매우 유능해져서 종종 스스로 의학 시험을 통과하기도 합니다. 그러나 한 가지 중요한 질문이 해결되지 않은 채 남아 있었습니다. 바로 학생이 컴퓨터에게 생각하는 방식을 어떻게 요청하느냐에 따라 답변의 질이 달라지는가 하는 점입니다. 구체적으로, 컴퓨터에게 답변을 즉시 내놓으라고 요구하는 것보다 문제를 단계별로 추론하며 생각하도록 강제하는 것이 더 나은 결과를 만들어내는가 하는 것입니다.

연구팀은 하나의 고급 인공지능 모델을 사용하여 2024년 정형외과 시험의 실제 문제들로 일련의 테스트를 진행함으로써 그 답을 찾고자 했습니다. 연구진은 서로 다른 브랜드의 컴퓨터 프로그램을 서로 비교하지 않았습니다. 대신, 모든 질문에 대해 동일한 프로그램을 두 번 사용했습니다. 먼저, 모델에게 빠르게 응답을 생성하는 표준 모드로 답변하도록 요청했습니다. 그다음, 연구진은 정확히 같은 모델에게 정확히 같은 질문을 던졌지만, 이번에는 '확장 추론(extended reasoning)' 모드로 전환했습니다. 이 두 번째 설정에서 컴퓨터는 최종 답변을 타이핑하기 전에 내부적으로 문제를 분해하고, 증거를 검토하며, 논리를 깊이 생각하는 데 더 많은 시간을 할애하도록 지시받습니다. 연구진은 이 추가적인 정신적 노력이 약 1분 정도의 시간을 더 소요하게 만드는데, 이것이 실제로 컴퓨터를 더 똑똑하게 만들 수 있는지 확인하고자 했습니다.

결과는 놀라웠습니다. 모델이 표준의 빠른 모드로 답변했을 때, 79퍼센트의 문제를 맞혔습니다. 이 점수는 이미 인상적이었으며, 컴퓨터의 성능을 5년 차 수련의와 거의 대등한 수준으로 올려놓았습니다. 하지만 연구진이 모델을 확장 추론 모드로 전환하자 정확도가 93퍼센트로 급증했습니다. 이는 컴퓨터가 운 좋게 몇 문제를 맞히거나 운 나쁘게 틀린 경우가 아니었습니다. 데이터는 명확한 패턴을 보여주었습니다. 컴퓨터가 빠른 모드에서 맞힌 모든 문제는 확장 추론 모드에서도 맞혔습니다. 개선은 오직 이전에 틀렸던 문제들로부터 나왔습니다. 확장 모드에서는 이전의 실수 대부분을 바로잡았습니다. 연구진은 이러한 성능 향상이 손 부상에서 척추 질환에 이르기까지 정형외과 수술의 거의 모든 영역에서 발생했으며, 질문에 엑스레이 사진이 포함되어 있는지 아니면 텍스트만 있는지는 중요하지 않다는 것을 발견했습니다.

이러한 극적인 개선에도 불구하고, 연구는 이 도구들을 사용하는 사람들에게 미묘하지만 중요한 경고를 찾아냈습니다. 컴퓨터가 틀렸을 때조차도, 그것은 맞았을 때와 똑같이 자신감 넘치는 태도를 보였습니다. 모델이 깊이 생각한 후에도 여전히 오답을 낸 몇몇 사례에서, 모델은 주저하거나 의구심을 표하지 않았습니다. 모델은 상세한 설명을 제공하고 심지어 잘못된 선택을 뒷받침하기 위해 의학 문헌을 인용하기까지 하여, 그 오류를 매우 권위 있게 들리도록 만들었습니다. 연구진은 만약 학생이 정답을 이미 알고 있지 않다면, 이러한 가짜 자신감에 쉽게 현혹될 수 있다고 지적했습니다. 컴퓨터는 속을 수도 있습니다. 사용자가 잘못된 아이디어를 제시하면, 모델은 종-종 이를 받아들이고 그 실수 위에 자신감 있고 상세한 설명을 구축해 나갑니다.

이 연구는 인공지능 도구가 강력하기는 하지만, 인간 교사나 검증된 학습 자료를 대체할 완벽한 존재는 아니라는 결론을 내립니다. 연구진은 이 도구들을 사용하는 학생들에게 가장 좋은 방법은 항상 확장 추론 설정을 사용하는 것이라고 제안합니다. 왜냐하면 추가적인 1분의 생각 시간이 정답 확률을 크게 높여주기 때문입니다. 그러나 출력물은 항상 검증이 필요한 초안으로 취급되어야 합니다. 컴퓨터는 학습 계획을 정리하거나 개념을 요약하는 데는 유용한 조수이지만, 아직 자신의 정확성을 스스로 판단하도록 신뢰할 수는 없습니다. 이번 연구 결과는 우리가 이러한 기계와 상호작용하는 방식이 기계 자체만큼이나 중요하다는 것을 보여줍니다. 단순한 설정의 전환이 좋은 답변을 훌륭한 답변으로 바꿀 수 있지만, 그것이 인간의 감독 필요성을 없애지는 못합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →