Associations Between Multi-Source Formative Assessment and Summative Examination Performance in Undergraduate Diagnostic Medicine: Evidence Supporting Programmatic Assessment
본 연구는 인지, 절차 및 의사소통 영역에 걸친 다원적 형성 평가가 학부 진단 의학 시험 성적을 예측하는 데 있어 유의미한 증분 타당도를 제공한다는 점을 입증함으로써, 다영역 프로그램 기반 평가 시스템의 설계를 뒷받침하는 동시에 천장 효과로 인한 이론 과제의 한계를 강조한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
마을에서 누가 최고의 제빵사인지 알아내려고 한다고 상상해 보세요. 단순히 그들에게 어느 토요일에 거대한 케이크 하나를 구워 오라고 시킨 뒤, 그 단 한 번의 결과로 판단할 수도 있습니다. 그것은 '총괄적(summative)' 평가와 같습니다. 즉, 단 한 번 일어나는 크고 최종적인 시험인 것이죠. 하지만 만약 당신이 그들이 실제로 어떻게 배우는지 보고 싶다면 어떨까요? 그들이 매주 빵 만드는 연습을 하는 것을 지켜보고, 까다로운 반죽을 어떻게 다루는지 보며, 고객들과 어떻게 대화하는지 귀를 기울인다면 어떨까요? 그것이 바로 '형성적(formative)' 평가입니다. 즉, 학생들의 성장을 돕기 위해 시간이 흐름에 따라 진행되는 작고 부담 없는 일련의 점검 과정인 것이죠.
의과대학의 세계에서, 교사들은 이 두 가지 접근 방식을 섞는 가장 좋은 방법을 찾으려 노력하고 있습니다. 그들은 '프로그래매틱 평가(programmatic assessment)'라고 불리는 시스템을 사용하는데, 이는 수백 개의 작은 타일로 거대한 모자이크를 만드는 것과 같습니다. 각 타일은 작은 과제나 빠른 점검입니다. 이 아이디어는 만약 그 모든 타일을 함께 본다면, 단 하나의 큰 그림만 보는 것보다 학생의 기술에 대해 훨씬 더 명확한 그림을 얻을 수 있다는 것입니다. 하지만 여기서 까다로운 점은, 그 작은 타일들이 실제로 학생이 최종 시험에서 얼마나 잘할지를 예측할 수 있느냐는 것입니다. 그리고 두뇌력을 테스트하는 것, 손기술을 테스트하는 것, 그리고 말하기 기술을 테스트하는 것과 같은 서로 다른 유형의 타일들이 각각 퍼즐에 고유한 조각을 더해주는가 하는 점입니다.
광둥 의과대학교의 이 연구는 바로 그 질문을 깊이 파고듭니다. 연구진은 진단 의학(환자의 무엇이 잘못되었는지 알아내는 법을 배우는 과정) 과정을 수강하는 382명의 의대생들을 조사했습니다. 그들은 학기 내내 진행된 다섯 가지 유형의 숙제와 실습 과제를 추적했으며, 이 모든 것은 단일 온라인 플랫폼에 기록되었습니다. 그들은 이 '연습 타일'들이 학생들의 기말 필기시험 점수를 예측할 수 있는지 알고 싶었습니다.
연구 결과는 다음과 같았는데, 이는 마치 어떤 손님은 훨씬 더 도움이 되고 어떤 손님은 그렇지 않은 깜짝 파티와도 같습니다. 첫째, 거의 모든 유형의 연습 과제가 기말고사 점수와 연관되어 있다는 것을 발견했습니다. 만약 학생이 연습을 잘했다면, 기말고사에서도 잘하는 경향이 있었습니다. 하지만 연구진이 어떤 과제가 '실질적인 독립적 예측 변수'인지(즉, 다른 과제들이 이미 다루지 않은 새로운 정보를 제공하는 것이 무엇인지) 자세히 살펴보았을 때, 결과는 흥미로워졌습니다.
'두뇌' 관련 과제들은 복합적이었습니다. 강의 직후에 객관식 문제를 푸는 한 유형의 숙제는 일종의 함정임이 드러났습니다. 모두의 점수가 너무 높아서(평균 100점 만점에 89.04점) 천장 효과(ceiling effect)가 나타났습니다. 즉, 거의 모든 사람이 상한선에 도달했기 때문에 우수한 학생과 뛰어난 학생을 구분해낼 수 없었습니다. 그것은 너무 쉬웠고 수업 직후에 이루어졌기에 유용한 예측 도구가 될 수 없었습니다. 그러나 '문제 기반 학습(PBL)'이라 불리는 다른 인지 과제는 슈퍼스타였습니다. PBL에서 학생들은 복잡한 의학적 미스터리를 해결하기 위해 그룹으로 협력합니다. 이 과제는 강력한 예측 변수였으며, 이는 문제를 통해 추론하는 능력이 성공의 핵심이라는 점을 시사합니다.
그다음은 '손기술' 관련 과제였습니다. 학생들은 신체 검진(심장 박동을 확인하거나 폐 소리를 듣는 것 등)을 수행하는 자신의 영상을 녹화하고 교수로부터 피드백을 받아야 했습니다. 이 영상 과제는 또 다른 주요 승자였습니다. 이 과제는 학생들의 지적 능력이나 그룹 퍼즐 수행 능력을 고려하더라도 기말고사 점수를 예측해 냈습니다. 이는 자신을 녹화하고, 피드백을 받고, 기술을 수정하는 행위 자체가 단순히 손을 움직이는 법뿐만 아니라 내용을 깊이 있게 학습하는 데 실제로 도움이 된다는 것을 시사합니다.
마지막으로 '사람' 관련 과제가 있었습니다. 학생들은 의료 이력을 청취하는 법을 배우기 위해 배우(표준화 환자)와 대화하는 연습을 했습니다. 이 과제는 예측에 작지만 실제적인 도움을 주었습니다. 가장 큰 요인은 아니었지만, 다른 테스트가 놓친 고유한 정보 조각을 추가했습니다.
이 모든 조각을 합쳤을 때, 연구는 이러한 다양한 유형의 연습 과제들이 기말고사 성적 차이의 약 50.5%를 설명한다는 것을 발견했습니다. 연구진은 좋은 평가 시스템은 인지(사고), 절차(실행), 의사소통(대화)이라는 세 가지 유형의 '타일'을 모두 갖추어야 한다고 결론지었습니다. 또한, 만로 어떤 숙제가 미래의 성공을 예측하는 좋은 도구가 되기를 원한다면, 단순히 수업 직후에 하는 빠르고 쉬운 퀴즈가 아니라 학생들을 구분해낼 수 있을 만큼 충분히 도전적이어야 한다는 점도 배웠습니다. 이 모든 데이터를 하나의 온라인 플랫폼을 통해 수집함으로써, 학교는 학생의 여정에 대한 훨씬 더 풍부하고 정확한 그림을 그려낼 수 있으며, 이는 학습이 단 한 번의 큰 시험을 통과하는 것 이상의 의미가 있음을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.