Inverted validity arguments in the evaluation of India’s national professionalism curriculum: a systematic review
이 체계적 문헌고찰은 인도의 국가 AETCOM 전문성 교육과정을 평가하는 기존 문헌들이 방법론적으로 결함이 있고 "역전되어" 있으며, 취약한 설계와 미사여구에 기반하여 효과성에 대해 크고 자신만만한 주장을 펼치는 동시에, 해당 교육과정이 실제 의료 현장의 실무를 실제로 개선하는지 판단하는 데 필요한 근거를 제공하는 데는 실패하고 있음을 밝히고 있다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 새로운 정부 주도 레시피인 "완벽한 수프"가 실제로 사람들을 더 건강하게 만들고 있는지 알아내려는 셰프라고 상상해 보십시오. 의학 교육의 세계에서 이 레시피는 미래의 의사들에게 친절하고, 윤리적이며, 환자와 대화하는 법을 가르치기 위해 설계된 인도의 국가 프로그램인 AETCOM이라고 불립니다. 하지만 까다로운 점은, 이 수프가 실제로 효과가 있는지 어떻게 알 수 있느냐는 것입니다. 단순히 셰프에게 수프 맛이 어떤지 물어볼 수도 없고, 재료 목록만 들여다볼 수도 없습니다. 당신은 실제 레스토랑에서 진짜 손님들에게 수프가 서빙될 때 어떤 일이 일어나는지 지켜봐야 합니다. 이것이 바로 "평가(evaluation)"라는 과학이 등장하는 지점입니다. 평가는 수업이 단순히 교실 안에서뿐만 아니라 실제 세상에서 행동을 변화시키는지 확인하는 과정입니다. 이를 제대로 수행하기 위해 과학자들은 몇 가지 큰 개념을 사용합니다. "타당도(Validity)"는 마치 당신의 자가 길이를 재는 것이 아니라 온도를 재고 있는 것은 아닌지 확인하는 것과 같으며, "훈련의 전이(Transfer of Training)"는 주방에서 배운 것이 레스토랑이 바빠졌을 때 실제로 요리를 더 잘하는 데 도움이 되는지를 묻는 것이고, "스핀(Spin)"은 누군가가 작은 성공을 거대한 승리처럼 보이게끔 보고서를 작성하는 것을 의미합니다.
이제, 연구자 시달링가이아(Siddalingaiah)와 마살리(Masali)라는 탐정 팀이 이 "완벽한 수프" 레시피에 대해 작성된 보고서 더미를 조사하기로 결정했다고 상상해 보십시오. 그들은 단순히 "수프가 효과가 있는가?"라고 묻지 않았습니다. 그들은 훨씬 더 기묘한 질문을 던졌습니다: "우리가 가진 보고서들이 과연 그 질문에 답할 능력이 있는가?" 그들은 AETCOM 커리큘럼을 테스트하려고 시도했던 2015년 이후의 수많은 연구를 살펴보았습니다. 그들이 발견한 것은 마치 모든 사람이 수프가 환상적이라고 외치고 있지만, 정작 아무도 레스토랑에서 수프를 맛보고 있지 않은 방에 들어선 것과 같았습니다. 대신, 그들은 주방에서 생재료를 맛보거나, 단지 셰프가 어떻게 느끼는지에 대해서만 묻고 있었습니다.
탐정들은 이 연구들에서 보고된 성공의 "크기"가 수프가 얼마나 좋은가가 아니라, 전적으로 테스트가 어떻게 설정되었는지에 달려 있다는 것을 발견했습니다. 교사가 수업 직후에 학생들을 직접 채점했을 때, 결과는 이미 훌데가도 1인 척도에서 3.49를 기록할 만큼 거대하고 찬란했습니다. 하지만 연구자들이 교육을 받은 학생과 받지 않은 학생을 실제로 비교한 단 두 개의 연구를 찾아냈을 때, 그 마법은 사라졌습니다. 점수는 고작 0.12로 떨어졌습니다. 이는 마치 첫 번째 테스터들은 모든 것을 더 크게 보이게 만드는 돋보기를 사용했고, 두 번째 그룹은 평범하고 정직한 거울을 사용한 것과 같습니다. 논문은 테스트의 규칙이 더 "허용적(permissive)"이거나 느슨할수록, 보고된 성공이 더 커 보인다는 점을 보여줍니다.
더 흥미롭게도, 연구자들은 "스핀(spin)"의 이상한 패턴을 목격했습니다. 그들은 보고서의 75%에서 저자들이 실제로 측정한 것보다 훨씬 더 나아간 주장을 하고 있다는 것을 발견했습니다. 이것은 마치 학생이 철자 시험에서 'A'를 받고 나서, 자신의 보고서에 "이것은 내가 문학 노벨상을 받을 것임을 증명한다"라고 쓰는 것과 같습니다. 연구들은 "학생들이 어떻게 느끼는지"나 "시험에서 무엇을 알고 있는지" 등을 측정했지만, 보고서들은 의사들이 이제 환자를 더 잘 치료하고 있거나 소송이 사라질 것이라고 주장했습니다. 사실, 89%의 보고서가 자신들의 증거가 뒷받-칠 수 있는 것 이상의 내용을 주장했습니다. 그들은 증거가 가장 부족한 부분에서 오히려 확신에 차 있었습니다.
또한, 이 논문은 아무도 "작업 환경(workplace conditions)"을 확인하지 않았다는 점을 지적합니다. 이것을 다음과 같이 생각해 보십시오. 당신이 빈 주차장에서 완벽하게 주차하는 법을 가르칠 수는 있지만, 만약 실제 도시의 거리들이 막히고 붐비며 상사가 빨리 운전하라고 지시한다면, 당신은 결국 사고를 낼 수도 있습니다. 연구자들은 의사의 상사가 새로운 행동을 지지하는지 확인한 연구가 5%에 불과하며, 의사들이 배운 것을 연습할 기회가 있었는지 확인한 연구는 12%에 불과하다는 것을 발견했습니다. 주차장이 열려 있는지 알지 못한다면, 운전자에게 주차를 잘하지 못한 책임을 물을 수 없으며, 운전 학구에도 책임을 물을 수 없습니다.
그렇다면 결론은 무엇입니까? 이 논문은 AETCOM 커리큘럼이 나쁘다거나 효과가 없다고 말하는 것이 아닙니다. 현재 우리가 그것을 테스트하는 방식이 망가져 있다고 말하는 것입니다. 증거 기반이 "역전(inverted)"되어 있습니다. 즉, 증거가 가장 약한 곳에서 가장 크고 확신에 차 있습니다. 저자들은 우리가 아직 커리큘럼이 성공인지 실패인지 알 수 없다고 결론짓는데, 그 이유는 우리가 의사들이 실제 병원에서 실제 환자를 상대할 때 그 교훈이 제대로 전달되는지 볼 수 있는 테스트를 구축하지 못했기 때문입니다. 그들은 우리가 "돋보기" 테스트를 중단하고, 실제 세상에서 어떤 일이 일어나는지 관찰하며, 환경이 새로운 기술을 사용할 수 있게 해주는지를 확인하는 시스템을 구축해야 한다고 제안합니다. 그렇게 할 때까지, 생명을 구하고 관계를 회복한다는 거창한 주장들은 그저 주장일 뿐, 증명된 사실이 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.