Evaluation in the Age of AI: Output as Evidence of Learning
이 논문은 고등 교육에서 AI의 광범위한 도입이 전통적인 측정 방식과 진정한 이해 사이의 불일치를 해결하고 학생의 주체성을 보존하기 위해, 평가 전략을 최종 결과물을 평가하는 것에서 학습 과정을 강조하는 방향으로 근본적으로 전환해야 한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
지난 한 세기 동안 대학들은 단순하고도 암묵적인 합의 하에 운영되어 왔다. 바로 학생이 제출한 과업이 그들이 배운 것을 증명한다는 것이다. 그것이 에세이든, 수학적 증명이든, 혹은 컴퓨터 프로그램이든, 최종 결과물은 그것을 만들어내는 데 필요한 정신적 노력의 직접적인 반영으로 취급되었다. 이 시스템은 실용적이었기에 작동할 수 있었다. 학교가 결과물의 품질을 바탕으로 기술을 인증하고 성취도를 서열화하는 것을 허용했기 때문이다. 그 기저에 깔린 믿음은 만약 학생이 고품질의 결과물을 만들어냈다면, 그 과정에서 반드시 필요한 사고 과정을 거쳤을 것이라는 점이었다. 최종 결과물과 내부적인 학습 과정 사이의 이 연결 고리는 고등 교육이 성공을 측정하는 토대가 되어 왔다.
그 연결 고리가 끊어졌다. 인간과 유사한 텍스트와 코드를 생성할 수 있는 능력을 갖춘 강력한 인공지능 시스템의 등장은 하룻밤 사이에 지형을 바꾸어 놓았다. 이러한 도구들은 과거에 인간의 사고와 고통이 필요했던 작업을 단 몇 초 만에 정교하게 수행해 낼 수 있다. 초보자와 전문가 사이의 장벽은 사실상 사라졌으며, 이는 학생이 스스로 정신적 노동을 수행하지 않고도 설득력 있는 에세이나 복잡한 컴퓨터 스크립트를 생성할 수 있음을 의미한다. 이는 교육에 있어 위기를 초래한다. 만약 최종 결과물이 더 이상 학생이 자료를 이해하고 있다는 증거가 되지 못한다면, 학교는 어떻게 학습을 평가할 수 있겠는가? '결과물'을 채점하던 기존의 방식은 더 이상 '입력'으로서의 학습을 입증하는 신뢰할 수 있는 근거가 되지 못한다.
버지니아 공과대학교의 연구진들은 단순히 학업적 정직성의 문제를 넘어, 자동화된 시대에 교육이 어떻게 작동해야 하는가라는 더 깊은 질문을 던지며 이 파괴적 현상을 조사했다. 그들은 문제가 단순히 학생들이 이러한 도구를 부정직하게 사용하는 것에 그치는 것이 아니라, 평가 시스템 전체가 측정하고자 하는 목적과 어긋나 있다고 주장한다. 학교가 최종 결과물을 유일한 학습의 증거로 의존할 때, 학교는 학생의 실제 이해도, 추론, 또는 판단력을 측정하는 것이 아니라, AI 사용을 숨기는 능력이나 값비싼 기술에 대한 접근성을 측정하게 된다. 연구진은 현재의 초점이 부정행위자를 잡아내는 데 집중되어 있는 것은 막다른 길이며, 학교가 학습 과정 그 자체로 초점을 옮겨야 한다고 제안한다.
현실을 파악하기 위해 연구진은 북미와 방글라데시 대학의 고등 교육 전문가와 학생 20명을 대상으로 설문 조사를 실시했다. 그들은 실제로 가르치는 사람들이 이러한 새로운 도구와 이를 저지하기 위해 설계된 정책들에 대해 어떻게 느끼는지 알고 싶어 했다. 결과는 학교가 하고 있는 일과 교사들이 효과적이라고 믿는 일 사이의 깊은 괴리를 보여주었다. 대부분의 기관이 AI 생성물을 탐지하는 소프트웨어 사용을 의まま하고 있지만, 교사들 자신은 이러한 도구에 대해 신뢰가 매우 낮았다. 설문 조사에서 20명의 응답자 중 15명이 소속 기관이 탐지 소프트웨어에 크게 의존하고 있다고 답했으나, 이 도구들이 정확하거나 공정하다고 확신한다고 답한 응답자는 4명뿐이었다. 이 격차는 학교가 과정의 무결성을 실제로 믿지 않으면서도 형식적으로만 준수 사항을 이행하고 있음을 시사한다.
연구는 이 문제가 코드의 '정확성'이 흔히 이진법적으로 결정되는 컴퓨터 과학과 같은 분야에서 특히 심각하다는 것을 발견했다. 이러한 영역에서 인공지능은 완벽한 코드를 작성하는 데 탁월하며, 이로 인해 정답을 확인하는 전통적인 채점 방식은 학생의 이해도를 측정하는 데 무용지물이 된다. 또한 연구진은 우려스러운 새로운 형태의 불평등을 발견했다. 프리미엄 버전의 AI 도구에 비용을 지불할 여력이 있는 학생들은 무료 버전을 사용하는 학생들보다 더 명확하고 논리적인 결과물을 만들어냈다. 이는 현재의 평가 방식이 학생의 타고난 학업 능력이 아니라, 더 나은 기술을 구매할 수 있는 능력을 부당하게 채점하고 있음을 의미한다. 나아가, 무료 도구에 의존하는 저소득층 배경의 학생들은 이중의 불이익을 받는다. 이들은 더 낮은 품질의 도움을 받을 뿐만 아니라, 조잡한 AI 출력물을 식별하도록 조정된 탐지 도구로부터 더 큰 의심을 받게 된다.
감시 중심적 접근 방식이 초래하는 인간적 비용 또한 상당하다. 연구진은 많은 교육자가 멘토에서 '디지털 검사관'으로 변모하는 과정에서 번아웃을 느끼고 있다고 밝혔다. 수업을 설계하거나 학생들을 돕는 대신, 교사들은 신뢰할 수 없는 탐지 소프트웨어의 경고를 바탕으로 AI 사용을 입증하기 위해 자신의 학생을 상대로 사건을 구성하는 데 시간을 허비해야 한다. 이는 교사와 학생 사이의 관계를 해치는 의심의 분위기를 조성한다. 적발될 것에 대한 두려움은 '공개 함정(disclosure trap)'을 만든다. 즉, 학생들은 AI 사용이 허용되는 상황임에도 불구하고 어쨌든 처벌받을 것을 우려하여 AI 사용을 인정하기를 두려워하게 된다. 이러한 공포는 도구의 사용을 지하로 숨어들게 만들며, 학습 과정을 덜 투명하고 덜 정직하게 만든다.
연구진은 해결책이 더 나은 탐지 소프트웨어에 맞서 패배가 예정된 싸움을 하는 것이 아니라, 무엇을 평가할 것인가를 바꾸는 것이라고 주장한다. 그들은 평가의 대상을 최종 결과물에서 학습 여정으로 전환할 것을 제안한다. 이는 학생들이 수업 중에 자신의 추론을 설명하거나, 주석이 달린 초안을 제출하거나, 자신의 아이디어를 방어하는 구술 시험에 참여하는 등, 사고 과정을 가시화하는 평가를 설계하는 것을 의미한다. 연구진이 '바람직한 어려움(desirable difficulties)'이라고 부르는 이러한 방식은 인지적 노동이 교사의 눈앞에서 일어나도록 보장한다. 정답 자체보다는 정답에 도달하는 방식에 집중함으로써, 학교는 진정한 이해와 비판적 판단을 더 잘 측정할 수 있다.
이 논문은 최종 결과물을 학습의 유일한 증거로 사용하는 시대가 끝나가고 있다고 결론짓는다. 구식 방법에 계속 의존하는 기관들은 모니터링이 불가능해지는 경계를 감시하기 위해 더 많은 자원을 쏟아부으며 끝없는 감시의 순환 속에 갇히게 될 것이다. 연구진은 이 파괴적 현상이 위협일 뿐만 아니라, 더 공정하고 의미 있는 시스템을 구축할 수 있는 기회라고 제안한다. 학습 과정을 우선시하고 의심의 문화를 탈피함으로써, 대학은 학생과 교사가 함께 진정한 이해를 증명할 수 있는 환경을 조성할 수 있다. 앞으로 나아가는 길은 새로운 교수법과 평가 방식에 투자하려는 의지를 필요로 하며, 이를 통해 교육이 세련된 결과물을 만들어내는 능력이 아닌 인간의 사고 능력에 계속해서 집중할 수 있도록 보장해야 한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.