Convergent assessment cannot be policed: a residual-entropy bound on authorship attribution and its consequences for integrity in quantitative disciplines
이 논문은 객관식 문제와 같은 수렴적 평가 형식의 경우 정답이 잔여 엔트로피를 전혀 포함하지 않아 저자 식별이 구조적으로 불가능하며, 따라서 에세이 탐지에 기반한 현재의 AI 무결성 정책은 정량적 학문 분야에 부적절하고 양식 특화된 통제가 필요하다고 주장한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 풀려는 탐정이라고 상상해 보십시오. 미스터리는 바로 "이것을 누가 썼는가?"입니다. 학교와 대학교의 세계에서 이것은 학술적 정직성(academic integrity)에 관한 궁극적인 질문입니다. 수년 동안 탐정들이 사용해 온 주요 도구는 긴 이야기를 쓰는 데 특화된 일종의 '지문 스캐너', 즉 에세이용 스캐너였습니다. 이 스캐너들은 사람이 글을 쓸 때 나타나는 쉼표 사용 방식이나 문장 구조와 같은 작고 독특한 습관들을 찾아냅니다. 하지만 반전이 있습니다. AI 챗봇이 이야기를 쓰는 능력이 너무나 뛰어나진 나머지, 이 스캐너들이 고전하고 있다는 점입니다. 학교들은 학생들의 다른 모든 활동, 즉 수학 문제, 객관식 퀴즈, 코딩 과제 등에 이 '에세이 스캐너'의 논리를 적용함으로써 이를 해결하려 노력하고 있습니다.
이것이 왜 막다른 골목이 될 수 있는지 이해하려면 두 가지 간단한 개념을 살펴봐야 합니다. 첫째, '정보'를 메시지에 담긴 독특한 세부 사항의 양이라고 생각해 보십시오. 긴 에세이는 매우 복잡하고 독특한 지문과 같습니다. 그것은 작성자가 누구인지 알려줄 수 있는 수많은 미세한 디테일을 가지고 있습니다. 하지만 수학 답안인 숫자 "42"는 완벽하고 매끄러운 구슬과 같습니다. 두 사람이 동일한 문제를 올바르게 풀었다면, 두 사람 모두 정확히 똑같은 "42"를 만들어냅니다. 여기에는 무질서함도, 독특한 지문도, 검사할 만한 추가적인 디테일도 없습니다. 둘 둘째, '저자 식별(authorship attribution)'을 그 독특한 디테일을 사용하여 누가 그 일을 했는지 증명하는 행위라고 생각해 보십시오. 애초에 독특한 디테일이 존재하지 않는다면, 아무리 화려한 기술이라도 그것을 마법처럼 만들어낼 수는 없습니다. 이 논문은 다음과 같은 대담한 질문을 던집니다. "우리가 매끄러운 구슬에 지문 스캐너를 적용하려고 한다면 어떤 일이 벌어질까?"
논문의 핵심 발견: "매끄러운 구절(Smooth Marble)" 문제
*"수렴적 평가는 감시될 수 없다(Convergent assessment cannot be policed)"*라는 제목의 이 연구 논문은 학교들이 근본적인 실수를 저지르고 있다고 주장합니다. 학교들은 에세이 기반의 규칙을 수학, 과학, 객관식 시험에 적용하려 하고 있지만, 저자는 이것이 불가능하다고 말합니다. 이는 AI 탐지기가 나쁘거나 도구를 개선해야 하기 때문이 아니라, 작업의 유형 자체가 저자를 식별할 수 있을 만큼의 정보를 포함하고 있지 않기 때문입니다.
저자는 **"잔여 엔트로피(residual entropy)"**라는 개념을 도입합니다. 쿠키를 굽는다고 상상해 보십시오. 만약 학생에게 "쿠키에 관한 이야기를 써라"라고 요청한다면, 학생은 시를 쓸 수도 있고, 공포 소설을 쓸 수도 있으며, 레시피를 쓸 수도 있습니다. 이를 수행하는 방법은 수백만 가지이며, 각 버전은 작성자의 스타일이라는 독특한 '지문'을 가집니다. 이것은 높은 엔트로피입니다. 하지만 학생에게 "X를 구하라"고 요청하고 답이 "5"라면, 그 답을 적는 올바른 방법은 단 하나뿐입니다. 천재가 썼든, 고군분투하는 학생이 썼든, 혹은 초지능 로봇이 썼든, 결과물은 정확히 똑같은 "5"입니다. 저자는 이를 **"제로 잔여 엔트로피"**라고 부릅니다. 정답이 결정되는 순간, 분석할 수 있는 변동성은 제로가 됩니다.
이 논문은 수학적으로 우리가 실제로 존재하는 것보다 더 많은 정보를 추출할 수 없음을 증명합니다. 만약 답이 단 하나의 글자나 숫자라면, 찾아낼 수 있는 '신호(signal)'는 존재하지 않습니다. 이러한 형식에 AI 탐지기를 사용하는 것은 마치 완벽하게 매끄럽고 빈 유리판에서 지문을 찾으려는 것과 같습니다. 아무리 강력한 현미경을 사용하더라도, 유리에 지문이 없다면 결코 찾을 수 없을 것입니다.
세 가지 위험 구역
저자는 13개 과목에 걸친 19개의 서로 다른 연구 데이터로부터 학교 과제들이 어디에 위치하는지 지도화했습니다. 그 결과 세 가지 뚜렷한 "구역" 또는 체제를 발견했습니다.
- 노출 구역 (위험 구역): 여기에는 객관식 질문, 짧은 수치형 답안, 표준 문제 세트가 포함됩니다. 이 구역에서 AI는 매우 뛰어난 성능을 보이지만(객관식에서 종종 96% 이상의 점수 기록), 답안에는 저자 신호가 전혀 없습니다. 논문은 이 구역에서 인간이 했는지 로봇이 했는지 구별하는 것이 불가능하다고 주장합니다. 이는 단순히 "구별하기 어려운 것"이 아니라, "이것을 누가 했는가?"라는 질문 자체가 답이 없는 상태임을 의미합니다.
- 잠재 구역 (대기실): 여기에는 현재 AI가 쉽게 통과할 만큼 충분히 똑똑하지 않은 짧은 수치 문제들이 포함됩니다. 이들은 현재 "안전"해 보이지만, 이는 AI가 아직 충분히 똑똑하지 않기 때문일 뿐입니다. 저자는 이것이 시한폭탄이라고 경고합니다. 일단 AI가 이 영역까지 잘 해내게 되면, 저자 신호를 뒷받침할 수 있는 수단이 없기 때문에 "안전함"은 순식간에 사라질 것입니다.
- 탐지 가능 구역 (안전 구역): 여기에는 긴 에세이, 성찰적 글쓰기, 복잡한 코딩 프로젝트가 포함됩니다. 이곳에서는 답안이 매우 다양하고 독특하기 때문에 AI 탐지기가 작동할 수 있습니다. 논문은 코드 내의 AI 탐지 연구가 성공적인 이유가, 단순한 수학 답안과 달리 코드에는 '지문' 역할을 할 수 있는 충분한 디테일이 있기 때문이라고 언급합니다.
충격적인 수치들
저자가 전형적인 과학 및 공학 대학 프로그램에 이 논리를 적용했을 때, 결과는 놀라웠습니다. 그는 과학 및 공학 프로그램의 최종 성적 중 **38%**가 "노출 구역"(객관식 및 문제 세트 등)에 속하는 과제에서 나온다는 것을 발견했습니다. 반면, 인문학 프로그램에서 이러한 함정에 빠지는 비율은 단 **5%**에 불과했습니다.
만약 증거의 기준을 형사 재판 수준(매우 높은 기준)으로 높인다면, 과학 및 공학 분야의 노출된 과제의 비율은 **52%**로 급증합니다. 이는 과학 전공생의 최종 성적 중 절반 이상에 대해, 학교 측이 실제로 누가 그 일을 했는지 증명할 방법이 없으며, 이를 위한 도구 또한 존재하지 않는다는 것을 의미합니다.
학교에 주는 시사점
이 논문은 단순히 더 좋은 소프트웨어를 구매한다고 해서 해결될 문제가 아니라는 점을 명시적으로 배제합니다. 저자는 객관식이나 수학 문제에 대해 탐지 기술을 개선하는 것으로는 문제를 해결할 수 없다고 명확히 밝히는데, 그 이유는 정보 자체가 그곳에 존재하지 않기 때문입니다. 수학 퀴즈에서 AI 탐지기를 근거로 학생을 부정행위로 몰아세우는 것은 비효-율적일 뿐만 아니라, 저자의 주장에 따르면 수학적으로 입증이 불가능한 일입니다.
대신, 이 논문은 학교가 전략을 완전히 바꿔야 한다고 제안합니다:
- 감시 불가능한 것을 감시하려 하지 마십시오: 객관식이나 단답형 수학 문제에 저자 식별기를 사용하지 마십시오. 그것은 시간 낭비이며 부당한 비난을 초래할 뿐입니다.
- 게임의 규칙을 바꾸십시오: 누가 그 일을 했는지 알고 싶다면 과제 자체를 바꿔야 합니다. 감독 하에 시험을 치르거나, 자신의 생각을 직접 설명하게 하거나, AI가 답을 쉽게 찾아볼 수 없도록 특정 강의실 상황에 특화된 문제를 설계하십시오.
- 한계를 인정하십시오: "노출 구역"에 대한 유일한 실제 보안책은 사후에 잡아내는 것이 아니라, AI 사용 자체를 사전에 차단하는 것(예: 격리된 공간에서의 시험)입니다.
요약하자면, 이 논문은 현재의 "원사이즈(one-size-fits-all)" 방식의 학술적 정직성 접근법은 깨졌다고 결론짓습니다. 에세이를 위해 설계된 도구를 수학 문제를 감시하는 데 사용할 수는 없습니다. 과학 및 공학 교육의 거대한 부분에 대해, 현재의 문제는 "어떻게 부정행위자를 잡을 것인가?"가 아니라, "어떻게 하면 승인되지 않은 AI 사용이라는 질문 자체가 성립하지 않도록 시험을 설계할 것인가?"가 되어야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.