← 최신 논문
💻 computer science

A systematic comparison of Large Language Models for automated assignment assessment in programming education: Exploring the importance of architecture and vendor

본 연구는 자동 프로그래밍 과제 채점을 위한 18개의 현대적 거대 언어 모델에 대한 최초의 대규모 체계적 비교를 제시하며, 아키텍처와 벤더에 따른 상당한 성능 차이, 소형 모델 변체들의 일관된 저조한 성능, 그리고 자동화된 합의와 인간 교사의 평가 사이의 지속적인 중간 수준의 격차를 밝혀낸다.

원저자: Marcin Jukiewicz

게시일 2026-08-04
📖 6 분 읽기🧠 심층 분석

원저자: Marcin Jukiewicz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 산더미 같은 숙제를 채점해야 하는 교사라고 상상해 보세요. 채점해야 할 프로그래밍 과제가 6,000개나 있고, 눈은 이미 피로에 지쳐 있습니다. 이때 "디지털 채점기(Digital Grader)"가 등장합니다. 이는 거대 언어 모델(LLM)이라고 불리는 초지능형 컴퓨터 뇌의 일종입니다. 이 모델들을 인터넷상의 거의 모든 것, 즉 수백만 줄의 코드까지 읽어낸 매우 박식한 로봇이라고 생각하면 됩니다. 이들은 언어와 논리를 이해하도록 설계되었기에, 학생들의 과제를 즉각적으로 채점하는 데 완벽한 아이디어처럼 보입니다. 하지만 여기 함정이 있습니다. 인간과 마찬가지로, 이 로봇들에게도 각기 다른 성격이 있다는 점입니다. 어떤 로봇는 엄격하고, 어떤 로로봇는 관대하며, 어떤 로봇는 그냥 이상하기도 합니다. 학교의 큰 고민은 이것입니다. 만약 우리가 이 로봇들에게 채점을 맡긴다면, 그들이 공정할까요? 그들이 인간 교사와 의견이 일치할까요? 아니 아니면 채점 시스템을, 똑같은 코드에 대해 한 로봇은 A+를 주고 다른 로봇은 F를 주는 혼란스러운 게임으로 만들어 버릴까요?

이 논문은 이러한 디지털 채점기들을 위한 거대한 "맛 테스트"와 같습니다. 저자인 마르친 유키에비치(Marcin Jukiewicz)는 대학 강의에서 나온 6,000개의 실제 학생 프로그래밍 과제를 모았고, 18가지 버전의 서로 다른 AI 로봇들에게 이 과제들을 채점하게 했습니다. 그는 단순히 점수를 달라고 요청한 것이 아니라, 이 로봇들이 어떻게 사고하는지, 얼마나 엄격한지, 그리고 서로 혹은 인간 교사와 얼마나 일치하는지를 관찰했습니다. 이 연구는 AI 모델들이 하나의 균일한 지능 덩어리가 아니라, 매우 다양한 사촌 관계임을 보여줍니다. 어떤 모델은 "자유분방(liberal)"하여 높은 점수를 사탕 나누어 주듯 남발하는 반면, 어떤 모델은 "제한적(restrictive)"이어서 아주 작은 실수에도 낙제점을 줍니다. 심지어 더 놀라운 점은, 같은 회사(예: OpenAI 또는 Google) 출신의 로봇들은 마치 같은 집에서 같은 규칙을 배우며 자란 형제처럼 매우 유사한 방식으로 생각하고 채점한다는 것입니다.

가장 중요한 발견은 일종의 현실 자각 타임입니다. 이 연구에서 가장 "우수한" AI 로봇조차 인간 교사와 통계적으로 중간 정도의 일치도만을 보였으며, 완벽한 일치와는 거리가 멀었습니다. 채점의 세계에서 이것은 두 명의 심사위원이 동일한 가수에게 완전히 다른 점수를 주는 것과 같습니다. 이 연구는 AI가 자기 자신과는 일관성을 유지할 수 있지만, 여전히 인간 교사의 미묘하고, 관용적이며, 맥락을 파악하는 채점 방식에는 미치지 못한다는 것을 시사합니다. 또한, 이 연구는 "미니(mini)" 또는 "나노(nano)" 버전의 모델들(더 작고 저렴한 모델들)이 거대한 풀사이즈 형제들보다 일반적으로 채점 능력이 떨어진다는 것을 발견했습니다. 따라서 만약 학교가 AI로 숙제를 채점하고자 한다면, 아무 로봇이나 골라서는 안 됩니다. 어떤 로봇을 선택하느냐에 따라 학생들이 받는 성적이 실제로 달라지기 때문입니다.

위대한 로봇 채점 대결

18마리의 로봇이 책상에 앉아 빨간 펜을 들고 있는 교실을 상상해 보세요. 이들은 똑같은 6,000개의 프로그래밍 과제 뭉치를 채점하려 합니다. 이들은 평범한 로봇이 아닙니다. 네 개의 주요 테크 거인인 OpenAI, Google, Anthropic, DeepSeek에서 나온 최신 기술인 "거대 언어 모델(LLM)"입니다. 이 연구의 목표는 이 로봇들이 모두 A를 받을 사람, B를 받을 사람, 그리고 낙제할 사람에 대해 의견이 일치할지 확인하는 것이었습니다.

결과는 마치 심사위원들이 서로 의견을 하나도 맞추지 못하는 리얼리티 TV 쇼와 같았습니다. 저자는 이 로봇들에게 뚜렷한 "채점 철학"이 있다는 것을 발견했습니다.

"착한" 로봇 vs "못된" 로봇
어떤 로봇들은 믿기 힘들 정도로 관대했습니다. GPT-4oClaude-haiku-3.5 같은 모델들은 "자유분방한(liberal)" 채점가였습니다. 이들은 높은 점수(1점 또는 만점)를 매우 자주 주는 경향이 있었습니다. 학생의 코드가 대체로 맞다면, 이 로봇들은 기꺼이 통과 점수를 주었습니다. 반대편 스펙트럼에는 DeepSeek-ReasonerGPT-4.1-nano 같은 "제한적인(restrictive)" 로봇들이 있었습니다. 이들은 엄격한 훈육관이었습니다. 이들은 아주 작은 오류만 발견해도 "0점"(낙제)을 줄 가능성이 훨씬 높았습니다. 착한 로봇들이 부드럽게 조언을 건넬 때, 이 로봇들은 세미콜론 하나가 빠졌다는 이유로 당신을 낙제시킬 수 있는 존재들이었습니다.

그리고 Claude-sonnet-4Gemini-2.0-flash-lite 같은 "균형 잡힌(balanced)" 로봇들도 있었습니다. 이들은 중간 지점을 지키는 채점가들이었습니다. 이들은 단순히 만점을 주거나 낙제를 주는 것이 아니라, "0.5"라는 점수를 사랑했습니다. 이들은 "주요 개념은 이해했지만 몇 가지 세부 사항을 놓쳤으니, 부분 점수를 주겠다"라고 말하는 이들이었습니다.

가족적 유사성
가장 흥식한 발견 중 하나는 같은 회사 출신의 로봇들이 형제처럼 행동했다는 점입니다. 만약 당신이 서로 다른 OpenAI 모델들(GPT-4o, GPT-5 및 그 "미니" 버전들)의 채점 패턴을 살펴본다면, 이들은 서로 뭉쳐 있었습니다. 이들은 비슷하게 생각했습니다. Google의 Gemini 모델들과 Anthropic의 Claude 모델들에서도 똑같은 현상이 나타났습니다. 마치 OpenAI가 모든 로봇에게 특정 스타일로 채점하도록 가르쳤고, Google은 그들과 다른 스타일을 가르친 것과 같습니다. 연구 결과, 로봇들은 여섯 개의 뚜렷한 그룹으로 나뉘었습니다. 다섯 개의 주요 "클랜(clan)"(공통된 스타일을 공유하는 GPT-5, GPT-4, Gemini, DeepSeek, Claude)과, 어디에도 속하지 못해 독특한 두 모델을 함께 묶은 하나의 특별한 "아웃라이어(Outlier) 클러스터"가 그것입니다.

"미니" vs "메가"
연구는 로봇의 크기도 살펴보았습니다. 테크 기업들은 종가 더 작고 빠르며 실행 비용이 저렴한 "미니" 또는 "나노" 버전의 모델을 자주 출시합니다. 논문은 이러한 작은 로봇들이 일반적으로 채점 능력이 떨어진다는 것을 발견했습니다. 풀사이즈 "플래그십" 모델들이 더 일관적이고 신뢰할 수 있었습니다. 이는 전문 셰프와 요리 쇼를 방금 본 아이를 비교하는 것과 같습니다. 아이도 요리를 완성할 수는 있겠지만, 맛을 제대로 내는 것은 전문 셰프일 확률이 훨씬 높습니다. "미니" 및 "나노" 모델들은 인간 교사와의 일치도가 낮았으며, 이는 만약 학교가 비용을 아끼기 위해 더 저렴하고 작은 모델을 사용하려 한다면, 더 낮은 품질의 채점을 받게 될 수도 있음을 시사합니다.

인간 요소
여기 당신을 놀라게 할 반전이 있습니다. 저자가 동일한 과제를 채점한 실제 인간 교사들과 이 모든 로봇을 비교했을 때, 로봇들은 잘 맞지 않았습니다. 사실, 인간 교사들이 가장 관대했습니다! 인간 교사들은 가장 높은 평균 점수(0.726)를 주었으며, 로봇들보다 만점("1")을 줄 확률이 훨씬 높았습니다.

가장 우수한 로봇인 Claude-haiku-3.5는 인간 교사와 0.470의 통계적 일치도를 보였습니다. 통계학의 세계에서 이는 "양호한" 수준이 아닌 "중간(moderate)" 정도의 일치로 간주됩니다. "좋은" 수준이 되려면 보통 0.75 이상의 점수가 필요합니다. 이는 만약 당신이 이 로봇에게 숙제를 채점하게 한다면, 당신의 선생님이 줄 점수와는 다른, 더 엄격한 점수를 받게 될 가능성이 높다는 것을 의미합니다.

"군중"의 역설
연구는 로봇들을 서로 대조하는 영리한 방법을 사용했습니다. 연구자들은 인간과 비교하는 대신 다음과 같이 질문했습니다. "만약 18개의 로봇이 준 가장 흔한 점수를 '진정한' 점수라고 한다면 어떨까?" 그렇게 했을 때, 로봇들은 서로 훨씬 더 잘 일치했습니다(상위 모델들의 경우 80% 이상의 일치도를 보임). 이는 로봇들이 자기들끼리는 매우 일관적이지만, 인간 교사와는 지속적으로 차이를 보인다는 것을 시사합니다.

이는 큰 질문을 던집니다. 로봇이 옳고 교사가 너무 관대한 것일까요? 아니 아니면 로봇들이 비슷한 데이터로 학습되었기 때문에 모두 똑같은 실수를 하고 있는 것일까요? 논문은 로봇들이 일관성은 있지만, 여전히 "인간적인 손길"—즉, 학생이 노력했다는 점이나 작은 실수가 개념을 이해하지 못했다는 것을 의미하지 않는다는 점을 이해하는 능력—을 놓치고 있을 수 있다고 제안합니다.

이것이 미래에 의미하는 바

이 논문은 AI 채점이 망가졌으니 사용을 중단해야 한다고 말하는 것이 아닙니다. 대신, 학교 측에 주의를 당부합니다. 숙제를 채점할 로봇을 선택하는 것은 중립적인 결정이 아닙니다. 그것은 결과 자체를 바꾸는 선택입니다. 만약 "자유분방한" 로봇을 선택하면 학생들은 더 높은 점수를 받을 수 있습니다. 만약 "제한적인" 로봇을 선택하면 학생들은 더 낮은 점수를 받을 수 있습니다.

연구의 결론은 우리가 AI에게 채점을 완전히 맡겨둘 수는 없다는 것입니다. 우리는 여전히 상황을 감시할 인간 교사가 필요합니다. 로봇은 훌륭한 도구이지만, 그것들은 서로 다른 종류의 계산기와 같습니다. 어떤 것은 올림을 하고, 어떤 것은 내림을 하며, 어떤 것은 버튼 구성이 다릅니다. 로봇이 인간 교사와 어떻게 일치할 수 있는지 알아내기 전까지, 우리는 로봇이 주는 점수가 선생님이 줄 점수와 다를 수 있다는 점을 반드시 기억해야 합니다. 그리고 교육의 세계에서, 그 차이는 매우 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →