Automated Scoring of Handwritten Mathematical Problem Posing Using Large Language Models
본 연구는 대규모 언어 모델인 Gemini 3.5 Flash가 구조화된 루브릭을 사용한 제로샷 프롬프팅 방식을 적용했을 때, 특히 정수 문제에 대해서 그리고 수정된 OCR 텍스트 입력을 활용했을 때 손으로 쓴 중학교 수학 문제 만들기 과제에 대해 신뢰할 수 있는 자동 채점을 달성할 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 채점해야 할 숙제가 산더미처럼 쌓인 교사라고 상상해 보십시오. 당신은 학생들에게 직접 수학 문제를 만들어 보라고 하는 것이 학습을 위한 초능력이라는 것을 알고 있습니다. 이는 창의성과 깊은 이해를 길러주기 때문입니다. 하지만 이러한 창의적인 손글씨 답안을 채점하는 것은 악몽과 같습니다. 학생마다 글씨체가 제각각이고, 어떤 학생들은 불가능한 시나리오를 만들어내며, 어떤 학생들은 그저 엉터리로 적기도 합니다. 채점에는 엄청난 시간이 걸리며, 무엇이 '좋은' 문제인지에 대해 인간 교사들 사이에서도 의견이 갈릴 수 있습니다. 바로 이 지점에서 인공지능(AI)이 지치지 않는 채점 조수로서의 가능성을 제시하며 등장합니다. 하지만 여기에는 함정이 있습니다. AI는 인쇄된 텍스트를 읽는 데는 뛰어나지만, 과연 엉망인 손글씨 수학 낙서를 읽어내고, 그것이 뛰어난 학생의 질문인지 아니면 혼란스러운 엉터리인지 구별할 수 있을까요? 이 질문은 교육과 컴퓨터 과학의 접점에 놓여 있으며, 학생의 창의성을 평가할 때 기계가 수학 교사처럼 '생각하는' 법을 배울 수 있는지를 탐구합니다.
이 연구의 연구진은 매우 똑똑한 AI인 Gemini 3.5 Flash를 테스트해 보기로 했습니다. 그들은 이 AI가 235명의 중학생이 만든 손글씨 수학 문제를 읽고 인간 교사만큼 정확하게 채점할 수 있는지 확인하고 싶었습니다. 이를 위해 연구진은 두 가지 서로 다른 시나리오를 포함하는 '맛보기 테스트'를 설정했습니다. 하나는 정수(예: 주행 거리)와 관련된 것이고, 다른 하나는 분수(예: 케이크 나누기)와 관련된 것이었습니다. 연구진은 AI에게 동일한 손글씨 텍스트의 두 가지 버전을 제공했습니다. 하나는 컴퓨터의 눈으로 직접 읽은 버전(때때로 엉망인 글씨체 때문에 실수를 범함)이었고, 다른 하나는 전문가가 세심하게 교정한 버전이었습니다. 또한, 채점 규칙을 낮은 점수에서 높은 점수 순으로 제시할지, 아니면 높은 점수에서 낮은 점수 순으로 제시할지에 따라 AI의 생각이 바뀌는지 확인하기 위해 규칙의 순서도 실험했습니다.
결과는 '희소식'과 '개선이 필요함'이 섞여 있었습니다. 연구 결과, AI가 전문가가 교정한 텍스트를 사용했을 때, 원본의 엉망인 컴퓨터 판독본을 사용할 때보다 인간 교사와 훨씬 더 잘 일치하는 것으로 나타났습니다. 하지만 수학 문제의 유형이 매우 중요했습니다. AI는 분수 문제(케이크 과제)보다 정수 문제(주행 과제)를 채점할 때 훨씬 더 정확했습니다. AI는 분수의 미묘한 차이를 다루는 데 더 어려움을 겪는 듯 보였는데, 수학적으로는 맞지만 학생이 말하고자 하는 이야기(맥락)에는 부합하지 않는 답안에 높은 점수를 주는 경우가 종종 있었습니다. 흥게롭게도, AI에게 제시된 채점 규칙의 순서는 성능에 전혀 영향을 미치지 않았습니다. 즉, AI가 루브릭(채점 기준표)의 하단부터 시작하든 상단부터 시작하든 그 성능은 동일했습니다.
요약하자면, 이 연구는 AI가 손글씨 수학 문제를 채점하는 신뢰할 수 있는 조수가 될 수 있음을 시사하지만, 아직 완벽하지는 않다는 것을 보여줍니다. AI는 글씨가 명확하고 수학이 정수로 이루어져 있을 때 가장 잘 작동합니다. 연구진은 단순히 AI에게 더 나은 텍스트를 제공하는 것(사람이 컴퓨터의 판독 오류를 수정하는 것)이 눈에 띄는 차이를 만들었지만, AI는 여전히 특히 분수가 포함된 경우의 수학적 '이야기'를 이해하는 데 도움이 필요하다는 것을 발견했습니다. AI가 지시 순서 때문에 혼란을 겪지는 않았지만, 수학적 내용의 복잡성 때문에 발목을 잡혔습니다. 저자들은 AI가 교사를 돕는 데 상당한 잠재력을 가지고 있지만, 분수와 같이 복잡한 주제를 다룰 때는 주의해서 사용해야 하며, 컴퓨터가 학생의 글씨를 올바르게 읽고 있는지 채점을 시작하기 전에 항상 확인해야 한다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.