Leveraging Large Language Models for Assessments Grading and Personalised Feedback Generation: A Case of Software Engineering
본 연구는 소프트웨어 공학 평가의 채점 및 개인화된 피드백 생성에 있어 LLM(ChatGPT-4 및 Gemini 2.5)의 효과를 평가하며, 이들이 고품질의 피드백과 예비 점수를 생성함에도 불구하고 교수자 채점과의 상관관계가 제한적이라는 점은 이들이 인간 강사를 대체하기보다는 보조하는 하이브리드 모델에 가장 적합하다는 것을 시사한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 대학교의 강의실에서는 거대 언어 모델로 알려진 새로운 종류의 인공지능에 의해 주도되는 조용한 혁명이 일어나고 있습니다. 이들은 단순히 사실을 검색하는 단순한 검색 엔진이 아닙니다. 이들은 방대한 양의 인간 저작물을 학습하여 문맥을 이해하고, 복잡한 문제를 추론하며, 인간의 대화를 모방하는 텍스트를 생성할 수 있는 시스템입니다. 수년 동안 교육자들은 이 도구들이 단순히 대화하는 것 이상의 일을 할 수 있을지, 즉 실제로 가르치거나 적어도 학생들이 제출하는 산더미 같은 과제를 채점하는 데 도움을 줄 수 있을지 궁금해해 왔습니다. 이 질문은 학생들이 단순히 에세이를 쓰거나 수학 문제를 푸는 것에 그치지 않는 소프트웨어 공학 같은 분야에서 특히 까다롭습니다. 대신, 학생들은 프로그램의 서로 다른 부분들이 어떻게 연결되고 기능해야 하는지를 보여주는 다이어그램을 그리며 소프트웨어 시스템의 복잡한 청사진을 만듭니다. 이러한 시각적 설계는 논리와 구조의 미묘한 오류를 찾아내기 위해 인간의 눈을 필요로 합니다. 만약 컴퓨터가 이러한 과제들을 정확하게 채점하고 어떻게 개선할지에 대한 유용한 조언을 제공할 수 있다면, 교사들이 더 깊은 학습에 집중할 수 있도록 해줄 것이지만, 이는 오직 컴퓨터가 학생의 성적을 맡길 수 있을 만큼 충분히 신뢰할 수 있을 때만 가능합니다.
파키스탄과 영국의 대학교 연구진은 바로 이 아이디어를 테스트하기 위해 나섰습니다. 그들은 가장 진보된 두 가지 인공지능 시스템이 복잡한 소프트웨어 설계 과제를 채점하고 학생들에게 개인화된 피드백을 제공할 수 있는지 확인하고 싶었습니다. 이를 위해 그들은 소프트웨어 설계 및 아키텍처 과정에서 나온 54개의 실제 학생 제출물을 수집했습니다. 각 학생은 사용자가 시스템과 어떻게 상호작용하는지를 보여주는 유스 케이스 다이어그램(use case diagram), 소프트웨어의 구성 요소를 개략적으로 설명하는 클래스 다이어그램(class diagram), 그리고 시스템의 계층을 매핑하는 3계층 아키텍처 설계(three-tier architecture design)라는 세 가지 특정 유형의 다이어그램을 작성했습니다. 숙련된 인간 강사가 이미 엄격한 규칙, 즉 만점을 받기 위해 무엇이 요구되는지를 정확히 정의한 루브릭(rubric)을 사용하여 이 모든 과제를 모두 채점해 두었습니다. 그런 다음 연구진은 이 과제들과 강사의 규칙을 OpenAI라는 회사의 모델과 Google의 모델이라는 두 가지 서로 다른 인공지능 모델에 입력했습니다.
연구진은 단순히 컴퓨터에게 점수를 달라고 요청한 것이 아니었습니다. 그들은 모델이 마치 인간 교사처럼 단계별로 채점 과정을 생각하도록 정교한 프로세스를 설계했습니다. 그들은 모델에게 먼저 학생이 올바른 주제를 다루었는지 확인하고, 그다음 모든 루브릭 항목을 검토하여 요구되는 요소들이 존재하는지 확인한 뒤, 마지막으로 발견된 특정 오류를 바탕으로 점수를 계산하도록 요청했습니다. 결과가 단순히 운 좋은 추측이 아니라 안정적인지 확인하기 위해, 연구진은 각 모델에게 모든 과제를 세 번씩 별도로 채점하게 한 뒤 그 결과를 평균 냈습니다. 또한 그들은 이 전체 과정을 관리할 수 있는 맞춤형 웹 도구를 구축하여, 모델이 텍스트와 복잡한 다이어그램이 포함된 학생의 PDF 파일을 읽고 각 학생을 위한 상세한 보고서를 생성할 수 있도록 했습니다.
연구진이 컴퓨터가 생성한 성적을 인간 강사의 성적과 비교했을 때, 결과는 약속과 한계가 섞여 있었습니다. 인공지능 시스템은 일반적으로 인간 교사의 평균 점수에 근접했으며, 컴퓨터 성적은 총 50점 만점 중 평균적으로 약 5점 정도 차이가 났습니다. 그러나 컴퓨터는 최우수 학생과 최하위 학생을 구별하는 인간 교사의 능력을 따라가는 데 어려움을 겪었습니다. 인간 강사는 자료를 완벽히 숙지한 학생과 그렇지 못한 학생을 명확히 구분하여 19점에서 49점까지 넓은 범위의 점수를 부여했습니다. 반면, 컴퓨터는 이러한 점수들을 더 좁은 범위로 압축하는 경향이 있었으며, 종종 평범한 과제에는 약간 더 높은 점수를 주고 우수한 과제에는 약간 더 낮은 점수를 주었습니다. 이는 컴퓨터가 전반적인 성취도를 대략적으로 추정하는 데는 유용하지만, 학생들을 정확하게 순위 매기는 능력을 상실했기 때문에 최종 성적을 결정하는 데 있어 아직 인간 교사를 대체할 만큼 신뢰할 수 없음을 의미했습니다.
채점의 불완전함에도 불구하고, 컴퓨터가 생성한 피드백은 놀라울 정도로 좋은 반응을 얻었습니다. AI가 생성한 코멘트를 받은 학생들은 그것이 명확하고 유용하며 자신의 실수를 이해하는 데 도움이 된다고 느꼈습니다. 실제로 어떤 컴퓨터의 피드백을 선호하는지 묻는 질문에, 대다수의 학생은 OpenAI의 모델을 선택했는데, 그 이유는 그 모델의 코멘트가 더 개인적이고 건설적이며 인간 교사가 말하는 방식에 더 가깝다고 느꼈기 때문입니다. 흥로미롭게도, 이러한 선호도는 수학적으로 점수가 더 정확했던 컴퓨터와 반드시 일치하지는 않았습니다. 즉, 학생들이 글쓰기 스타일 면에서 가장 좋아했던 모델이 반드시 점수 산출이 가장 정확했던 모델은 아니었습니다. 이는 학생들에게는 점수의 정확한 숫자보다 조언의 질이 더 중요하다는 것을 시사합니다.
이 연구는 인공지능 도구들이 강력한 보조자이지만 아직 완전히 주도권을 잡을 준비는 되지 않았다고 결론짓습니다. 이들은 수백 개의 과제를 검토하고, 다이어그램에서 누락된 요소를 찾아내며, 초기 피드백 초안을 작성하는 등의 힘든 작업을 처리할 수 있어 교사들의 시간을 엄청나게 절약해 줄 수 있습니다. 그러나 연구는 학생의 미래가 걸린 고부담 평가(high-stakes assessments)의 경우, 공정성을 보장하기 위해 인간 교사가 반드시 과정에 참여해야 함을 강력하게 시사합니다. 이 연구 결과에 따른 이상적인 미래는 컴퓨터가 지치지 않는 첫 번째 독자로서 예비 평가와 상세한 제안을 제공하고, 인간 강사가 최종 판단과 사람만이 제공할 수 있는 미묘한 이해를 제공하는 하이브리드 방식입니다. 이러한 파트너십은 소프트웨어 공학 교육을 변화시켜, 교사들에게 과도한 부담을 주지 않으면서도 모든 학생에게 개인화된 피드백을 제공할 수 있게 할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.