← 최신 논문
💻 computer science

LLM-Generated Design Problems for Assessing Higher-Order Thinking in Project-Based Learning

본 연구는 전통적인 채점의 한계와 교수자의 업무 부담을 극복하고 고차원적 사고 및 전이 기술을 효과적으로 평가하기 위해, 프로젝트 기반 컴퓨팅 교육에서 LLM이 생성한 설계 문제를 보완적인 평가 도구로 사용하는 방안을 제안한다.

원저자: Ahmad D. Suleiman, Daqing Hou, Maliha Noushin Raida

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ahmad D. Suleiman, Daqing Hou, Maliha Noushin Raida

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 완벽한 피자를 만드는 기술을 연마하기 위해 한 학기 전체를 보내는 요리 수업에 참여하고 있다고 상상해 보세요. 당신은 반죽을 치대고, 소스를 고르고, 황금빛이 돌 때까지 굽는 법을 배웁니다. 학기말에 선생님은 보통 당신이 실제로 만든 피자를 보고 성적을 매깁니다. 하지만 여기에 문제가 있습니다. 당신이 훌륭한 피자를 만들 수 있다고 해서, 그 피자가 왜 잘 만들어졌는지 그 원리를 진정으로 이해하고 있다는 뜻은 아니라는 점입니다. 또한 그 기술을 사용해 케이크를 굽거나 고장 난 오븐을 고칠 수 있다는 것도 보장할 수 없습니다. 당신은 그저 피자를 만드는 단계를 암기했거나, 혹은 로봇 셰프(AI와 같은)가 힘든 일을 다 하는 동안 옆에서 구경만 했을 수도 있기 때문입니다.

이것이 바로 컴퓨터 과학 교사들이 프로젝트 기반 학습(PjBL)에서 직면하는 퍼즐입니다. 학생들은 멋진 소프트웨어 프로젝트를 구축하지만, 전통적인 시험은 학생들이 단순히 코드를 복사하여 붙여넣거나 자신이 만든 특정 결과물에 대해 보고서를 쓰는 능력만을 확인하는 경우가 많습니다. 이러한 방식은 '고차원적 사고(HOT)'—즉, 배운 내용을 완전히 새롭고 까다로운 상황에 적용하는 능력—를 놓치게 됩니다.

새로운 도구: "디자인 문제(Design Problems)"

이를 해결하기 위해, 이 논문의 저자들은 **디자인 문제(DP)**라고 불리는 것을 도입했습니다. 이것은 피자 수업 직후에 벌어지는 "주방 챌린지"라고 생각하면 됩니다. 선생님이 "당신의 피자를 보여주세요"라고 묻는 대신, 다음과 같이 말합니다:

"좋아요, 만약 병원에서 노인 환자의 손가락 움직임을 추적하여 건강 문제를 감지하는 시스템이 필요하다고 가정해 봅시다. 당신이 피자 앱을 만들 때 사용했던 것과 동일한 논리를 사용하여, 이 새로운 시스템의 상위 수준 계획을 설계하세요. 시간은 30분입니다."

이 과정은 학생들이 단순히 사실을 암기하는 것을 멈추고 지식을 **전이(transferring)**하도록 강제합니다. 학생들은 새로운 것을 분석, 평가, 창조해야 하며, 이를 통해 자신이 단순히 작성한 특정 코드가 아니라 개념 자체를 제대로 이해하고 있음을 증명해야 합니다.

로봇 조수: AI가 질문을 작성할 수 있을까?

이런 까다롭고 새로운 시나리오를 담은 질문을 만드는 것은 교사들에게 매우 힘든 작업입니다. 모든 학생의 프로젝트에 딱 맞는 새로운 상황을 매번 발명하는 데는 엄청난 시간이 걸립니다. 그래서 연구진은 질문을 던졌습니다: 거대 언어 모델(LLM)—매우 똑똑한 AI 챗봇—이 우리를 대신해 이 질문들을 작성할 수 있을까?

연구진은 두 가지 서로 다른 AI 모델(표준 모델과 단계별로 생각하는 '추론형' 모델)에게 네 가지 서로 다른 학생 프로젝트(보안 도구, 분산 게임, 모바일 앱 등)를 바탕으로 80개의 디자인 문제를 생성하도록 요청하여 테스트를 진행했습니다.

연구 결과:

  • AI는 꽤 유능합니다: 특히 '추론형' AI가 인상적이었습니다. 이 모델은 현실적이고 학습 목표에 완벽하게 부합하는 시나리오를 만들어냈습니다. 실제로 AI가 생성한 문제 중 50%가 인간 전문가로부터 만점을 받았습니다.
  • AI가 완벽하지는 않습니다: 때때로 AI는 게으른 모습을 보였습니다. 원래의 프로젝트와 너무 유사한 시나리오를 만들거나(예를 들어 이미 피자를 만들었는데 또 피자를 요구하는 경우), 질문을 너무 모호하게 만들기도 했습니다.
  • 결론: 이 논문은 AI가 질문의 초안을 작성하는 지치지 않는 조수로서 큰 도움이 될 수 있다고 제안합니다. 다만, 질문이 너무 쉽거나 혼란스럽지 않은지 확인하기 위해 인간 교사의 검토가 여전히 필요합니다.

교실 테스트: 학생들이 정말 이해했는가?

연구진은 이 AI가 작성한 디자인 문제를 세 개의 실제 대학 수업에 적용했습니다. 학생들에게는 이 새로운 시나리오를 개별적으로 해결할 30분의 시간이 주어졌습니다.

여기서 반전이 일어납니다:
학생들의 디자인 문제 성적을 학기 내내 진행한 원래 프로젝트 성적과 비교했을 때, 두 성적 사이에는 거의 아무런 상관관계가 없었습니다.

  • 어떤 학생들은 **'마스터(Masters)'**였습니다: 프로젝트도 완벽히 수행했고, 새로운 챌린지도 통과했습니다.
  • 어떤 학생들은 **'구현자(Implementers)'**였습니다: (아마도 도움을 받았거나 레시피를 따랐을 수도 있지만) 훌륭한 프로젝트를 만들어냈음에도 불구하고, 논리를 다른 곳에 적용하지 못해 새로운 챌리지에서는 실패했습니다.
  • 어떤 학생들은 **'개념가(Conceptualizers)'**였습니다: 프로젝트 자체는 고전했지만, 깊은 개념을 이해하고 있었기에 새로운 챌린지에서는 압도적인 성과를 냈습니다.

이는 전통적인 프로젝트 성적이 전체를 말해주지 않는다는 사실을 입증합니다. 학생은 훌륭한 앱을 만들 수 있지만, 여전히 새로운 상황에서 엔지니어처럼 생각하는 법을 모를 수 있습니다. 디자인 문제는 이러한 차이를 포착해 냈습니다.

학생들이 실제로 어떻게 생각했는가

연구진은 또한 학생들이 답안을 작성하는 방식(키스트로크 데이터)을 살펴보았습니다. 학생들은 단순히 미친 듯이 타이핑만 한 것이 아니었습니다.

  • 학생들은 시작 부분에서 약 2분 동안 멈췄는데, 이는 아마도 생각하고 계획하는 시간이었을 것입니다.
  • 학생들은 답안의 일부를 삭제하고 다시 썼습니다(삭제된 글자 수가 입력된 글자 100자당 약 12~16자 정도인 '수정 비율'을 보임).
  • 학생들은 글을 쓰는 동안 빈번하게 휴식(10초 이상의 멈춤)을 취했습니다.

이러한 행동은 학생들이 단순히 복사하여 붙여넣는 것이 아니라, 아이디어를 분석하고 종합하는 고된 정신적 작업을 실제로 수행하고 있었음을 시사합니다.

이 논문이 제외하는 것 (한계점)

이 논문은 이 방법이 무엇이 아닌지를 명확히 밝히고 있습니다:

  • 이것은 다른 모든 테스트를 대체하는 마법의 탄환이 아닙니다.
  • 이것은 학생들이 시험 중에 AI를 사용할 수 있다면 작동하지 않는 방식입니다(그래서 교사들은 휴대폰 없이 교실에서 직접 수행하게 했습니다).
  • 이것은 학생들이 걸린 시간을 기준으로 성적을 매기는 방법이 아닙니다. 데이터에 따르면 더 많은 시간을 쓰는 것이 반드시 더 높은 성적으로 이어지지는 않았습니다.
  • 이것은 아직 완벽한 시스템이 아닙니다. 논문은 이러한 개방형 답변을 채점하는 것이 여전히 주관적이며, 도움 없이 규모를 키우기(scale) 어렵다는 점을 명시하고 있습니다.

핵심 요약

이 연구는 AI를 사용하여 이러한 "디자인 문제"를 생성하는 것이, 학생들이 단순히 하나의 특정 결과물을 만드는 법을 암기하는 것이 아니라 컴퓨터 과학 개념을 진정으로 이해하고 있는지를 확인하는 유망한 방법임을 시사합니다. 이는 교사가 '레시피를 따를 줄 아는 학생'과 '완전히 새로운 요리를 만들어낼 줄 아는 학생'의 차이를 구분할 수 있게 도와줍니다. AI가 완벽하지 않아 인간의 감독이 필요하긴 하지만, AI는 학생들이 수업에서 연습했던 것과 똑같은 모습이 아닌, 실제 세상의 문제들에 대비할 수 있도록 만드는 열쇠가 될 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →