← 최신 논문
💻 computer science

Is Solving Better Than Evaluating GenAI Solutions?

한 알고리즘 전공 저학년 수업에서 실시된 무작위 연구에 따르면, 학생들이 결함이 있는 생성형 AI 생성 솔루션을 평가하게 하는 것이 전체 시험 성적을 해치지 않으면서 숙제 점수를 향상시켰으나, 이것이 의도적인 비계 설정(scaffolding)이 없는 전통적인 문제 해결 방식과 비교했을 때 개념적 전이나 학습 효과의 개선으로 자동 연결되지는 않는 것으로 나타났다.

원저자: Ethan Dickey, Marios Mertzanidis, Alexandros Psomas

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ethan Dickey, Marios Mertzanidis, Alexandros Psomas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마스터 셰프가 되기 위해 배우고 있다고 상상해 보십시오. 수년 동안, 당신이 요리를 이해했다는 것을 증명하는 유일한 방법은 주방에 서서 직접 채소를 썰고 처음부터 직접 수플레를 굽는 것이었습니다. 하지만 이제 몇 초 만에 완벽한 수플레를 뚝딱 만들어내는 마법 같은 로봇이 나타났습니다. 이로 인해 요리 학교들은 약간의 패닉에 빠졌습니다. 로봇을 금지해야 할까요? 아니면 학생들에게 로봇을 사용하게 하되, 시험 방식을 바꿔야 할까요? 학생들에게 요리를 해보라고 요구하는 대신, 로봇이 만든 수플레를 맛보고, 어디가 탔는지 찾아내며, 왜 실패했는지 설명하라고 요구하는 것은 어떨까요? 이것이 바로 오늘날 컴퓨터 과학 교육이 직면한 거대한 질문입니다. 우리는 컴퓨터가 거의 즉각적으로 코드를 작성하고 수학 문제를 풀 수 있는 "생성형 AI"의 시대에 살고 있습니다. 교육자들은 고민합니다. 만약 우리가 학생들에게 해결책을 직접 구축하라고 요구하는 것을 멈추고, 대신 AI의 해결책을 비평하도록 요구한다면, 그들이 실제로 더 많이 배우게 될까요? 아니면 그저 스스로 생각하는 능력이 더 퇴보하게 될까요?

이 논문은 그 논쟁을 해결하기 위해 설계된 실제 실험입니다. 퍼듀 대학교의 연구진은 "알고리즘"—지도에서 가장 빠른 경로를 찾거나 방대한 데이터 목록을 정리하는 것과 같은 복잡한 문제를 해결하기 위한 정교한 단계별 레시피—을 공부하는 220명의 주니어 레벨 학생들을 대상으로 실험을 진행했습니다. 그들은 학생들에게 어떤 숙제를 줄지 결정하기 위해 동전 던지기와 같은 "A/B 테스트"를 설정했습니다. 학기의 전반부 동안, 한 그룹(이를 "베이커(Bakers)"라고 부릅시다)은 까다로운 알고리즘 문제를 처음부터 직접 풀어야 했습니다. 다른 그룹(이들을 "크리틱(Critics)"이라고 부릅시다)은 AI에게 동일한 문제를 풀도록 요청한 다음, 로봇이 어디에서 틀렸는지 지적하며 AI의 결과물을 채점해야 했습니다. 그 후, 학기 후반부에 역할을 서로 바꿨습니다. "크리틱"은 "베이커"가 되었고, "베이커"는 "크리틱"이 되었습니다.

연구진은 "크리틱"이 "베이커"보다 더 잘 배우는지 알고 싶었습니다. AI의 실수를 찾아내는 것이 개념을 더 깊이 이해하는 데 도움이 되었을까요? 그것이 나중에 스스로 문제를 해결하는 능력을 더 향상시켰을까요? 결과는 놀랍게도 약간 "그저 그랬습니다." 학생들이 중간고사와 기말고사를 치렀을 때, "크리틱" 그룹은 "베이커" 그룹보다 높은 점수를 받지 못했습니다. 사실, 그들은 더 낮은 점수를 받지도 않았습니다. 두 그룹은 거의 동일한 성적을 거두었습니다. 이 연구는 해결책을 구축하는 행위를 AI의 해결책을 비평하는 행위로 바꾸는 것이 자동으로 당신을 더 똑똑한 문제 해결가로 만들어주지는 않는다는 점을 시사합니다. 그것은 단지 당신이 시간을 어떻게 보내느냐를 바꿀 뿐입니다. "크리틱"은 오류를 진단하고 논리를 판단하는 데 에너지를 쏟았고, "베이커"는 기초부터 논리를 구축하는 데 에너지를 쏟았습니다. 두 접근 방식 모두 시험이라는 동일한 목적지에 도달한 것으로 보였습니다.

하지만 작은 반전이 하나 있었습니다. "크리틱" 역할을 했던 학생들은 AI를 채점하는 특정 숙제에서는 실제로 더 높은 점수를 받았습니다. 로봇의 작업에서 실수를 찾는 것이 그것 전체를 직접 만드는 것보다 쉬웠기 때문입니다. 그러나 문제는 이것이 더 나은 시험 점수로 이어지지는 않았다는 점입니다. 연습 퀴즈에서는 A를 받았지만 실제 시험에서는 같은 점수를 받은 것과 같았습니다. 연구진은 또한 학생들에게 어떻게 느꼈는지 물었습니다. 대부분은 AI 과제가 자신의 학습 방식을 바꾸지는 않았다고 답했습니다. 그러나 학습 방식을 바꿨다고 말한 소수의 학생들은 "비평" 과제가 훨씬 더 도움이 되었다고 느꼈습니다. 이는 단순히 학생에게 AI를 채점하라고 요구하는 것만으로는 마법의 해결책이 될 수 없음을 암시합니다. 진정으로 배우기 위해서는, 단순히 버그를 찾는 것을 넘어, 그것을 수정하거나 왜 그 수정이 작동하는지 정확히 설명하도록 요구하는 것과 같은 더 많은 가이드가 필요할 수도 있습니다.

결국, 이 연구는 학교가 학생들의 성적을 망치지 않으면서도 학생들이 AI와 상호작용하며 비평하도록 허용해도 안전하다는 것을 보여주지만, 그것이 자동으로 그들을 천재로 만들지는 않는다는 것을 시사합니다. 마법은 AI 자체에 있는 것이 아니라, 교사가 과제를 어떻게 설계하느냐에 달려 있습니다. 만약 목표가 깊은 이해를 구축하는 것이라면, 단지 고장 난 로봇의 해결책을 학생에게 건네주며 "고쳐보라"고 말하는 것만으로는 충분하지 않을 수 있습니다. 비평을 진정한 "아하!" 모먼트로 바꾸기 위해서는 조금 더 세밀한 비계(scaffolding)가 필요할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →