Changes in Coding Behavior and Performance Since the Introduction of LLMs
대학원 클라우드 컴퓨팅 과목에 대한 이 준종단적 연구는 LLM의 도입 이후 학생들의 코딩 행동이 더 길지만 덜 반복적인 제출 방식으로 변화했으며 학습 이득은 감소했음을 밝히고 있으며, 이는 이러한 도구들에 대한 과도한 의존이 생산성과 교육적 성과 모두에 부정적인 영향을 미칠 수 있음을 시사한다.
원저자:Yufan Zhang, Jaromir Savelka, Seth Copen Goldstein, Michael Conway
요리 수업을 상상해 보세요. 학생들은 매 학기 특정 케이크를 구워야 합니다. 5년 동안 선생님은 학생들이 어떻게 케이크를 굽는지 관찰했습니다. 그러다 2022년 말, "마법의 펜"(대규모 언어 모델 또는 LLM)이 등장했습니다. 이 펜은 학생들이 요청하면 레시피를 써줄 뿐만 아니라 반죽까지 대신 섞어줄 수 있었습니다.
연구자들은 알고 싶었습니다: 마법의 펜이 학생들이 케이크를 더 잘 굽도록 도왔을까요, 아니면 학생들이 굽는 법을 잊어버리는 동안 케이크를 그저 화려하게 보이게만 만들었을까요?
그들은 대학원 수준의 컴퓨터 과학 수업에서 10학기 동안의 데이터(마법의 펜 도입 전 5년과 도입 후 5년)를 살펴보았습니다. 그들은 변하지 않는 하나의 특정 코딩 과제에 집중했는데, 이는 마치 변하지 않는 케이크 레시피와 같았습니다.
발견된 사실: "블로트(Bloat, 비대화)" 효과
연구자들은 마법의 펜이 도착한 후 매우 이상한 일들이 일어나고 있음을 발견했습니다:
더 많은 수정, 그러나 적은 개선: 마법의 펜이 오기 전에는 학생들이 오류를 수정하기 위해 코드를 작고 신중하게 변경했습니다. 하지만 마법의 펜이 온 후, 학생들은 제출물 사이의 거대하고 전면적인 변화를 만들기 시작했습니다.
비유: 문장을 편집한다고 상상해 보세요. 이전에는 오타를 고치기 위해 단어 하나를 바꿨을 것입니다. 하지만 마법의 펜 이후에는, 새 버전이 실제로 더 낫지 않더라도 문단 전체를 삭제하고 세 배나 더 긴 새로운 문단을 붙여넣을 수도 있습니다.
데이터: 학생들이 시도 사이에 코드를 변경한 양이 세 배로 늘어났습니다. 제출한 총 코드의 양은 500% 증가했습니다.
"만점"의 환상: 거의 모든 학생이 해당 과제에서 만점을 받았습니다.
비유: 마치 반 학생들 모두가 갑자기 시험에서 "A"를 받은 것과 같습니다. 하지만 선생님은 학생들이 수학을 실제로 이해해서 "A"를 받은 것이 아니라, 마법의 펜에서 정답지를 베껴온 것이라는 사실을 깨달았습니다. 성적이 더 이상 전체 이야기를 말해주지 못하게 된 것입니다.
"느린 학습자"의 신호: 연구자들은 학생의 점수가 새로운 시도마다 얼마나 개선되었는지 측정했습니다.
비유: 사다리를 오르는 것을 생각해 보세요. 마법의 펜 이전에는 학생이 사다리 한 칸을 올라갈 때마다 정상에 훨씬 더 가까워졌습니다. 마법의 펜 이후에는 학생들이 사다리를 훨씬 빠르게 오르고 있었지만(더 많은 변화를 만들었지만), 정상을 향해 나아가지는 못했습니다. 그들은 그저 제자리걸음을 하고 있었습니다.
데이터: "변화당 점수 개선도"가 크게 떨어졌습니다. 학생들은 더 열심히 노력하고 있었지만(더 많은 편집), 배우는 것은 적었습니다.
팀 프로젝트의 반전
연구는 학생들이 함께 웹사이트를 구축하는 그룹 프로젝트도 살펴보았습니다.
결과: 마법의 펜이 도착한 후 팀 점수는 실제로 약간 상승했습니다.
비유: 이는 한 선수가 초고속 로봇을 경기장에 가져온 스포츠 팀과 같습니다. 팀은 더 많은 경기에서 승리하지만, 인간 선수들은 예전만큼 강해지지 않을 수도 있습니다. 로봇이 힘든 일을 대신 수행함으로써, 인간의 기여도가 예전만큼 높지 않다는 사실을 가리고 있는 것입니다.
"켄타우로스"에 대한 경고
저자들은 일의 미래를 체스에 비유합니다.
체스에서 "켄타우로스"는 인간과 컴퓨터가 함께 협력하는 팀을 말합니다. 이 팀은 인간 단독 혹은 컴퓨터 단독보다 더 뛰어납니다.
문제점: 연구자들은 학생들이 컴퓨터에게 무엇을 할지 명령만 할 뿐, 정작 어떻게 말을 움직여야 하는지는 잊어버린 체스 선수처럼 되어가고 있다고 우려합니다.
그들은 마법의 펜에 과도하게 의존하는 학생들(거대하고 비대한 코드 변화로 나타남)이 실제로는 다른 개인 과제에서는 다소 낮은 성과를 보였다는 것을 발견했습니다. 이는 마법의 펜이 과제를 끝내는 데는 도움을 줄지 모르지만, 스스로 과제를 수행하는 데 필요한 기술을 배우는 능력은 해칠 수 있음을 시사합니다.
결론
이 논문은 학생들이 여전히 좋은 성적을 받고 있지만, 그들의 행동이 과도하게 AI에 의존하고 있음을 시사하는 방향으로 변했다고 결론짓습니다.
그들은 더 길고 지저분한 코드를 제출합니다.
무언가를 배우지 못한 채 더 많은 수정을 가합니다.
단순한 과제에서 만점을 받지만, 전반적인 학습 효율은 떨어지는 것으로 보입니다.
저자들은 학교와 기업이 "기술(skill)"을 측정하는 방식을 재고해야 한다고 경고합니다. 학생이 마법의 펜을 사용하여 완벽한 결과를 낼 수 있다고 해서, 그가 반드시 케이크를 굽는 법을 안다는 뜻은 아닙니다. 그들은 학생들에게 단순히 "시작" 버튼을 누르는 사람이 아니라, 컴퓨터를 이끄는 체스 마스터가 되는 법을 가르쳐야 합니다.
기술 요약: LLM 도입 이후 코딩 행동 및 성능의 변화
문제 정의 대규모 언어 모델(LLM)과 에이전트형 코딩 도구의 소프트웨어 개발 워크플로우 내 급격한 통합은 학생들이 프로그래밍 과제에 참여하는 방식을 근본적으로 변화시켰습니다. 이러한 도구들은 생산성 향상을 약속하지만, 교육자들에게는 중대한 과제를 안겨줍니다. 즉, 학생의 진정한 이해와 AI가 생성한 출력물을 구분하는 것, 그리고 "기계적 부담(mechanical burden)"을 외부로 전가할 때 학습 목표가 달성되고 있는지 평가하는 것입니다. 기존 문헌은 LLM의 영향에 대해 튜터링 효과를 통한 향상부터 과도한 의존으로 인한 해악에 이르기까지 상충되는 견해를 제시하고 있습니다. LLM의 대중화 전후로 코딩 행동과 학습 결과가 구체적으로 어떻게 진화했는지를 정량화한 종단적이고 경험적인 증거는 부족한 실정입니다.
방법론 본 연구는 카네기 멜런 대학교(Carnegie Mellon University)의 대학원 수준 클라우드 컴퓨팅 과목에서 제출된 소스 코드를 분석하는 준종단적 설계(quasi-longitudinal design)를 채택하였습니다. 데이터셋은 10개 학기(2020년 가을부터 2025년 봄까지)를 포괄하며, ChatGPT 출시(2022년 11월) 이전 5개 학기와 출시 이후 5개 학기로 나뉩니다.
데이터 소스: 분석은 721명의 고유 학생 등록을 포함하는 2,066개의 제출물을 대상으로 합니다.
과제 선정: 분석의 주된 초점은 개별 프로젝트 내의 특정 정적 과제인 "PageRank 과제"입니다. 이 과제는 2020년부터 2025년까지 명세와 스타터 코드가 변경되지 않았기에 직접적인 솔루션 비교가 가능하도록 선택되었습니다. 이 과제는 최소한의 스타터 코드(60줄)를 사용하여 소셜 그래프 상에서 PageRank 알고리즘을 구현하는 것을 포함합니다.
지표 정의:
코딩 행동: 제출 횟수(시도 횟수), 총 편집 거리(Myers 알고리즘을 사용하여 연속된 제출 간의 라인 변경 합계), 평균 편집 거리.
성능: 과제 점수(최종 PageRank 제출물의 자동 채점 점수), IP 점수(개별 프로젝트 상위 5개 점수의 합), TP 점수(팀 프로젝트 점수).
학습 효율성: "평균 제출 효과(Average Submission Effect)"로 정의되며, 이는 연속된 제출 간의 과제 점수 변화량을 제출 횟수로 나눈 값입니다.
제약 사항: 개별 프로젝트에서는 협업 및 AI 보조 코딩이 금지되었습니다. 본 연구는 학생들의 실제 LLM 사용 여부를 직접 기록하는 대신, 행동적 대리 지표(편집 거리 및 제출 패턴)에 의존하며, 이는 학생들이 오용 사실을 과소 보고할 수 있음을 인지한 결과입니다.
주요 결과 본 연구는 LLM 도입 이후 코딩 행동과 성능 상관관계에서 통계적으로 유의미한 변화를 식별하였습니다:
행동 변화 (2022년 이후):
제출량 증가: 학생당 제출 횟수의 중앙값이 50% 증가했습니다 (2회에서 3회로).
코드 볼륨 확대: 중앙값 기준 총 편집 거리는 500% 증가하였고, 평균 편집 거리는 300% 증가했습니다. 이는 학생들이 제출 사이에 더 크고 덜 점진적인 변화를 수행하고 있음을 시사합니다.
코드 비대화(Code Bloat): 만점을 받은 최종 제출물은 훨씬 더 많은 라인의 코드를 포함하고 있으며(그림 1 참조), 이는 요청되지 않은 포맷팅, 문서화 또는 보일러플레이트를 생성하는 LLM의 경향과 일치합니다.
성능 결과:
과제 점수: 점수가 안정적으로 유지되었으며, 모든 학기에서 거의 모든 학생이 PageRank 과제에서 만점을 받았습니다. 이는 해당 과제가 성능을 차별화하기에는 너무 단순할 수 있음을 나타냅니다.
개별 프로젝트(IP) 점수: ChatGPT 출시 이후 평균 점수가 약간 감소했습니다.
팀 프로젝트(TP) 점수: 역량 있는 개인에게 AI가 "비공식 팀원"으로서 도움을 주는 것을 시사하듯, 점수가 완만하게 상승했습니다.
상관관계 및 효율성:
학습 효율성 저하: "평균 제출 효과"(편집당 점수 개선도)가 2024년 봄부터 유의미하게 감소했습니다. 학생들은 더 많은 편집을 수행하고 있지만, 점수 획득량은 더 적습니다.
부적 상관관계: 평균 편집 거리와 IP 점수 사이에는 통계적으로 유의미한 부적 상관관계($corr = -0.16, p < 0.001$)가 존재합니다. 평균 편집 거리가 60줄 늘어날 때마다 IP 점수는 약 1%씩 감소했습니다.
팀 역학의 변화: ChatGPT 이전에는 높은 편집 거리가 낮은 팀 점수와 상관관계가 있었으나, ChatGPT 이후 이 상관관계가 사라졌습니다. 이는 LLM이 팀 환경 내에서 개인의 학습 격차를 은폐할 수 있음을 시사합니다.
주요 기여
경험적 증거: 본 연구는 LLM 확산 전후의 기간을 특정하여, 10개 연속 학기에 걸친 코딩 행동 변화에 대한 종합적인 종단 데이터를 제공하는 첫 번째 연구입니다.
행동적 대리 지표: 직접적인 사용 로그가 없는 상황에서도, 증가된 편집 거리와 제출 횟수, 그리고 감소된 점수 개선율이 잠재적인 LLM 과의존을 나타내는 강력한 행동적 지표로 기능함을 입증했습니다.
성능과 학습의 분리: 본 연구는 높은 과제 점수(Task Score)가 더 이상 학습 효율성을 보장하지 않음을 보여줍니다. 학생들은 훨씬 더 "비대한" 코드와 덜 전략적인 반복 과정을 거치면서도 만점을 받을 수 있으며, 이는 문제 해결 능력의 저하를 은폐할 수 있습니다.
의의 및 주장 저자들은 관찰된 행동 변화가 학생들이 LLM에 과도하게 의존하고 있으며, 이것이 표면적인 성능 향상에도 불구하고 학습 결과에 부정적인 영향을 미치고 있다는 가설과 일치한다고 주장합니다.
교육적 경고: 연구 결과는 LLM 시대에 노동 시장에 진입하는 첫 세대 졸업생들에 대한 우려를 불러일으킵니다. 데이터는 학생들이 효율적이고 점진적인 코드를 작성하는 능력과, 요청되지 않은 과도한 변경을 생성하는 도구에 의존하는 경향이 높아지고 있음을 시사합니다.
평가 불일치: 현재의 평가 방식은 AI가 증강된 세상에서 요구되는 기술과 어긋나 있을 수 있습니다. 본 논문은 최종 출력물(점수)에만 집중하는 지표가 학습의 과정에서 발생하는 퇴보를 포착하지 못한다고 주장합니다.
"켄타우로스(Centaur)" 모델: 논문은 교육 철학의 전환을 제안하며 결론을 맺습니다. 체스의 "켄타우로스" 모델(인간 + 기계가 각각 단독으로 있을 때보다 뛰어난 성과를 내는 모델)을 인용하여, 인간 개발자의 역할이 전술적 코드 생산에서 전략적 감독(추상화 정의, 컴포넌트 통합, 출력물에 대한 비판적 평가)으로 이동하고 있다고 제안합니다. 저자들은 교육 과정과 평가가 단순히 코드를 생성하는 능력이 아닌, 이러한 전략적 역량을 측정하는 방향으로 진화해야 한다고 촉구합니다.
본 논문은 학생들의 직접적인 사용 로그가 없으므로 모든 학생의 LLM 오용을 확정적으로 증명할 수는 없다는 점을 인정하며 주장을 신중하게 유지하고 있으나, 통계적 추세는 프로그래밍 과제에 접근하고 학습하는 방식에 체계적인 변화가 있음을 강력하게 시사합니다.