Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026
이 2026년 연구는 다섯 가지 첨단 생성형 AI 시스템을 기초 객체 지향 프로그래밍 평가를 통해 평가하였으며, 이들이 일반적으로 평균적인 학생들보다 뛰어난 성능을 보이고 전년 대비 상당한 개선을 보여주었으나, 인터페이스 및 추상 클래스와 같은 특정 심화 개념과 그래픽 관련 과업에서는 여전히 어려움을 겪고 있다는 점을 발견하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
젊은이들이 처음으로 소프트웨어를 구축하는 법을 배우는 교실에 새로운 종류의 조력자가 도착했습니다. 이들은 인간 튜터가 아니라, 방대한 텍스트와 코드 라이브러리를 학습하여 질문을 읽고 그에 대응하는 프로그램을 작성할 수 있는 컴퓨터 프로그램인 대규모 언어 모델입니다. 수년 동안 교육자들은 이 도구들이 진정으로 프로그래밍의 논리를 이해할 수 있는지, 아니면 단순히 패턴을 흉내 내는 것뿐인지 궁금해하며 이 도구들의 진화를 지켜봐 왔습니다. 이 질문이 중요한 이유는 프로그래밍이 흔히 객체 지향 프로그래밍이라는 특정 방식으로 가르쳐지기 때문입니다. 이 방식에서는 코드가 데이터와 동작을 모두 가진 실제 세계의 객체처럼, 데이터와 행동을 보유한 독립적인 단위들로 구성됩니다. 만약 이 인공 시스템들이 학생들과 동일한 문제를 해결할 수 있다면, 이는 우리가 코딩을 가르치고, 테스트하고, 코딩 학습의 미래를 생각하는 방식을 변화시킬 것입니다.
에스토니아 타르투 대학교의 연구진은 가장 인기 있는 다섯 가지 인공지능 시스템을 실제 대학 환경에서 시험대에 올리기로 했습니다. 그들은 기계에게 추상적인 퍼즐을 풀거나 진공 상태에서 코드를 작성하라고 요구하지 않았습니다. 대신, 그들은 1학년 학생들을 위한 입문 과정에서 사용되는 것과 동일한 프로그래밍 테스트와 기말고사 질문들을 가져와 기계들에게 직접 입력했습니다. 과제들은 현지 언어인 에스토니아어로 작성되었으며, 연구진은 시스템에 특별한 지시나 힌트를 주지 않았습니다. 그들은 단지 기계가 학생으로서 문제를 해결하도록 요청했을 뿐이며, 교사가 인간의 작업에 적용하는 것과 동일한 채점 규칙을 적용했습니다. 목표는 이 도구들이 평균적인 학생을 따라잡을 수 있는지, 그리고 더 중요한 것은 그들이 여전히 어디에서 비틀거리는지를 확인하는 것이었습니다.
결과는 인공지능 시스템들이 놀라울 정도로 유능하며, 종종 비교 대상인 인간 학생들을 능가한다는 것을 보여주었습니다. 여러 부분으로 구성된 완전한 프로그램을 구축해야 하는 첫 번째 프로그래밍 테스트에서, 한 가지 시스템을 제외한 모든 시스템이 평균 학생보다 높은 점수를 받았습니다. 마이크로소프트 오피스에 통합된 하나의 도구는 작은 구문 오류 때문에 한 사례에서 작동하는 프로그램을 생성하는 데 실패했지만, 나머지 시스템들은 일관되게 최고 점수를 받았습니다. 더 복잡한 데이터 처리를 포함하는 약간 더 어려운 두 번째 테스트에서도 기계들은 다시 한번 압도적이었으며, 대부분 완벽하거나 완벽에 가까운 점수를 달랐습니다. 전체 과정을 다루고 까다로운 개념적 질문을 포함했던 기말고사에서도 기계들은 일반적으로 학급 평균보다 훨씬 높은 점수를 기록했습니다.
하지만 기계들은 완벽하지 않으며, 그들의 실수는 그들의 이해가 여전히 얕다는 점을 드러냅니다. 그들은 충돌 없이 실행되는 길고 복잡한 프로그램을 작성할 수는 있었지만, 인간 교사라면 잡아냈을 구체적인 세부 사항을 놓치는 경우가 종 occasionally 있었습니다. 예를 들어, 일부 시스템은 텍스트 형식을 제대로 맞추지 못하거나 코드가 작동하게 만드는 데 필요한 지침을 포함하는 것을 잊어버려, 프로그램 실행을 중단시키는 오류를 초래했습니다. 또한 그들은 인터페이스라고 불리는 특정 규칙을 통해 프로그램의 서로 다른 부분들이 어떻게 소통해야 하는지와 같은 특정 고급 개념에서 어려움을 겪었습니다. 이러한 영역에서 기계들은 겉보기에는 올바르게 보이지만 실제로는 질문이 요구하는 바를 수행하지 않는 코드를 생성하기도 했습니다. 게다가 연구는 이미지 해석을 포함한 그래픽 관련 질문에서의 성능이 제한적임을 언급했는데, 이는 AI가 비텍스트적 정보를 처리할 때 직면하는 광범위한 과제를 반영합니다.
연구진은 이 시스템들이 불과 1년 전의 평가와 비교했을 때 상당히 향상되었다는 것을 발견했습니다. 이전 버전의 도구들은 과정을 통과하는 데 실패했을 수도 있었지만, 최신 모델들은 이제 일관되게 상위권 학생 성적을 기록하고 있습니다. 그러나 명확한 패턴이 나타났습니다. 기계들은 표준적인 구조를 구축하기 위한 지침을 따르는 데는 뛰어나지만, 작업이 시스템의 서로 다른 조각들이 개념적으로 어떻게 결합되는지에 대한 깊은 추론을 요구할 때는 비틀거릴 수 있다는 점입니다. 그들은 종-종 요청되지 않은 추가 기능을 추가하거나 학생들이 아직 배우지 않은 고급 기술을 사용하는데, 이는 그들이 교육과정보다 훨씬 넓은 지식의 풀에서 끌어오고 있음을 시사합니다.
궁극적으로, 이 연구는 강력하지만 아직 모든 교육적 필요에 완전히 신뢰할 수 있는 도구라는 그림을 그려냅니다. 인공지능 시스템은 종종 평균 학생을 능가하는 작동하는 코드를 생성할 수 있으며, 이는 그들이 프로그래밍의 메커니즘을 숙달했음을 증명합니다. 하지만 그들은 근본적인 논리에 대한 진정한 이해가 부족함을 나타내는 특정한 반복적 오류를 여전히 범하고 있습니다. 교육자들에게 이는 이 도구들이 학습을 지원하는 데 사용될 수는 있지만, 인간의 감독이나 단순한 코드 생성 능력이 아닌 깊은 개념적 이해를 테스트하는 정교한 평가 설계의 필요성을 대체할 수는 없음을 의미합니다. 기계들은 매년 나아지고 있지만, 프로그래머처럼 진정으로 생각하기 위해서는 아직 갈 길이 멉니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.