← 최신 논문
💬 NLP

Assessment of Evolving Large Language Models in Upper Secondary Mathematics

본 연구는 진화하는 거대 언어 모델들이 수학적 숙련도 측면에서 급격히 발전하여, 보통 수준의 성능에서 핀란드 상급 중등 교육 졸업 시험에서 완벽에 가까운 점수를 달성하는 단계로 나아갔음을 입증하며, 이를 통해 수학 교육을 지원하는 강력한 도구로서 이들의 잠재력을 강조한다.

원저자: Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

게시일 2026-06-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 경주를 지켜보고 있습니다. 주자들은 인간이 아니라 서로 다른 버전의 "슈퍼 브레인"(거대 언어 모델 또는 LLM)입니다. 이들이 달리는 트랙은 대학 입학 여부를 결정하는 매우 까다로운 시험인 핀란드 고등학교 수학 시험입니다.

다음은 연구 논문에 근거하여, 이 디지털 주자들이 서툰 초보자에서 완벽한 챔피언으로 어떻게 진화했는지를 보여주는 이야기입니다.

출발선: "아기" 단계 (2023년 8월)

경주의 시작점에서 AI 주자들은 이제 막 대수학을 배우기 시작한 학생들과 같았습니다.

  • 주자: OpenAI의 초기 버전 GPT-4.
  • 결과: 120점 만점에 64점을 기록했습니다. 핀란드 성적 체계로 보면 이는 통과 점수이지만, 낮은 점수(등급 "E")입니다. 이는 수업은 통과했지만 간신데 통과한 학생과 같습니다.
  • 경쟁자: 구글의 "Bard"는 이보다 훨씬 뒤처져 34점(등급 "C")을 받았는데, 이는 시험에 낙제한 학생과 같습니다.

이 단계에서 논문은 이 AI 모델들이 단순한 것들은 잘 수행하지만, 고등학교 수학에 필요한 복잡한 논리에는 어려움을 겪었다고 언급합니다. 그들은 마치 가끔 곱셈을 까먹는 계산기와 같았습니다.

훈련 과정: 더 똑똑해지기 (2023년 말 – 2024년 초)

연구진이 몇 달 후 다시 확인했을 때, AI 주자들은 열심히 "훈련"을 한 상태였습니다.

  • 업그레이드: AI는 도구, 특히 파이썬(Python)이라는 프로그래밍 언어를 사용하는 법을 배웠습니다. 이것은 주자가 갑자기 맨발로 달리는 대신 첨단 자전거를 탈 수 있게 된 것과 같습니다.
  • 결과: 2023년 말까지 GPT-4 주자는 120점 만점에 93점을 기록하며 최고 등급("L")을 받으며 질주했습니다. 이제 이 모델은 이전에는 불가능하다고 느꼈던 3차원 공간이 포함된 까다로운 기하학 문제들을 풀 수 있게 되었습니다.
  • 격차: 하지만 모든 주자가 같은 속도로 발전한 것은 아니었습니다. 2024년 초, 구글의 무료 버전 AI는 여전히 중간 그룹에 머물러 있었던 반면, OpenAI와 Microsoft의 유료 버전 AI들은 경주를 선두에서 이끌고 있었습니다.

결승선: "슈퍼휴먼" 시대 (2025년 1월)

연구진이 2025년 초에 최종 테스트를 실시했을 때, 경주는 완전히 바뀌어 있었습니다. AI 주자들은 단순히 경쟁하는 수준을 넘어, 점수판을 깨뜨리고 있었습니다.

  • 새로운 챔피언: 두 명의 새로운 주자, DeepSeek R1OpenAI의 o3120점 만점에 120점 만점으로 결승선을 통과했습니다.
  • 의미: 이 모델들은 단순히 시험에 합격한 것이 아니라, 거의 그 어떤 인간 학생도 해내지 못한 점수를 기록했습니다. 실제로, 만약 이 AI 모델들이 오늘날 핀란드 대학에 지원하는 실제 학생이라면, 가장 경쟁이 치열한 학과(의학이나 공학 등)에 합격할 것이며, 지원자 중 최상위권에 위치할 것입니다.

그들은 어떻게 그렇게 빨라졌나? (비법)

논문은 이 모델들이 단순히 수학을 더 많이 "암기"한 것이 아니라고 설명합니다. 그들은 생각하는 방식을 바꿨습니다.

  • 사고의 사슬 (Chain of Thought): 어려운 퍼즐을 푸는 인간을 상상해 보세요. 그들은 단순히 답을 추측하지 않습니다. 잠시 멈춰서, 단계별로 생각하고, 자신의 작업을 검토하며, 막히면 실수를 바로잡습니다. 새로운 AI 모델들(OpenAI의 "o1" 및 "o3"와 같은)도 똑같이 합니다. 이들은 답변하기 전에 "사고 과정"을 시뮬레이션하여 스스로 오류를 잡아낼 수 있습니다.
  • 자기 수정 (Self-Correction): 이전의 모델들이 답을 적자마자 바로 제출하는 학생이었다면, 새로운 모델들은 초안을 작성하고, 실수를 깨닫고, 솔루션을 다시 쓴 다음, 그 후에 제출하는 학생과 같습니다. 이러한 "숙고하는" 사고방식이 그들이 만점을 받을 수 있게 해준 핵심입니다.

요점

논문은 이 AI 도구들의 "수학적 두뇌"가 불과 몇 년 만에 믿기 힘들 정도로 빠르게 진화했다고 결론짓습니다.

  • 그들이 할 수 있는 것: 그들은 이제 평균적인 인간 학생보다 더 나은 성적으로 고난도의 수학 시험을 풀 수 있으며, 종종 만점을 기록하기도 합니다.
  • 논문이 던지는 다음 질문: 이 논문은 이 AI들이 아직 교사가 될 준비가 되었다고 주장하는 것이 아닙니다. 논문은 묻습니다: 문제를 완벽하게 풀 수 있다고 해서, 혼란스러워하는 학생에게 도움이 되는 방식으로 실제로 설명할 수도 있는가? 논문은 "풀이" 부분은 숙달되었지만, "가르치는" 부분이 다음 큰 과제임을 시사합니다.

요약하자면: AI는 단 몇 년 만에 고군분투하던 학생에서 수학 천재로 변모했지만, 이제 문제는 그들이 좋은 튜터(Tutor)가 될 수 있느냐 하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →