A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks
본 연구는 Codeforces 프로그래밍 과제에서 ChatGPT 03-mini 와 DeepSeek-R1 을 비교하여, 두 모델 모두 쉬운 문제에서는 유사한 성능을 보이지만 어려운 문제에서는 어려움을 겪는 반면, ChatGPT 는 중간 난이도의 과제에서 DeepSeek-R1 보다 현저히 뛰어난 성과를 보인다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
두 명의 천재이지만 매우 다른 학생이 일련의 코딩 시험을 치르기 위해 앉아 있다고 상상해 보세요. 한 명은 ChatGPT(특히 o3-mini 버전)로, 도서관의 거의 모든 책을 읽은 바 있는 잘 알려진 고도로 훈련된 학생입니다. 다른 한 명은 DeepSeek-R1로, 논리적 추론과 수학 퍼즐에 대한 집중한 집중력으로 유명한 중국의 새로운 오픈소스 도전자입니다.
베르겐 대학의 연구자들은 이들을 Codeforces라는 프로그래머를 위한 '체육관'을 통해 시험에 붙이기로 결정했습니다. 연구자들은 두 학생에게 간단한 워밍업부터 혹독한 마라톤에 이르기까지 29 개의 문제를 제시하고, 이를 해결하는 C++ 코드를 작성하도록 요청했습니다.
다음은 난이도별로 세분화된 대결의 결과입니다:
1. 워밍업 (쉬운 작업)
이것들은 간단한 산술 문제나 기본적인 논리 퍼즐로 생각할 수 있습니다.
- 결과: 두 학생 모두 훌륭한 성과를 거두었습니다. 그들은 100 미터 달리기에서 두 명의 최상위 선수처럼, 경기를 모두 성공적으로 마쳤습니다.
- 주의할 점: 두 학생 모두 정답을 맞췄지만, DeepSeek 은 때때로 ChatGPT 보다 조금 더 느리게 움직였고 조금 더 많은 '에너지'(메모리) 를 사용했습니다. 하지만 두 학생 모두 결승선을 통과했습니다.
2. 중거리 (중간 난이도 작업)
이제 경기가 흥미로워졌습니다. 이러한 문제들은 약간의 전략과 계획이 필요했습니다.
- ChatGPT: 이 학생이 여기서 명확한 승자였습니다. 이 학생은 약 **55%**의 문제를 정확하게 해결했습니다. 그들은 자신을 정확히 페이스 조절하는 방법을 아는 베테랑 마라토너와 같았습니다.
- DeepSeek: 이 학생은 크게 고전하며 중간 난이도 문제의 약 **18%**만 해결했습니다. 마치 경기 도중 혼란을 겪거나, 제 발에 걸려 넘어지거나, 규칙을 잊어버린 것처럼 보였습니다.
- 이유: 논문은 ChatGPT 가 훈련 기간 중 이 특정 유형의 '경쟁적 프로그래밍' 데이터에 대해 더 많은 연습을 했을 가능성을 시사하며, 이로 인해 선두를 점할 수 있었다고 설명합니다.
3. 울트라 마라톤 (어려운 작업)
이것들은 복잡한 다단계 논리가 필요한 가장 힘든 도전 과제들이었습니다.
- 결과: 두 학생 모두 벽에 부딪혔습니다.
- ChatGPT는 9 개의 어려운 문제 중 단 1 개만 해결했습니다.
- DeepSeek은 어려운 문제 중 아무것도 해결하지 못했습니다 (0%).
- 비유: 두 학생에게 청사진 없이 처음부터 고층 빌딩을 짓도록 요청한다고 상상해 보세요. 두 학생 모두 막혔습니다. ChatGPT 는 구조가 무너지기 (런타임 오류) 전에 몇 층을 짓는 시도를 했지만, DeepSeek 은 종종 기초를 놓는 것조차 못 하거나 (컴파일 오류), 끝내기 전에 에너지를 모두 소진했습니다 (메모리 제한).
'에너지' 소비 (메모리 및 시간)
연구자들은 각 학생이 사용한 '연료'(컴퓨터 메모리) 와 시간을 또한 살펴보았습니다.
- ChatGPT는 일반적으로 쉽고 중간 난이도 작업에서 더 빠르고 자원을 효율적으로 사용했습니다.
- DeepSeek은 때때로 막대한 양의 메모리를 사용하거나, 특히 어려운 작업에서 생각하는 데 매우 오랜 시간이 걸렸습니다. 한 사례에서는 DeepSeek 이 문제를 생각하는 데 너무 오래 걸려 완전히 시간 초과가 발생했습니다.
결론
이 논문은 DeepSeek-R1이 간단한 작업을 잘 처리할 수 있는 강력한 새로운 도전자이지만, ChatGPT o3-mini가 현재 중간 난이도의 코딩 도전 과제에 대한 더 나은 '코치'라고 결론 내립니다. 그러나 문제가 정말로 어려워지면 두 모델 모두 인간의 도움이 필요합니다. 그들은 아직 스스로 가장 어려운 퍼즐을 해결할 준비가 되지 않았습니다.
연구의 중요 참고 사항:
연구자들은 각 학생에게 문제를 한 번만 시도하도록 요청했습니다 ('싱글샷' 시도). 실패하면 다시 시도하거나 힌트를 요청할 수 없었습니다. 논문은 만약 인간이 그들을 안내하거나 DeepSeek 의 더 전문화된 버전 (DeepSeek-Coder) 을 사용했다면 결과가 달랐을 수 있다고 지적합니다. 하지만 이 특정 테스트에 기반하면 ChatGPT 가 중간 영역에서 앞서 나갔으며, 두 모델 모두 최상위 수준에서는 고전했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.