Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning
이 논문은 복잡한 시장 주도형 물류 문제에 대해 대규모 언어 모델을 대학원생들과 비교 평가하는 토너먼트 기반 벤치마크를 제시하며, 인간이 코딩한 에이전트가 LLM 생성 솔루션보다 현저히 우수한 성능을 보이고 대부분의 LLM 에이전트가 단순한 베이스라인을 넘어서는 데 실패할 뿐만 아니라 최적의 인간 전략을 개선하도록 프롬프트를 입력했을 때 오히려 그 전략을 저하시킨다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 질문: "바이브 코딩(Vibe Coding)"이 대학원생을 이길 수 있을까?
당신에게 말만 하면 코드를 짜주는 아주 똑똑한 로봇 비서(거대 언어 모델, 즉 LLM)가 있다고 상상해 보세요. 당신이 "배달 앱 하나 만들어줘"라고 말하면, 로봇은 몇 초 만에 코드를 써 내려갑니다. 이것을 **"바이브 코딩(Vibe Coding)"**이라고 부릅니다.
이 논문이 던지는 핵심 질문은 이것입니다: 이 로봇이 실제로 복잡하고 중요한 비즈니스 문제를 해결할 만큼 똑똑한가, 아니면 그저 겉보기에는 그럴싸해 보이지만 상황이 복잡해지면 무너지는 코드를 쓰는 데만 능숙한 것인가?
이를 알아내기 위해 연구진은 거대한 코딩 토너먼트를 개최했습니다.
경기장: "경매, 픽업 및 배송(APDP)" 게임
연구진은 로봇들에게 단순한 수학 문제(예: "2+2는?")를 풀게 하는 대신, **경매, 픽업 및 배송 문제(APDP)**라는 복잡한 시뮬레이션 속에 집어넣었습니다.
이것은 마치 고도의 전략이 필요한 물류 체스(Logistics Chess) 게임과 같습니다:
- 경매: 여러 회사(에이전트)가 배송 업무를 따내기 위해 입찰을 합니다. 업무는 하나씩 판매됩니다. 당신은 얼마를 입찰할지 예측해야 합니다. 너무 높게 입찰하면 돈을 잃고, 너무 낮게 입찰하면 업무는 따낼 수 있어도 배송 과정에서 손해를 볼 수 있습니다. 경쟁자들이 어떻게 행동할지 예측해야 합니다.
- 계획: 업무를 따낸 후에는 트럭이 물건을 픽업하고 배송할 최적의 경로를 찾아야 합니다. 트럭의 적재 공간은 제한되어 있으며, 규칙을 어겨서는 안 됩니다.
- 목표: 승자는 가장 많은 수익(입찰로 얻은 수익에서 운송 비용을 뺀 금액)을 올린 회사입니다.
이것은 단순히 오류 없이 실행되는 코드를 쓰는 문제가 아닙니다. 전략적으로 사고하고, 미래를 예측하며, 상대방보다 한 수 앞서 나가는 코드를 작성하는 문제입니다.
참가자들
연구진은 두 팀을 맞붙였습니다:
- 팀 휴먼(인간): AI 코딩 도구가 등장하기 전, 스위스 로잔 연방 공과대학교(EPFL)의 대학원생들이 몇 주 동안 직접 고민하고 계획하며 손으로 짠 17개의 에이전트입니다.
- 팀 AI: 세계 최고의 AI 모델(GPT-5, Claude, Gemini 등)을 사용하여 "바이브 코딩"으로 작성된 40개의 에이전트입니다. 연구진은 AI에게 학생들에게 주었던 것과 정확히 동일한 지침을 제공했습니다.
결과: 인간의 압도적인 승리
결과는 놀랍고도 명확했습니다:
- 상위 5위는 모두 인간: 모든 토너먼트에서 상위 5위 자리는 모두 인간 학생들의 차지였습니다. AI 에이전트들은 상위 5위 안에 들지 못했습니다.
- AI vs "단순한 기준점": 연구진은 매우 단순하고 멍청한 AI 에이전트(기본적인 무작위 추측기)를 만들었습니다. 40개의 AI 에이전트 중 33개가 이 단순한 에이전트에게 패배했습니다. AI의 전략이 너무 형편없어서 기본적인 계산기 수준의 모델에게도 진 것입니다.
- "수정하기"의 참사: 마지막 테스트에서 연구진은 가장 뛰어난 인간의 코드를 가져와서 최고의 AI에게 "개선해 보라"고 요청했습니다. AI는 코드를 수정하려고 시도했지만, 코드를 더 좋게 만드는 대신 오히려 더 나쁘게 만들었습니다. 개선된 버전은 1등에서 10등으로 떨어졌습니다.
AI는 왜 실패했는가?
논문에 따르면, AI는 구문(Syntax)(오타 없는 코드 작성)에는 뛰어나지만, 추론(Reasoning)(복잡한 전략의 '이유'와 '방법'을 이해하는 것)에는 어려움을 겪습니다.
- "허용 가능한 휴리스틱(Admissible Heuristic)"의 실패: 더 간단한 테스트에서 AI는 최적의 경로를 찾기 위해 특정 수학적 기법(A* 탐색)을 사용하도록 요청받았습니다. AI는 연구진이 명시적으로 알려주었음에도 불구하고, 이 기법의 가장 기초적인 규칙을 계속해서 잊어버렸습니다. 이는 요리사에게 케이크 레시피를 부탁하면서, 달걀이 핵심 재료라는 사실을 알려주었는데도 요리사가 달걀 넣는 것을 계속 까먹는 것과 같습니다.
- "타임아웃(Time-Out)" 버그: AI 에이전트들은 종로에서 길을 잃거나 생각하는 데 너무 오랜 시간이 걸려, 결국 경매 시간을 놓쳐 낙찰을 받지 못하는 경우가 많았습니다. 인간의 코드는 이런 문제가 없었습니다.
- 전략의 부재: AI 에이전트들은 맹목적으로 입찰하거나 연료를 낭비하는 경로를 계획하곤 했습니다. 그들은 "분위기를 읽거나" 경쟁자의 움직임을 예측하지 못했습니다.
결론
이 논문은 LLM이 아직 "대학원생 수준의 코더"는 아니다라고 결론짓습니다.
LLM은 코드가 잘 작동하게(구문 오류 없이) 만드는 데는 탁고하지만, 장기적인 계획과 전략이 필요한 복잡한 현실 세계의 시나리오에서 경쟁할 수 있는 코드를 작성하는 데는 아직 미흡합니다.
비유하자면:
당신에게 완벽한 케이크 레시피를 쓸 줄 아는 로봇이 있다고 상상해 보세요. 로봇은 밀가루를 몇 컵 넣어야 하는지 정확히 압니다. 하지만 가격이 매 분마다 변하고, 경쟁자들이 고객을 뺏으려 하며, 예산이 한정된 도시에서 베이커리를 운영해 보라고 한다면, 그 로봇은 아마 파산할 것입니다. 로봇은 레시피를 쓸 수는 있지만, 사업을 운영할 수는 없습니다.
연구진은 이제 코드가 단순히 "작동하는지"(테스트 통과 여부)만 확인할 것이 아니라, 코드가 실제 세상에서 정말로 **"이길 수 있는지"**를 확인해야 할 때라고 말합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.