: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
이 논문은 LLM 에이전트의 장기적 계획 및 일관된 실행 능력을 평가하기 위해 1 년 간의 시뮬레이션 스타트업 운영을 과제로 제시하는 새로운 벤치마크인 를 소개하고, 이를 통해 프런티어 모델들이 여전히 장기 과제 수행에서 실패하는 패턴과 한계를 규명했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"인공지능 (AI) 이 장기적인 계획을 세우고, 실수를 반복하지 않으며, 한 번 시작한 일을 끝까지 잘 해낼 수 있을까?"**라는 아주 중요한 질문을 던집니다.
기존의 AI 테스트들은 "빨간 공을 들어라", "문제를 풀어라" 같은 짧은 미션만 평가했습니다. 하지만 현실 세계에서는 1 년이라는 긴 시간 동안 사업을 운영하며, 실수가 쌓여 파산하거나, 반대로 작은 성공이 모여 대박이 나는 경우가 많습니다.
저자들은 이 문제를 해결하기 위해 **'YC-Bench(스타트업 시뮬레이션 테스트)'**라는 새로운 게임을 만들었습니다. 이를 쉽게 설명해 드릴게요.
🎮 YC-Bench: AI 의 '스타트업 경영 대결'
이 테스트는 AI 를 가상의 스타트업 CEO로 만들어 1 년 동안 회사를 운영하게 합니다.
- 초기 자본: 20 만 달러 (약 2 억 6 천만 원)
- 임무: 고객에게서 일을 받아서 돈을 벌고, 직원을 고용해 급여를 주며, 1 년 뒤 가장 많은 돈을 남기는 것.
- 난이도: 아주 높습니다. 일부 고객은 **사기꾼 (적대적 고객)**이라 일을 맡기만 하면 일을 더 많이 시키거나, 기한을 넘겨서 실패하게 만듭니다.
🕵️♂️ 핵심 규칙: "기억력"과 "전략"
이 게임의 가장 큰 특징은 기억입니다.
AI 가 대화하는 기록은 일정 길이만 남고 사라집니다 (메모리 제한). 그래서 AI 는 **메모장 (Scratchpad)**을 스스로 만들어 써야 합니다.
- "어떤 고객은 사기꾼이니까 절대 안 받아야지."
- "이 직원은 연구 분야는 잘하지만, 데이터는 못 해."
- "이번 달 급여가 너무 많이 늘었으니, 더 비싼 일을 찾아야지."
이 메모장을 잘 쓰는 AI 일수록, 시간이 지나도 실수를 반복하지 않고 성공할 확률이 높습니다.
📊 실험 결과: 누가 이겼을까?
총 12 개의 최신 AI 모델 (GPT-5, Claude, Gemini 등) 을 테스트했습니다. 결과는 놀라웠습니다.
대부분의 AI 는 '파산'했습니다.
- 12 개 모델 중 7 개는 시작 자금 (20 만 달러) 보다 돈을 더 잃었습니다.
- 심지어 1 년 뒤에도 돈을 벌지 못한 모델이 많았습니다.
- 이유: 사기꾼 고객을 구별하지 못하거나, 일을 너무 많이 받아서 직원이 감당하지 못해 실패했습니다.
승자는 3 명뿐입니다.
- Claude Opus 4.6이 127 만 달러로 1 위를 차지했습니다.
- GLM-5가 121 만 달러로 2 위를 차지했습니다. (재미있는 점은 GLM-5 는 Claude 보다 11 배나 더 저렴하게 작동했다는 것입니다.)
- GPT-5.4도 100 만 달러 이상을 벌며 3 위를 했습니다.
성공의 비결은 '메모장' 사용법
- 성공한 모델들은 메모장에 **"사기꾼 고객 리스트"**를 꼼꼼히 적어두고, 그들을 피했습니다.
- 반면, 실패한 모델들은 메모장을 쓰지 않거나, 메모장에 쓴 규칙을 바로 잊어버리고 다시 실수를 반복했습니다.
💡 AI 의 '치명적인 실수'들 (실패 원인 분석)
연구팀은 AI 들이 왜 실패하는지 자세히 분석했습니다.
- 사기꾼을 못 봄: "이 고객은 비싸게 주지만 일을 너무 많이 시킨다"는 패턴을 못 찾아서 계속 일을 맡겼다가 파산했습니다. (파산 원인 중 47% 가 이 때문)
- 과도한 업무 분배: 직원이 할 수 있는 일보다 일을 너무 많이 받아서, 기한을 못 채우고 벌금을 물었습니다.
- 이해와 행동의 괴리:
- Sonnet 모델: "이 고객은 사기꾼이야, 피해야지"라고 메모장에 잘 썼지만, 다음 순간에는 그 고객을 다시 찾아가 일을 맡겼습니다. (규칙을 쓰고 바로 무시함)
- Grok 모델: "우리는 파산 직전이다!"라고 분석은 잘 했지만, 아무 행동도 취하지 않고 가만히 있었습니다. (분석은 잘하지만 행동이 없음)
🚀 결론: AI 는 여전히 '장기전'에 약하다
이 연구는 **"현재의 AI 는 짧은 미션은 잘하지만, 1 년처럼 긴 시간을 두고 계획을 세우고 실행하는 능력은 아직 부족하다"**는 것을 보여줍니다.
- **메모장 (Scratchpad)**을 잘 활용하는지가 성패를 가릅니다.
- **사기꾼 (적대적 상황)**을 구별하고, 실수에서 배우는 능력이 아직 완벽하지 않습니다.
- 하지만 Claude Opus 4.6과 GLM-5 같은 모델은 이미 인간 CEO 못지않게 전략적으로 사고할 수 있음을 보여주었습니다.
한 줄 요약:
"AI 가 스타트업을 운영해 보니, 대부분은 사기꾼 고객을 못 구별하고 파산했지만, '메모장'을 잘 쓰는 몇몇 AI 는 1 년 만에 6 배나 돈을 불려냈습니다. AI 는 이제 '짧은 질문'은 잘하지만, '긴 인생'을 설계하는 데는 아직 연습이 필요합니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.