← 최신 논문
🤖 AI

YC-Bench\texttt{YC-Bench}: Benchmarking AI Agents for Long-Term Planning and Consistent Execution

이 논문은 LLM 에이전트의 장기적 계획 및 일관된 실행 능력을 평가하기 위해 1 년 간의 시뮬레이션 스타트업 운영을 과제로 제시하는 새로운 벤치마크인 YC-Bench\texttt{YC-Bench}를 소개하고, 이를 통해 프런티어 모델들이 여전히 장기 과제 수행에서 실패하는 패턴과 한계를 규명했습니다.

원저자: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Muyu He, Adit Jain, Anand Kumar, Vincent Tu, Soumyadeep Bakshi, Sachin Patro, Nazneen Rajani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 장기적인 계획을 세우고, 실수를 반복하지 않으며, 한 번 시작한 일을 끝까지 잘 해낼 수 있을까?"**라는 아주 중요한 질문을 던집니다.

기존의 AI 테스트들은 "빨간 공을 들어라", "문제를 풀어라" 같은 짧은 미션만 평가했습니다. 하지만 현실 세계에서는 1 년이라는 긴 시간 동안 사업을 운영하며, 실수가 쌓여 파산하거나, 반대로 작은 성공이 모여 대박이 나는 경우가 많습니다.

저자들은 이 문제를 해결하기 위해 **'YC-Bench(스타트업 시뮬레이션 테스트)'**라는 새로운 게임을 만들었습니다. 이를 쉽게 설명해 드릴게요.


🎮 YC-Bench: AI 의 '스타트업 경영 대결'

이 테스트는 AI 를 가상의 스타트업 CEO로 만들어 1 년 동안 회사를 운영하게 합니다.

  • 초기 자본: 20 만 달러 (약 2 억 6 천만 원)
  • 임무: 고객에게서 일을 받아서 돈을 벌고, 직원을 고용해 급여를 주며, 1 년 뒤 가장 많은 돈을 남기는 것.
  • 난이도: 아주 높습니다. 일부 고객은 **사기꾼 (적대적 고객)**이라 일을 맡기만 하면 일을 더 많이 시키거나, 기한을 넘겨서 실패하게 만듭니다.

🕵️‍♂️ 핵심 규칙: "기억력"과 "전략"

이 게임의 가장 큰 특징은 기억입니다.
AI 가 대화하는 기록은 일정 길이만 남고 사라집니다 (메모리 제한). 그래서 AI 는 **메모장 (Scratchpad)**을 스스로 만들어 써야 합니다.

  • "어떤 고객은 사기꾼이니까 절대 안 받아야지."
  • "이 직원은 연구 분야는 잘하지만, 데이터는 못 해."
  • "이번 달 급여가 너무 많이 늘었으니, 더 비싼 일을 찾아야지."

이 메모장을 잘 쓰는 AI 일수록, 시간이 지나도 실수를 반복하지 않고 성공할 확률이 높습니다.

📊 실험 결과: 누가 이겼을까?

총 12 개의 최신 AI 모델 (GPT-5, Claude, Gemini 등) 을 테스트했습니다. 결과는 놀라웠습니다.

  1. 대부분의 AI 는 '파산'했습니다.

    • 12 개 모델 중 7 개는 시작 자금 (20 만 달러) 보다 돈을 더 잃었습니다.
    • 심지어 1 년 뒤에도 돈을 벌지 못한 모델이 많았습니다.
    • 이유: 사기꾼 고객을 구별하지 못하거나, 일을 너무 많이 받아서 직원이 감당하지 못해 실패했습니다.
  2. 승자는 3 명뿐입니다.

    • Claude Opus 4.6이 127 만 달러로 1 위를 차지했습니다.
    • GLM-5가 121 만 달러로 2 위를 차지했습니다. (재미있는 점은 GLM-5 는 Claude 보다 11 배나 더 저렴하게 작동했다는 것입니다.)
    • GPT-5.4도 100 만 달러 이상을 벌며 3 위를 했습니다.
  3. 성공의 비결은 '메모장' 사용법

    • 성공한 모델들은 메모장에 **"사기꾼 고객 리스트"**를 꼼꼼히 적어두고, 그들을 피했습니다.
    • 반면, 실패한 모델들은 메모장을 쓰지 않거나, 메모장에 쓴 규칙을 바로 잊어버리고 다시 실수를 반복했습니다.

💡 AI 의 '치명적인 실수'들 (실패 원인 분석)

연구팀은 AI 들이 왜 실패하는지 자세히 분석했습니다.

  • 사기꾼을 못 봄: "이 고객은 비싸게 주지만 일을 너무 많이 시킨다"는 패턴을 못 찾아서 계속 일을 맡겼다가 파산했습니다. (파산 원인 중 47% 가 이 때문)
  • 과도한 업무 분배: 직원이 할 수 있는 일보다 일을 너무 많이 받아서, 기한을 못 채우고 벌금을 물었습니다.
  • 이해와 행동의 괴리:
    • Sonnet 모델: "이 고객은 사기꾼이야, 피해야지"라고 메모장에 잘 썼지만, 다음 순간에는 그 고객을 다시 찾아가 일을 맡겼습니다. (규칙을 쓰고 바로 무시함)
    • Grok 모델: "우리는 파산 직전이다!"라고 분석은 잘 했지만, 아무 행동도 취하지 않고 가만히 있었습니다. (분석은 잘하지만 행동이 없음)

🚀 결론: AI 는 여전히 '장기전'에 약하다

이 연구는 **"현재의 AI 는 짧은 미션은 잘하지만, 1 년처럼 긴 시간을 두고 계획을 세우고 실행하는 능력은 아직 부족하다"**는 것을 보여줍니다.

  • **메모장 (Scratchpad)**을 잘 활용하는지가 성패를 가릅니다.
  • **사기꾼 (적대적 상황)**을 구별하고, 실수에서 배우는 능력이 아직 완벽하지 않습니다.
  • 하지만 Claude Opus 4.6GLM-5 같은 모델은 이미 인간 CEO 못지않게 전략적으로 사고할 수 있음을 보여주었습니다.

한 줄 요약:

"AI 가 스타트업을 운영해 보니, 대부분은 사기꾼 고객을 못 구별하고 파산했지만, '메모장'을 잘 쓰는 몇몇 AI 는 1 년 만에 6 배나 돈을 불려냈습니다. AI 는 이제 '짧은 질문'은 잘하지만, '긴 인생'을 설계하는 데는 아직 연습이 필요합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →