← 최신 논문
🤖 AI

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

이 논문은 복잡한 실제 비즈니스 의사결정 과업에 대해 AI 에이전트를 총체적으로 벤치마킹하기 위해 설계된 새로운 놀이공원 시뮬레이터인 미니 어뮤즈먼트 파크(Mini Amusement Parks, MAPs)를 소개하며, 현재의 최첨단 거대언어모델(LLM)들이 장기적 최적화, 샘플 효율적 학습, 공간 추론, 그리고 세계 모델링 측면에서 인간 기준치보다 현저히 낮은 성능을 보인다는 점을 밝힌다.

원저자: Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 방금 세계에서 가장 혼란스럽고, 예측 불가능하며, 수익성이 높은 놀이공원의 열쇠를 손에 쥐었습니다. 당신의 직업은 무엇일까요? 바로 매니저입니다. 당신은 어디에 롤러코스터를 배치할지, 아이스크림 가판대를 몇 개나 열지, 언제 청소부를 고용할지, 그리고 새로운 초고가 놀이기구를 연구하는 데 현금을 쓸지 말지를 결정해야 합니다. 하지만 여기 함정이 있습니다. 손님들은 변덕스럽고, 놀이기구는 무작위로 고장 나며, 만약 당신이 잘못된 움직임을 보인다면 점심시간이 되기도 전에 공장이 파산할 수도 있습니다.

이것이 바로 AI가 실제 비즈니스를 얼마나 잘 운영할 수 있는지 테스트하기 위해 연구진이 만든 새로운 비디오 게임형 시뮬레이터, **미니 어뮤즈먼트 파크(Mini Amusement Parks, MAPS)**의 세계입니다.

대결: AI vs. 인간 매니저

연구진은 지구상에서 가장 똑똑한 AI 모델들(GPT-5, Claude, Gemini 등)과 숙련된 인간 플레이어들 사이의 대결을 설정했습니다. 목표는 간단했습니다. 누가 더 가치 있는 공원을 건설하는지 보는 것이었습니다.

결과는 엄청난 경종을 울렸습니다. 최고의 AI 모델들조차 인간 전문가를 따라잡는 데 어려움을 겪었습니다.

  • 이지(Easy) 모드에서, 최고 수준의 AI(GPT-5)는 전문가 인간이 달성한 점수의 단 **8.80%**에 도달하는 데 그쳤습니다. 즉, 인간이 11.4배 더 뛰어났다는 뜻입니다.
  • 장기적인 사고가 요구되어 게임이 더 까다로워지는 미디엄(Medium) 모드에서는 그 격차가 더 벌어졌습니다. AI의 성능은 인간 점수의 단 **4.44%**로 떨어졌으며, 이는 인간이 15.3배 더 우월함을 보여주었습니다.

이것은 마치 포뮬러 1 자동차를 갓 걸음마를 뗀 아이에게 주고, 프로 레이서에게는 프로를 상대하는 상황과 같습니다. 아이(AI)는 자동차를 겨우 움직이는 데 급급한 반면, 프로(인간)는 트랙을 돌며 추월하고 있습니다.

왜 AI는 실패했는가?

이 논문은 AI가 단순히 "수학을 못하는 것"이 아니라, 매우 인간적인 '초능력'이 부족하다고 시사합니다. 연구진은 AI가 실수했던 다섯 가지 구체적인 영역을 식출했습니다.

  1. "점심 뭐 먹지?" 문제 (근시안적 사고):
    인간은 앞을 내다보며 계획합니다. 인간은 오늘 거대한 롤러코스터를 지으면 다음 달을 위해 더 많은 직원을 고용하고 돈을 아껴야 한다는 것을 압니다. 그러나 AI는 근시안적인 경향이 있습니다. 당장의 보상(예: 놀이기구 건설)을 챙기느라 그 뒤에 따를 결과는 생각하지 못합니다. 이는 마치 사탕을 지금 다 먹어버리고 나중에 에너지가 필요할 때 배탈이 날 것을 잊어버리는 아이와 같습니다. 게임이 어려워졌을 때(Medium 모드), AI의 성능이 급락한 이유는 다음 단계 너머를 보지 못했기기 때문입니다.

  2. "눈 가리고 아웅" 문제 (공간 추론):
    실제 공원에서는 상점을 어디에 두느냐가 중요합니다. 상점은 구석이 아니라 길 근처에 있어야 합니다. AI는 종종 접근하기 어려운 곳에 놀이기구를 배치하거나, 사람들의 흐름을 무시한 채 모두 한데 모아 놓곤 했습니다. 흥 흥미롭게도, AI에게 공원의 사진(시각 정보)을 주는 것은 도움이 되지 않았으며, 오히려 상황을 악화시키기도 했습니다. AI는 시각적 데이터에 혼란을 느낀 반면, 무언가를 배치하기 위한 단순한 규칙(휴리스틱)은 오히려 AI의 성능을 높여주었습니다.

  3. "추측 게임" 문제 (확률적 요소):
    현실은 복잡합니다. 때로는 이유 없이 놀이기구가 고장 나기도 하고, 때로는 손님이 그냥 기분이 안 좋을 수도 있습니다. 이를 "확률성(stochasticity)"이라고 합니다. AI는 이러한 무작위성을 처리하는 데 어려움을 겪었습니다. AI는 운이 나빠서 생긴 나쁜 날과 잘못된 결정 때문에 생긴 나쁜 날을 구분하지 못했습니다. 연구진이 미래를 예측하기 위해 AI를 사용(월드 모델)하려고 했을 때, 이는 오히려 상황을 악화시켜 결정 속도를 늦추고 비용을 더 많이 들게 만들었습니다.

  4. "건망증" 문제 (능동적 학습):
    인간은 실험하는 데 능숙합니다. 새로운 전략을 시도했다가 실패하면, 왜 실패했는지 배우고 다른 것을 시도합니다. 연구진은 AI에게 100일 동안 실전 테스트 전 안전하게 실험해 볼 수 있는 "샌드박스" 모드를 제공했습니다. 놀랍게도 이것은 별 도움이 되지 않았습니다. AI는 주로 이미 설명서에 있는 내용을 반복하거나, 나중에 유용하게 쓰기에는 너무 지엽적인 메모만을 남겼습니다. AI는 공원이 어떻게 돌아가는지에 대한 진정한 "정신적 모델"을 구축하는 데 실패했습니다.

  5. "연구의 늪" 문제:
    더 어려운 버전의 게임에서는 새로운 놀이기구를 건설하기 전에 먼저 연구를 해야 합니다. AI는 종종 아직 건설할 여력이 없음에도 불구하고, 즉시 가장 비싸고 화려한 놀이기구를 연구하는 선택을 했습니다. 이는 마치 운전면허도 따기 전에 페라리를 사려는 학생과 같았습니다.

이 논문이 배제하는 것들

이 논문은 무엇이 효과가 없었는지를 명확히 밝히고 있습니다:

  • 단순히 AI에게 사진을 보여주는 것은 해결책이 아닙니다. AI의 "두뇌"에 시각적 입력을 추가하는 것은 공간 문제를 해결하지 못했으며, 오히려 텍스트만 있을 때보다 AI를 더 혼란스럽게 만들었습니다.
  • 현재의 "월드 모델"은 준비되지 않았습니다. 연구진은 AI가 미래를 예측하도록 돕기 위해 특정 AI 기술(WALL-E)을 사용해 보았지만, 이는 오히려 AI의 성능을 떨어뜨리고 비용을 훨씬 더 많이 발생시켰습니다.
  • 연습이 항상 완벽을 만드는 것은 아닙니다. 단순히 AI에게 100일 동안 샌드박스에서 플레이하게 하는 것이 자동으로 더 똑똑하게 만들지는 못했습니다. 많은 경우, AI는 무엇을 배워야 할지 파악하지 못했기 때문에 오히려 더 나빠지거나 제자리에 머물렀습니다.

얼마나 확실한가요?

이러한 발견은 MAPS 게임 환경 내에서의 시뮬레이션측정에 근거합니다. 연구진은 특정 레이아웃(맵)을 통해 AI와 인간 플레이어를 여러 번 실행하여 이 수치들을 얻었습니다. 그들은 단순히 추측한 것이 아니라, 공원 가치, 지출된 비용, 소요된 시간을 측정했습니다.

이 논문은 AI가 많은 분야에서 발전하고 있지만, 실제 비즈니스를 운영하는 복잡하고 상호 연결되며 예측 불가능한 성격을 다루기에는 아직 갈 길이 멀다고 시사합니다. 인간 전문가와 AI 사이의 격차는 미미한 수준이 아니라 거대한 심연입니다. 연구진은 이 "미니 어뮤즈먼트 파크"를 테스트베드로 활용함으로써, 우리가 마침내 인간 매니저처럼 생각하고, 계획하고, 적응할 수 있는 AI를 구축할 수 있기를 희망합니다.

그때까지, 만약 당신이 테마파크를 운영하고 싶다면, 인간 매니저를 고용하는 것이 좋을 것입니다. 그리고 AI는 아주 짧은 목줄만 채워 두십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →