← 최신 논문
💬 NLP

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

본 논문은 다양한 시나리오에 걸쳐 고수준 계획과 효율적인 행동 실행을 동시에 최적화하는 데 현재 모델들이 어려움을 겪는다는 점을 드러내기 위해, LLM 기반 에이전트의 전략적 일관성과 실행 견고성을 평가하도록 설계된 세 가지 다양하고 장기적인 상호작용 경제 환경을 특징으로 하는 새로운 오픈소스 벤치마크인 EcoGym 을 소개합니다.

원저자: Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu
게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 사업 관리자를 채용한다고 상상해 보세요. 그들에게 주는 대부분의 테스트는 즉석 퀴즈와 같습니다. "여기 문제가 있다, 5 분 안에 풀어라." 하지만 현실에서 사업을 운영하는 것은 즉석 퀴즈가 아니라 마라톤입니다. 3 년 후 회사를 파산시키지 않을 현명한 결정을 오늘 내릴 수 있는지 확인해야 합니다.

이 논문인 "EcoGym" 은 인공지능 에이전트 (인간처럼 행동하는 컴퓨터 프로그램) 를 짧은 과제가 아닌, 시뮬레이션된 경제 내에서의 장기적 생존과 성장 능력으로 평가하는 새로운 방식을 제시합니다.

다음은 그들이 수행한 작업을 간단한 비유로 정리한 내용입니다:

1. 문제: "즉석 퀴즈"의 함정

현재의 인공지능 테스트는 체스 선수가 단일 퍼즐을 풀도록 요구하는 것과 같습니다. 그들은 그 퍼즐을 잘 풀 수 있을지 모르지만, 1,000 수를 두는 긴 게임에서 지지 않고 플레이할 수 있다는 보장은 없습니다. 저자들은 기존 테스트들이 너무 짧고, 너무 구체적이며, 예상치 못한 변화가 발생하는 실제의 복잡한 경제 상황을 반영하지 못한다고 주장합니다.

2. 해결책: EcoGym (비즈니스 시뮬레이터)

이 팀은 EcoGym을 구축했습니다. 이는 인공지능 에이전트들이 1 년 (365 일) 내내 중단 없이 사업을 운영해야 하는 비디오 게임과 같은 세계입니다. 짧은 퀴즈 대신, 이는 마라톤입니다.

인공지능은 자금, 자원, 숨겨진 규칙을 관리하면서도 "순자산"이나 "소득"을 늘리려고 노력해야 합니다. 함정은 무엇일까요? 게임은 결코 끝나지 않고 계속 진행되므로, 인공지능은 장기적인 계획을 세워야 합니다.

3. EcoGym 의 세 가지 "게임"

테스트가 공정하고 다양한 기술을 포괄하도록 하기 위해, 그들은 세 가지 뚜렷한 시나리오를 만들었습니다:

  • 자판기 (상점 주인):

    • 일: 당신은 자판기 사업을 소유하고 있습니다. 무엇을 구매할지, 얼마나 재고를 쌓을지, 그리고 얼마의 가격을 매길지 결정해야 합니다.
    • 도전: 당신은 미래를 알 수 없습니다. 여름이라 사람들이 차가운 음료를 원할 수도 있고, 겨울이라 뜨거운 수프를 원할 수도 있습니다. 인공지능은 이러한 패턴을 추측하고 다음 배송이 도착하기 전에 자금이 고갈되지 않도록 현금을 관리해야 합니다.
    • 목표:순자산 (현금 + 재고 가치) 을 극대화하세요.
  • 프리랜서 (긱 워커):

    • 일: 당신은 코딩이나 글쓰기 같은 작업을 수주하는 프리랜서입니다.
    • 도전: 당신은 제한된 에너지스트레스를 가지고 있습니다. 휴식 없이 너무 많이 일하면 "번아웃"이 되어 실패합니다. 너무 많이 쉬면 돈을 벌지 못합니다. 당신은 일하기, 새로운 기술 배우기, 그리고 잠자기 사이에서 균형을 맞춰야 합니다.
    • 목표: 건강을 유지하면서 총 소득을 극대화하세요.
  • 플랫폼 운영자 (소셜 미디어 CEO):

    • 일: 당신은 콘텐츠 플랫폼 (미니 틱톡이나 유튜브 같은) 을 운영합니다.
    • 도전: 사용자는 자연스럽게 지루해하고 떠납니다 ("감소" 문제). 당신은 새로운 사용자를 유치하기 위해 돈을 쓰고, 크리에이터에게 콘텐츠 제작을 위해 돈을 지불하며, 나쁜 콘텐츠를 규제해야 합니다. 하지만 너무 강하게 밀어붙이면 품질이 떨어지고, 충분히 밀어붙이지 않으면 사용자가 떠납니다.
    • 목표: DAU(일일 활성 사용자) 를 극대화하고 플랫폼을 생존시키세요.

4. 숨겨진 규칙 (마법 상자)

EcoGym 의 가장 멋진 점 중 하나는 인공지능이 규칙을 모른다는 것입니다.

  • 물리 엔진이 숨겨진 비디오 게임을 한다고 상상해 보세요. 점프하면 위로 올라간다는 것은 알지만, 정확히 얼마나 높이 올라가는지는 시도해 볼 때까지 모릅니다.
  • EcoGym 에서 인공지능은 실험해야 합니다. 어떤 가격이, 어떤 근무 일정이, 혹은 어떤 콘텐츠 전략이 효과적인지 파악하기 위해 다양한 시도를 해야 합니다. 이는 단순히 지시를 따르는 것이 아니라 호기심과 발견을 테스트하는 것입니다.

5. 발견한 점 (결과)

저자들은 이용 가능한 11 개의 가장 똑똑한 인공지능 모델 (OpenAI, Google 등 주요 기관의 모델 포함) 을 테스트했습니다. 결과는 다음과 같습니다:

  • 어떤 "초지능"도 모든 것을 이기지 못함: 스포츠에서처럼 수영, 달리기, 점프를 모두 가장 잘하는 단일 선수는 없습니다.

    • 한 모델은 자판기 운영 (돈 벌기) 에 뛰어났습니다.
    • 다른 모델은 최고의 프리랜서(일과 휴식 균형) 였습니다.
    • 세 번째 모델은 최고의 플랫폼 운영자(사용자 만족 유지) 였습니다.
    • 교훈: 한 가지 일에 똑똑하다고 해서 모든 일에 똑똑한 것은 아닙니다.
  • "장기적" 고난: 모든 인공지능에게 가장 큰 문제는 일관성을 유지하는 것이었습니다. 많은 모델들은 초반에 강하게 시작하고 훌륭한 계획을 세웠지만, 1 년이 지나도 그 계획을 중간에 잊어버리거나 진전을 망치는 어리석은 실수를 저질렀습니다. 그들은 오랜 시간에 걸쳐 "전략적 비전"을 유지하는 데 어려움을 겪었습니다.

  • 생각이 도움이 됨: 모델들이 행동하기 전에 "소리를 내어 생각" (이유를 적어보기) 할 수 있게 허용되었을 때, 성능이 크게 향상되었습니다. 이는 인간이 큰 행동을 하기 전에 잠시 멈추고 계획을 세우는 것과 같습니다.

  • 인간 vs 인공지능: 한 테스트에서 인간 전문가들이 게임을 플레이했습니다. 놀랍게도, 최고의 인공지능 모델이 실제로 인간 전문가들을 이겼습니다. 이는 인공지능이 이러한 특정 장기 경제 계획 작업에서 인간보다 더 나을 잠재력을 가지고 있음을 보여줍니다.

6. 왜 이것이 중요한가

이 논문은 우리가 짧고 쉬운 과제로 인공지능을 테스트하는 것을 멈춰야 한다고 결론 내립니다. 사업을 운영하거나 프로젝트를 관리할 수 있는 진정한 유용한 인공지능을 구축하려면, 그들이 시간이 지남에 따라 배우고, 적응하고, 생존해야 하는 길고 복잡한 "EcoGym" 스타일의 환경에서 테스트해야 합니다.

요약하자면: EcoGym 은 인공지능 두뇌를 위한 체육관으로, 단기적 사고를 멈추고 장기적 전략가로 성장하도록 훈련시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →