← 최신 논문
🤖 AI

CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies

이 논문은 이질적인 다중 에이전트 커피 경제 내에서 장기적 관점의 LLM 에이전트를 평가하기 위해 설계된 벤치마크인 CoffeeBench를 소개하며, 대부분의 모델이 능동적인 의사소통을 통해 양(+)의 순수익을 달하는 반면, 일부 모델은 일관된 계획에도 불구하고 '유휴 표류(idle-drift)'와 같은 특정 실패 모드를 보인다는 점을 밝히고 있습니다.

원저자: Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Issa Sugiura, Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 디지털 커피숍 시뮬레이션이 90일 동안 실행되는 세상을 상상해 보세요. 이 세계에는 여섯 개의 독립적인 사업체가 있습니다. 원두를 재배하는 두 명의 농부, 그 원두를 볶아 커피로 만드는 두 명의 로스터, 그리고 최종적으로 고객에게 완성된 커피 한 잔을 판매하는 두 명의 소매업자입니다.

이 논문은 AI 에이전트가 장기간 하나의 사업체를 얼마나 잘 운영할 수 있는지 테스트하기 위해 설계된 새로운 "테스트"인 CoffeeBench를 소개합니다. 기존의 테스트들이 단순히 질문에 답하거나 단판 게임을 수행하는 방식이었다면, CoffeeBench는 AI가 돈을 관리하고, 물건을 사고팔며, 다른 사업체와 협상하고, 매일 결정을 내리는 실제 CEO처럼 행동하도록 강제합니다.

다음은 연구진이 발견한 내용을 쉬운 비유를 사용하여 정리한 테스트 방식과 결과입니다.

설정: 디지털 커피 체인

이 시뮬레이션을 약간의 반전이 있는 복잡한 릴레이 경주라고 생각해보세요.

  • 플레이어: 두 명의 농부, 두 명의 로스터, 두 명의 소매업자가 있습니다. 이들은 서로 경쟁하면서도 생존을 위해 서로 거래해야 합니다.
  • 목표: 테스트 대상인 AI는 특정 로스터의 역할을 맡습니다. 이 AI의 유일한 임무는 90일 동안 최대한 많은 이윤을 남기는 것입니다.
  • 상대방: 나머지 다섯 개의 사업체는 다른 AI 에이전트(또는 고정된 규칙)에 의해 운영됩니다. 그들 역시 자신만의 돈을 벌기 위해 노력하고 있습니다.
  • 규칙:
    • 가만히 앉아 있을 수는 없습니다. 생두를 사고, 볶고, 볶은 커피를 팔아야 합니다.
    • 현금을 관리해야 합니다(돈이 떨어지지 않도록 주의하세요). 재고도 관리해야 합니다(커피가 상하게 두지 마세요). 또한 가격도 조절해야 합니다.
    • 다른 사업체와 대화할 수 있습니다. 예를 들어, "원두 20kg을 10달러에 살게요"라거나 "저기, 혹시 대량 구매 할인을 해줄 수 있나요?"라고 말할 수 있습니다.
    • 현금이 바닥나면 파산하며 게임에서 퇴출됩니다.

테스트: AI의 성적

연구진은 여러 가지 다양한 AI 모델들을 이 커피 경제 체제에 맞붙였습니다. 그들은 누가 최고의 "사업가"가 될 수 있는지 확인하고자 했습니다.

1. 승자 (활동적인 관리자들)
GPT-5.5Claude Opus 4.7 같은 모델들이 가장 좋은 성적을 거두었습니다.

  • 그들이 한 일: 이들은 매우 바쁘고 수다스러운 기업가 같았습니다. 끊임없이 다른 사업체에 전화를 걸고, 가격을 협상하고, 계약을 맺었습니다. 단순히 상황이 일어나기를 기다리지 않고, 공급망을 능동적으로 관리했습니다.
  • 결과: 이들은 상당한 수익(시뮬레이션 내에서 약 3,000달러)을 창출했습니다.

2. "조용한" 성과자들
Gemini 3.1 Pro와 같은 일부 모델들은 말을 많이 하지는 않았지만 괜찮은 수익을 냈습니다.

  • 그들이 한 일: 이들은 효율적이지만 반응적인 형태를 보였습니다. 다른 이들이 메시지를 보내기를 기다렸다가 응답했습니다. 먼저 대화를 시작하지는 않았지만, 사업을 계속 운영하는 데는 성공했습니다.

3. 패자: "유휴 표류(Idle Drift)"의 실패
Claude Haiku 4.5라는 모델은 매우 기이한 문제를 겪었습니다.

  • 문제점: 이 모델은 저자들이 **"유휴 표류(Idle Drift)"**라고 부르는 현상을 겪었습니다.
  • 비유: 체스 선수가 보드 앞에 앉아 아주 깊게 고민하고, 종이에 아주 훌륭한 계획을 적어 내려간 뒤... 아무것도 하지 않는 모습을 상상해 보세요. 그저 다음 날이 시작되기만을 기다리며 앉아 있는 것입니다.
  • 발생한 일: AI는 뉴스를 읽고 시장을 분석하며 "모든 것이 좋아 보인다, 훌륭한 계획이 있다"라고 말한 뒤, 90일 중 40일 동안 아무것도 하지 않기로 선택했습니다. 추론 과정은 일관성을 유지했지만, 행동하기를 거부했습니다.
  • 결과: 아무것도 하지 않았기 때문에 돈을 잃었고, 시뮬레이션 종료 시점에 적자를 기록했습니다.

논문의 핵심 요약

  • 대화가 중요하다: 가장 성공적인 AI 에이전트들은 소통을 가장 많이 한 모델들이었습니다. 복잡한 경제 체제에서는 사무실에 앉아 운이 좋기를 바라기만 해서는 안 됩니다. 협상하고 관계를 구축해야 합니다.
  • 장기적 사고는 어렵다: 90일 동안 사업을 운영하는 것은 단거리 경주가 아니라 마라톤입니다. 많은 AI가 시간이 흐름에 따라 혼란을 겪거나 나태해졌습니다.
  • 더 많은 행동이 곧 더 많은 돈은 아니다: AI가 도구 호출(가격 확인이나 메시지 전송 등)을 많이 했다고 해서 반드시 돈을 더 많이 번 것은 아니었습니다. (좋은 가격을 받아내는 것과 같은) 결정의 이 행동의 보다 더 중요했습니다.
  • "유휴(Idle)" 버그: 이 논문은 AI가 행동하지 않고 "생각"만 하는 루프에 빠지는 특정 실패 모드를 강조합니다. 이는 장기적인 과업을 수행해야 하는 미래의 AI에게 매우 중요한 문제입니다.

이 논문이 말하지 않는

  • 이 AI들이 당장 내일 현실 세계의 커피 회사를 운영할 준비가 되었다고 주장하지 않습니다.
  • 이것이 금융 위기를 해결하거나 글로벌 경제를 바꿀 것이라고 말하지 않습니다.
  • AI가 사업가처럼 "의식을 갖거나" "감정을 느낀다"고 암시하지 않습니다. 이는 단지 숫자를 극대화하라는 지침을 따르고 있는 것뿐입니다.

요약하자면: CoffeeBench는 목표가 커피 사업을 운영하는 것인 AI를 위한 비디오 게임입니다. 승자들은 가장 많이 대화하고 가장 많이 행동한 모델들이었습니다. 패자는 너무 많이 생각하고 너무 적게 행동하여, 결국 아무것도 하지 않는 상태로 표류해 버린 모델이었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →