Agentick: A Unified Benchmark for General Sequential Decision-Making Agents
이 논문은 RL, LLM, VLM, 하이브리드 및 인간 에이전트의 순차적 의사결정 분야에서 공정한 비교를 가능하게 하고 발전을 촉진하기 위해 다양한 모달리티와 난이도 수준에 걸쳐 37 개의 절차적으로 생성된 작업을 포함한 통합 벤치마크인 Agentick 을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
세상에서 가장 뛰어난 "문제 해결사"가 누구인지 파악해 보려고 상상해 보세요. 당신은 세 가지 매우 다른 유형의 참가자들을 마주하게 됩니다:
- 백지 상태 (Blank Slate): 아무것도 모르는 로봇으로, 시행착오를 통해 모든 것을 배워야 합니다 (걷는 법을 배우는 아기와 같습니다).
- 백과사전 (Encyclopedia): 거의 인터넷 전체를 읽었지만, 실제 세상에서 아무것도 해본 적이 없는 초지능 컴퓨터입니다.
- 하이브리드 (Hybrid): 위 두 가지의 혼합체입니다.
문제는 무엇일까요? 지금까지는 이들을 공정하게 비교할 수 없었습니다. 마라톤 선수, 체스 그랜드마스터, 수영 선수를 모두 "경주를 하라"고 시켜서 비교하려는 것과 같습니다. 수영 선수는 익사할 것이고, 체스 선수는 길을 잃을 것입니다.
"Agentick"의 등장입니다.
이 논문의 저자들은 Agentick이라는 새로운 보편적 테스트 장을 구축했습니다. 이는 어떤 유형의 AI든 동일한 경기장에서 경쟁할 수 있도록 특별히 설계된 거대하고 절차적으로 생성된 "장애물 코스"라고 생각하시면 됩니다.
장애물 코스 (벤치마크)
Agentick은 단순히 하나의 게임이 아닙니다. 점점 어려워지는 37 가지의 다양한 미니 게임 (미로, 퍼즐, 보물 찾기 등) 의 집합체입니다. 이 게임들은 다음 여섯 가지 특정 기술을 테스트합니다:
- 내비게이션: 길을 찾을 수 있는가?
- 계획 수립: 미리 생각할 수 있는가?
- 추론: 논리 퍼즐을 해결할 수 있는가?
- 기억력: 10 단계 전에 일어난 일을 기억할 수 있는가?
- 일반화: 새로운 규칙에 적응할 수 있는가?
- 팀워크: 다른 이들과 (또는 그들을 상대로) 협력할 수 있는가?
보편적 번역기 (인터페이스)
여기서 마법 같은 트릭이 있습니다. Agentick은 게임의 모든 순간마다 다섯 가지 다른 언어를 동시에 사용합니다.
- "백지 상태 (RL)"를 위해: 구식 아케이드 게임처럼 픽셀화된 비디오 게임 화면을 보여줍니다.
- "백과사전 (LLM)"을 위해:
#을 벽,.을 빈 공간으로 하는 ASCII 문자를 사용한 텍스트 기반 지도나 서술된 설명을 보여줍니다. - 인간을 위해: 3D 스타일의 뷰를 보여줍니다.
이로써 누구도 속임수를 쓰지 않도록 보장합니다. "백과사전"은 픽셀의 의미를 추측할 필요가 없고, "백지 상태"는 규칙을 이해하기 위해 소설을 읽을 필요가 없습니다. 그들은 모두 세계의 동일한 상태를 보지만, 각자가 가장 잘 처리할 수 있는 형식으로 보는 것입니다.
결과: 누가 이겼는가?
연구진은 누가 가장 잘 수행하는지 보기 위해 90,000 개 이상의 게임을 실행했습니다. 간단한 비유를 사용하여 그들이 발견한 바는 다음과 같습니다:
단 하나의 영웅은 없다: "최고"인 AI 는 없습니다. 그것은 작업에 달려 있습니다.
- **백지 상태 (RL)**는 계획 수립과 팀워크에서 놀라웠습니다. 반복을 통해 게임의 정확한 메커니즘을 학습하여 마스터 전술가가 되었습니다.
- **백과사전 (LLM)**은 내비게이션과 일반화에서 뛰어났습니다. 너무 많은 것을 읽었기 때문에, 먼저 연습할 필요 없이 새로운 미로의 올바른 경로를 추측할 수 있었습니다.
- 판결: 가장 똑똑한 AI (GPT-5 mini) 조차도 "완벽한 점수"의 약 **30%**만 달성했습니다. 오늘날 AI 가 할 수 있는 것과 해야 하는 것 사이에는 여전히 거대한 격차가 존재합니다.
"생각하기" 트릭: AI 에게 어떻게 생각하라고 요구하는지가 AI 의 크기보다 더 중요합니다.
- 연구진이 LLM 들에게 행동하기 전에 "단계별로 생각하라" (Chain-of-Thought 라는 방법) 고 지시했을 때, 그들의 성능은 3 배에서 10 배까지 증가했습니다. 마치 학생에게 "단순히 추측하지 말고, 먼저 논리를 적어보라"고 말하는 것과 같습니다. 갑자기 그들은 퍼즐을 훨씬 더 잘 해결합니다.
간단하고 짧을수록 더 낫다: 지도를 탐색하려는 AI 에게 **텍스트 그리드 (ASCII)**가 길고 화려한 설명보다 더 잘 작동했습니다.
- 누군가에게 길 안내를 하려고 상상해 보세요.
#= 벽,.= 길 과 같은 심볼이 포함된 간단한 지도가 "당신은 왼쪽에 벽이 있는 방에 서 있습니다..."라고 말하는 단락의 텍스트보다 종종 컴퓨터가 처리하기 더 쉽습니다. 이러한 간결한 심볼은 공간적 추론에 더 효율적이었습니다.
- 누군가에게 길 안내를 하려고 상상해 보세요.
이것이 중요한 이유
이 논문은 진정한 능력을 갖춘 자율 에이전트 (스스로 일을 할 수 있는 로봇이나 소프트웨어) 를 구축하려면, 서로 다른 유형의 AI 를 별개의 세계로 취급하는 것을 멈춰야 한다고 주장합니다. Agentick 은 각 유형이 빛을 발하고 실패하는 지점을 파악할 수 있는 공통의 토대를 제공합니다.
이는 AI 의 미래가 단순히 더 큰 모델을 만들거나 더 오래 훈련시키는 것에만 있는 것이 아니라, "행동하며 배우는" 백지 상태와 "세계 지식"을 가진 백과사전을 결합하고, 동시에 그들로부터 최상의 결과를 얻기 위한 올바른 "프롬프팅 (지시)"을 사용하는 것에 있음을 시사합니다.
간단히 말해: Agentick 은 같은 경기장에서 체스 선수, 수영 선수, 그리고 달리는 선수를 심판할 수 있는 첫 번째 공정한 심판이며, 우리가 진전을 이루었지만 완벽한 자율 에이전트를 구축하는 데는 여전히 멀었다는 것을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.