← 최신 논문
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

이 논문은 LLM 에이전트가 강화 학습 과정에서 생소한 환경 내의 새로운 솔루션을 발견하는 능력을 상실하는 핵심 실패 모드로 '탐색 붕괴(exploration collapse)'를 식별하고, 보상을 최적화하기에 앞서 자기 경험 기반의 상태 및 전이 예측을 통한 지도 미세 조정(supervised finetuning)을 통해 에이전트를 먼저 접지(grounding)시킴으로써 성능을 향상시키는 방법론인 SPA를 제안한다.

원저자: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

게시일 2026-09-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간처럼 생각하고 행동하며, 퍼즐을 풀거나 가상 세계를 탐험하거나, 심지어 웹 브라우저를 사용하여 정보를 찾는 것까지 가능한 컴퓨터 프로그램을 상상해 보십시오. 대규모 언 언어 모델(LLM)로 알려진 이러한 프로그램들은 인터넷의 방대한 텍스트를 학습하여 문장에서 다음에 올 단어를 예측하는 법을 배웁니다. 연구자들이 이 모델들에게 목표를 달ique하기 위해 단계를 밟아 나가는 '에이전트' 역할을 수행하도록 요청할 때, 흔히 강화 학습이라는 방법을 사용합니다. 이는 모델이 다양한 행동을 시도하고, 그 결과가 성공했는지 실패했는지에 대한 피드백을 받으며, 성공으로 이어지는 행동을 반복하도록 점진적으로 학습하는 과정입니다. 이는 기계에게 명시적으로 프로그래밍되지 않은 일을 하는 법을 가르치는 강력한 방법입니다. 그러나 이러한 에이전트들을 새롭고 익숙하지 않은 상황에 배치할 때 결정적인 문제가 발생합니다. 에이전트는 이전에 보았던 특정 퍼즐은 해결하는 법을 배울 수 있지만, 완전히 새로운 환경을 어떻게 탐색해야 할지 파악하는 데 어려움을 겪으며, 최선의 해결책을 찾는 것을 방해하는 좁은 사고방식에 갇히곤 합니다.

한 연구팀은 왜 이러한 지능형 에이전트들이 미지의 상황에 직면했을 때 실패하는지를 이해하기 위해 연구를 시작했습니다. 그들은 '탐색 붕괴(exploration collapse)'라고 부르는 특정한 현상을 발견했습니다. 간단히 말해, 에이전트가 새로운 과제를 수행하도록 훈련될 때, 종종 단 하나의 특정한 성공 경로만을 찾아내고 다른 모든 가능성은 무시하게 된다는 것입니다. 에이전트는 그 단일 경로에 너무 집중한 나머지 다양한 접근 방식을 시도하는 능력을 상실합니다. 연구진은 이를 두 가지 서로 다른 점수를 통해 측정했습니다. 하나는 에이전트의 가장 최선의 추측이 작동하는지를 추적하는 점수이고, 다른 하나는 에이전트의 여러 다양한 추측 중 어떤 것이라도 작동하는지를 추적하는 점수입니다. 익숙한 작업에서는 에이전트가 학습함에 따라 두 점수 모두 향상됩니다. 하지만 상자를 특정 목표 지점으로 밀어야 하는 격자 기반 퍼즐과 같이 새롭고 어려운 환경에서는, 단일 최선 추측에 대한 점수는 약간 상승하는 반면, 다양한 경로를 시도하는 것에 대한 점수는 실제로 하락합니다. 에이전트는 더 유연해지는 법을 배우는 대신, 잘못된 습관에 더 확신을 갖게 되는 것입니다. 이는 에이전트가 자신이 처한 새로운 세상의 규칙을 진정으로 이해하지 못하기 때문에 발생합니다. 즉, 탄탄한 기초 없이 추측만 하고 있는 것입니다.

이를 해결하기 위해 연구진은 SPA, 즉 '자기 경험 에이전트(Self-Experience Agent)'라고 불리는 새로운 훈련 방법을 개발했습니다. 에이전트에게 즉시 보상을 얻는 법을 가르치는 대신, 먼저 주변 세계를 이해하는 법을 가르쳤습니다. 연구진은 점수를 얻어야 한다는 압박 없이 에이전트가 스스로 환경을 탐색할 기회를 주었습니다. 이 단계에서 에이전트는 자신이 본 것을 설명하고, 특정 행동을 취했을 때 다음에 어떤 일이 일어날지 예측하도록 요청받았습니다. 예를 들어, 에이전트가 특정 위치에 있는 상자를 보고 그것을 밀기로 결정했다면, 먼저 상자가 어디에 있는지 말한 다음 상자가 어디로 이동하게 될지를 예측해야 했습니다. 연구진은 환경으로부터 얻은 실제의 정확한 결과를 사용하여 에이전트의 예측을 수정했으며, 이는 사실상 에이전트에게 해당 게임의 물리 법칙을 가르치는 효과를 냈습니다. 이 과정은 에이전트의 마음속에 일종의 내부 지도 또는 '세계 모델(world model)'을 구축하여, 모호한 추측이 아닌 현실에 근거한 이해를 심어주었습니다.

에이전트가 세상이 어떻게 돌아가는지에 대한 이러한 내부적 이해를 구축한 후, 연구진은 본격적으로 승리하는 법을 가르치기 위한 표준 훈련 과정을 시작했습니다. 결과는 놀라웠습니다. 상자를 목표물로 밀어야 하는 소코반(Sokoban) 퍼즐 게임 테스트에서, 표준 훈련 방식은 에이전트가 약 25%의 확률로만 성공하게 했습니다. 새로운 방식으로는 성공률이 거의 60%까지 치솟았습니다. 얼어붙은 호수가 등장하는 또 다른 퍼즐에서는 성공률이 약 22%에서 70% 이상으로 향상되었습니다. 아마도 가장 놀라운 점은, 이 방식으로 훈련된 매우 작은 규모의 컴퓨터 모델이 기존의 표준 방식으로 훈련된 훨씬 더 크고 강력한 모델을 능가할 수 있었다는 것입니다. 게임의 규칙을 먼저 학습한 이 작은 모델은, 그저 보상을 향해 추측하며 나아가려 했던 거대 모델보다 복잡한 퍼즐을 더 효과적으로 헤쳐 나갈 수 있었습니다.

연구진은 이 접근 방식이 스도쿠(Sudoku)와 같은 논리 퍼즐이나 가사 노동을 시뮬레이션한 환경 등 다른 유형의 과제에서도 작동하는지 테스트했습니다. 에이전트에게 승리하기 전에 세상의 상태를 이해하도록 가르치는 방식은 모든 경우에서 더 나은 결과를 가져왔습니다. 그들은 성공의 핵심이 단순히 더 많은 데이터나 더 큰 컴퓨터를 갖는 것이 아니라, 학습이 일어나는 순서에 있다는 것을 발견했습니다. 에이전트에게 환경의 구조를 먼저 학습하도록 강제함으로써, 에이전트는 단일하고 취약한 전략에 붕괴되는 함정을 피할 수 있었습니다. 에이전트는 자신의 행동이 가져올 결과를 이해함으로써 여러 경로를 탐색하며 선택지를 열어두는 법을 배웠습니다. 이 연구는 인공지능이 새롭고 복잡한 상황에 진정으로 적응하기 위해서는, 성공을 최적화하기 전에 현실에 대한 신뢰할 수 있는 이해를 구축해야 한다는 점을 시사합니다. 이 연구는 에이전트가 환경의 실제 메커니즘에 근거를 둘 때, 더 효과적으로 탐색하고 이전에는 도달할 수 없었던 문제를 해결할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →