← 최신 논문
🤖 AI

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

본 논문은 LLM 에이전트가 탐사가 필요한 높은 불확실성 시나리오와 실행에 적합한 명확한 문맥을 적응적으로 구분하여 텍스트 기반 및 GUI 기반 에이전트 벤치마크 전반에 걸쳐 일관된 성능 향상을 달성할 수 있도록 하는 탐사 인식 강화 학습 프레임워크를 제안한다.

원저자: Xingyuan Hua, Sheng Yue, Ju Ren

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xingyuan Hua, Sheng Yue, Ju Ren

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"학습을 통한 탐험: 탐험 인식 정책 최적화를 통한 에이전트 추론 확장"이라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 정리합니다.

큰 문제: '추측하고 확인하는' 함정

새로운 방에서 복잡한 퍼즐을 풀려고 하지만, 한 번에 전체 그림을 볼 수 없다고 상상해 보세요. 조각들이 어디에 맞는지 파악하려면 주변을 돌아다니고, 물건을 만지고, 서랍을 열어봐야 합니다.

현재의 AI 에이전트 (지능형 컴퓨터 프로그램) 는 주변을 둘러보는 것을 두려워하는 사람들과 같습니다. 그들은 완주선까지 곧바로 달려가도록 훈련받았습니다. 무엇을 해야 할지 100% 확신이 없으면 다음과 같은 두 가지 중 하나를 선택합니다.

  1. 포기하고 틀리게 추측합니다.
  2. 목적 없이 방황하며, 이미 정답을 알고 있음에도 불구하고 방 안의 모든 서랍을 열어봅니다. 이는 시간과 에너지를 낭비합니다.

이 논문은 인간이 이 부분에서 더 뛰어나다고 주장합니다. 우리가 불확실할 때는 멈추고, 단서를 모으기 위해 주변을 둘러본 뒤, 그 다음에 행동을 취합니다. 실수를 하면 뒤로 물러나 다른 길을 시도할 수 있습니다. 하지만 현재의 AI 는 이를 자연스럽게 수행하는 데 어려움을 겪습니다.

해결책: EAPO (스마트 탐험가)

저자들은 EAPO(Exploration-Aware Policy Optimization, 탐험 인식 정책 최적화) 라는 새로운 훈련 방법을 개발했습니다. EAPO 를 AI 에게 탐험, 기억, 행동이라는 세 단계의 춤을 가르치는 코치라고 생각하세요.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다.

1. '배낭'과 '노트북' (기억과 탐험)

AI 를 등산객이라고 상상해 보세요.

  • 배낭 (기억): AI 는 본 모든 것을 적어두는 '배낭'을 들고 다닙니다. 문을 열고 붉은 벽을 보면, 노트에 "문 뒤에 붉은 벽이 있음"이라고 적습니다.
  • '탐험' 모드: AI 가 혼란스러울 때 단순히 추측하지 않습니다. 대신 '탐험 모드'로 전환합니다. *"이 문 뒤에 뭐가 있을지 모르겠어. 안을 살짝 들여다보고, 노트에 적고, 다시 나올게."*라고 말합니다.

이 논문에서는 AI 가 명시적으로 다음을 적어야 하는 특별한 형식을 도입합니다.

  • : "무슨 일이 일어나는지 확인하기 위해 이 버튼을 확인하겠습니다."
  • : "좋아, 확인했어. 불이 켜지네. 기억해 두겠어."
  • : "이제 불이 켜진 것을 알았으니, 초록색 버튼을 누르겠습니다."

2. '시간 여행' 트릭 (롤백)

가장 마법 같은 부분입니다. 많은 비디오 게임에서 함정에 걸리면 죽고 레벨을 처음부터 다시 시작해야 합니다. 이는 짜증나고 비효율적입니다.

이 논문은 AI 에게 시간 여행 (롤백) 방법을 가르칩니다.

  • AI 가 경로를 탐험하다가 *"아, 저 문은 잘못된 문이네"*라고 깨닫으면 당황하지 않습니다.
  • 웹 브라우저의 '뒤로' 버튼처럼, 실수를 하기 직전의 정확한 위치로 즉시 돌아갑니다.
  • 결정적으로, 탐험하는 동안 적은 메모를 유지합니다. *"빨간 문을 시도해 봤는데 잠겨 있었어. 그러니 다시는 시도하지 않겠지."*라고 기억합니다.

이것은 탐험을 '막다른 길'이 아닌 '학습 기회'로 바꿉니다.

3. '스마트 보상' 시스템

AI 가 영원히 방황하지 않도록 탐험을 가르치려면 좋은 보상 시스템이 필요합니다.

  • 옛 방식: AI 는 작업을 완료했을 때만 보상을 받습니다. 탐험은 보상을 지연시키므로 시간 낭비라고 학습합니다.
  • EAPO 방식: AI 는 유용한 정보를 수집할 때 '보너스 점수'를 받습니다.
    • AI 가 서랍을 열어 열쇠를 찾으면, 그 열쇠를 아직 사용하지 않았더라도 보상을 받습니다.
    • AI 가 서랍을 열어 아무것도 찾지 못하면, 시간을 낭비했다는 이유로 작은 페널티를 받습니다.
    • 이는 AI 가 선택적이 되도록 가르칩니다. "유용한 것을 찾을 것 같을 때만 탐험할 거야."

실험 결과

연구자들은 이 '스마트 탐험가'를 네 가지 유형의 과제를 통해 테스트했습니다.

  1. 텍스트 기반 작업: 레시피 따르기나 텍스트 어드벤처 게임 해결.
  2. 온라인 쇼핑: 웹사이트에서 특정 품목 찾기.
  3. 모바일 앱 (Android): 설정을 변경하기 위해 전화 메뉴 탐색.
  4. 데스크톱 컴퓨터 (OS): 파일 열기 및 창 이동.

결과:

  • 더 나은 성능: EAPO 로 훈련된 AI 는 다른 AI 방법들보다 훨씬 더 많은 과제를 해결했습니다 (일부 경우 성공률이 20% 에서 60% 까지 향상됨).
  • 작은 모델, 큰 두뇌: EAPO 로 훈련된 매우 작은 AI 모델 (20 억 개 파라미터) 이 이 방법을 사용하지 않은 훨씬 크고 비싼 모델들보다 더 좋은 성과를 냈습니다. 이는 두뇌의 크기보다 생각하는 방식이 더 중요하다는 것을 증명했습니다.
  • 적응성: AI 는 혼란스러울 때만 탐험하도록 학습했습니다. 정답을 알고 있을 때는 빠르게 행동했고, 길을 잃었을 때는 멈추고 단서를 모았습니다.

결론

이 논문은 AI 에이전트에게 호기심은 있지만 단호한 태도를 가르칠 수 있음을 보여줍니다. 맹목적으로 추측하거나 허둥지둥 모든 것을 클릭하는 대신, 다음과 같이 학습합니다.

  1. 불확실할 때 멈춥니다.
  2. 정보를 수집합니다 (탐험).
  3. 기록합니다 (기억).
  4. 실수를 하면 뒤로 물러납니다 (롤백).
  5. 그 새로운 지식을 사용하여 올바른 행동을 취합니다.

이는 "박물관이 어디야?!"라고 소리치며 도시를 뛰어다니는 관광객과, 지도를 확인하고 현지인에게 물어보며 방향을 적어본 뒤 자신감 있게 목적지로 걸어가는 현명한 여행자의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →