← 최신 논문
💻 computer science

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

이 논문은 지도 미세 조정(supervised fine-tuning)과 다회차 그룹 상대적 정책 최적화(Multi-Turn Group Relative Policy Optimization)를 결합한 새로운 파이프라인을 통해 훈련되어, 이질적인 행동 공간 사이를 자율적으로 선택하고 전환함으로써 마인크래프트 환경 내의 동적이고 장기적인 과업에서 최첨단 성능과 적응성을 달성하는 통합 에이전트 모델인 CrossHA를 소개한다.

원저자: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 마인크래프트(Minecraft) 게임을 가르치고 있다고 상상해 보세요. 과거에 연구자들은 게임의 각기 다른 부분들을 위해 별도의 "두뇌"를 만들어야 했습니다. 어떤 두뇌는 걷기에 특화되어 있었고(단순한 단계별 명령 사용), 또 다른 두뇌는 메뉴 클릭에 능숙했으며(정밀한 마우스 움직임 사용), 세 번째 두뇌는 고차원의 단축키 사용에 능했습니다(예: "가장 가까운 나무로 이동하기").

문제는 이 로봇들이 경직되어 있었다는 점입니다. 만약 어떤 작업이 걷기와 메뉴 클릭을 모두 필요로 한다면, 로봇은 한 번에 한 가지 종류의 "언어"만 사용할 수 있도록 훈련되었기 때문에 혼란에 빠지거나 멈춰버리곤 했습니다.

핵심 아이디어: "맥가이버 칼" 에이전트
이 논문은 새로운 종류의 AI 에이전트인 CrossHA를 소개합니다. 이는 마치 모든 주방 도구를 갖춘 숙련된 요리사와 같습니다. 이 에이전트는 숟가락이나 칼 중 하나만을 강요받는 대신, 재료(작업)를 보고 즉시 결정합니다. "지금 내가 필요한 것이 거친 다지기(단순한 움직임)인가, 아니면 정교한 슬라이스(정밀한 클릭)인가?"

이 모델은 인간이 매 단계마다 어떤 것을 사용할지 알려주지 않아도, 실시간으로 서로 다른 "행동 언어" 사이를 매끄럽게 전환할 수 있는 최초의 모델입니다.

어떻게 가르쳤는가 (훈련 레시피)

연구진은 단순히 모델에 데이터를 쏟아부은 것이 아니라, 인간이 복잡한 기술을 배우는 방식과 유사한 3단계 훈련 파이프라인을 사용했습니다.

  1. "맛보기" 단계 (지도 미세 조정 - Supervised Fine-Tuning):
    먼저, 모델에게 사람들이 다양한 방식으로 게임을 플레이하는 수천 개의 사례를 보여주었습니다. 여기서의 목표는 모델에게 이 모든 다양한 방식의 "어휘"를 가르쳐서, 모델이 그 모든 것을 이해할 수 있게 하는 것이었습니다. 이는 학생에게 영어, 스페인어, 프랑스어를 읽는 법을 가르치되, 아직 이야기를 쓰는 법까지 요구하지는 않는 것과 같습니다.

  2. "스프린트" 단계 (단일 턴 강화 학습 - Single-Turn RL):
    다음으로, 모델에게 짧고 단발적인 도전 과제들을 주었습니다. 만약 모델이 잘못된 "언어"를 사용하여 문제를 해결하려 한다면(예: 문 손잡이를 클릭하는 대신 문을 뚫고 지나가려고 시도하는 경우), 낮은 점수를 받았습니다. 반대로 적절한 도구를 선택하면 보상을 받았습니다. 이를 통해 모델은 단일 순간에 어떤 도구를 선택할지에 대한 빠르고 스마트한 판단력을 배웠습니다.

  3. "마라톤" 단계 (멀티 턴 강화 학습 - Multi-Turn RL):
    마지막으로, 모델이 길고 전체적인 게임을 플레이하도록 했습니다. 목표는 단순히 한 단계를 맞히는 것이 아니라, 전체 퀘스트를 효율적으로 완수하는 것이었습니다. 모델은 때때로 "빠르지만 투박한" 방식이 들판을 가로지를 때 더 낫다는 것을, 그리고 "느리지만 정교한" 방식으로 전환하는 것이 섬세한 아이템을 제작할 때 필수적이라는 것을 배웠습니다. 모델은 긴 여정 동안 속도와 정확성의 균형을 맞추는 법을 배웠습니다.

결과: 이것이 왜 중요한가

연구진은 이 모델을 나무 베기부터 복잡한 아이템 제작, 몬스터와의 전투에 이르기까지 마인크래프트의 800가지 이상의 서로 다른 작업에 대해 테스트했습니다.

  • 기존 방식: 한 가지 방식(예: 걷기만 가능)으로만 훈련된 로봇은 걷기는 잘했지만 제작에는 서툴렀습니다. 그들은 달리기만 할 줄 알고 문을 여는 법은 모르는 사람과 같았습니다.
  • CrossHA 방식: 새로운 모델은 모든 면에서 뛰어났습니다. 단순히 평균 점수가 높은 것이 아니라, 정확히 언제 기어를 바꿔야 할지를 알았기 때문에 탁월한 성과를 냈습니다.

"스마트한 운전자"의 비유:
자동차 운전을 상상해 보세요.

  • 고정된 동작의 로봇은 고속도로에서만 운전할 줄 아는 운전자와 같습니다. 비포장도로를 만나면 사고를 내고, 주차장에 들어서면 길을 잃습니다.
  • CrossHA는 고속도로에서는 효율성을 위해 고속 기어로 바꾸고, 좁은 주차 공간에서는 정밀함을 위해 저속 기어로 바꾸어 조심스럽게 운전할 줄 아는 숙련된 운전자와 같습니다. 이 모델은 스스로 기어를 바꿀 때를 알기 위해 부조종사의 도움을 받을 필요가 없습니다. 그저 도로의 상태를 느끼고 적응할 뿐입니다.

결론

이 논문은 하나의 모델이 이 모든 서로 다른 "행동 공간"을 마스터하도록 훈련하고, 보상을 통한 시행착오(강화 학습)를 통해 학습하게 함으로써, 단 하나의 유형의 행동에 갇혀 있던 기존 모델들보다 훨씬 더 똑똑하고 유연하며 효율적인 에이전트를 만들었다고 주장합니다.

그들은 이 모델이 복잡한 오픈 월드 게임에서 800가지 이상의 다양한 도전을 수행할 수 있음을 보여줌으로써 이를 입증했으며, 모델과 코드는 다른 이들도 사용할 수 있도록 공개되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →