← 최신 논문
💬 NLP

Milestone-Guided Policy Learning for Long-Horizon Language Agents

본 논문은 마일스톤 경계에서 궤적을 분할하고 이중 규모 우위 추정을 적용하여 장기 언어 에이전트의 신용 할당 오류 및 샘플 비효율성을 해결하는 마일스톤 유도 정책 학습 프레임워크인 BEACON 을 소개하며, ALFWorld 와 같은 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

게시일 2026-05-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 집사를 어지러운 집을 치우도록 가르친다고 상상해 보세요. 이 작업은 길고 복잡합니다: "파란 열쇠를 찾아서, 창고 문을 열고, 고양이를 꺼내서, 그리고 먹이를 주세요."

로봇이 마지막에 실패한다면 (아마도 고양이를 먹이는 것을 잊었을 것입니다), 전통적인 훈련 방법은 "실패했어! 돌아가서 네가 한 모든 것을 취소해."라고 말합니다. 이는 로봇이 이전에 한 좋은 일들, 예를 들어 열쇠를 찾고 문을 여는 일들에 대해 처벌받게 만든다는 뜻입니다. 로봇은 초반에는 올바른 일을 했음에도 마지막의 실수 때문에 '나쁜 점수'를 받아 혼란을 겪게 됩니다.

이 논문은 이러한 혼란을 해결하기 위해 BEACON이라는 새로운 훈련 방법을 소개합니다. 간단한 비유를 들어 그 작동 원리를 설명해 보겠습니다:

문제: "전부 아니면 전무"식 점수 매기기

현재 방법들 (GRPO 등) 은 로봇의 하루 전체를 하나의 단일 시험으로 취급합니다.

  • 결함: 로봇이 작업의 99% 를 완벽하게 수행했지만 마지막 단계에서 넘어지면, 하루 전체가 실패로 기록됩니다.
  • 결과: 로봇은 99% 의 훌륭한 작업으로부터 아무것도 배우지 못합니다. 또한 때로는 같은 행동 (예: "열쇠 찾기") 을 했을 때 "잘했다"는 신호를 받기도 하고, 다른 때는 나중 단계가 잘못되었을 뿐인데 "잘못했다"는 신호를 받기도 하므로 혼란을 겪습니다. 이는 모든 방정식을 올바르게 풀었음에도 불구하고 이름만 잊어 썼다는 이유로 수학 시험에서 F 를 받는 학생과 같습니다.

해결책: BEACON ("체크포인트" 시스템)

BEACON 은 긴 작업을 더 작은 장, 즉 마일스톤으로 나누어 게임을 바꿉니다. 이러한 마일스톤은 비디오 게임의 체크포인트라고 생각하세요.

1. 여정을 세그먼트로 나누기
BEACON 은 로봇을 평가하기 위해 마지막까지 기다리는 대신 자연스러운 중단 지점을 찾습니다.

  • 예시: "열쇠를 찾았나요?" (체크포인트 1). "문을 열었나요?" (체크포인트 2).
  • 로봇이 체크포인트에 도달하면, 게임은 그곳에 도달하는 데 어떤 경로를 사용했는지 기억을 "초기화"합니다. 로봇이 열쇠를 찾는 데 이상한 경로를 사용했는지 여부는 중요하지 않습니다. 중요한 것은 로봇이 지금 열쇠 앞에 있다는 점입니다.

2. 부분적 진전에 대한 신용 부여
구식 시스템에서는 로봇이 마지막에 실패하면 하루 전체에 대해 0 점을 받았습니다.

  • BEACON 의 트릭: 로봇이 열쇠를 찾았지만 나중에 실패하더라도, 열쇠를 찾은 것에 대해 "부분 점수" 보상을 받습니다.
  • 비유: 릴레이 경주를 상상해 보세요. 마지막 레이스에서 주자가 배턴을 떨어뜨리면, 구식 시스템은 전체 팀에게 0 점을 줍니다. BEACON 은 "첫 번째 주자는 훌륭하게 했어! 배턴을 완벽하게 넘겼어. 마지막 주자가 떨어뜨렸더라도 그들에게 하이파이브와 작은 보상을 주자"라고 말합니다. 이는 로봇이 다음 체크포인트에 도달하기 위해 계속 시도하도록 장려합니다.

3. "이중 스케일" 코치
BEACON 은 피드백을 제공하는 두 가지 유형의 코치를 사용합니다:

  • 큰 그림 코치: 최종 결과를 봅니다. 고양이가 먹이를 먹었나요? 예/아니요. 이는 로봇이 궁극적인 목표에 집중하도록 유지합니다.
  • 세그먼트 코치: 현재 장만 봅니다. "문을 효율적으로 열었나요?" 이 코치는 로봇을 문 열기 단계에 도달한 다른 로봇들과만 비교합니다.
  • 이것이 도움이 되는 이유: 로봇이 자신의 일을 한 후 발생한 일들 때문에 처벌받는 것을 막아줍니다. 로봇이 문을 완벽하게 열었지만, 그룹의 다음 로봇이 고양이를 먹이는 데 실패하더라도 첫 번째 로봇은 두 번째 로봇의 실패에 대해 비난받지 않습니다.

결과: 더 똑똑하고 빠른 학습자

저자들은 이 방법을 세 가지 다른 "세계"에서 테스트했습니다:

  1. ALFWorld: 텍스트 기반 집 청소 게임.
  2. WebShop: 온라인 쇼핑 시뮬레이션.
  3. ScienceWorld: 가상 과학 실험실.

무슨 일이 일어났나요?

  • 구식 방법: 작업이 길어질수록 로봇들은 더 나빠졌습니다. 그들은 혼란을 겪고 학습을 멈췄습니다.
  • BEACON: 로봇들은 매우 긴 작업에서도 점점 더 나아졌습니다.
    • 가장 어려운 집 청소 작업에서 BEACON 은 **93%**의 성공률을 보인 반면, 구식 방법은 **54%**의 성공률만 보였습니다.
    • BEACON 은 훈련을 훨씬 더 효율적으로 만들었습니다. 마지막에 실패했다는 이유로 연습 주행의 76% 를 폐기하는 대신, BEACON 은 부분적 성공에 보상을 함으로써 **82%**의 주행에서 유용한 교훈을 찾았습니다.

요약

BEACON 은 최종 시험 점수만 보는 것이 아니라, 모든 단계에서 숙제를 확인하는 똑똑한 선생님 같습니다. 만약 처음 세 장은 잘 풀었지만 마지막 장을 망쳤다면, 선생님은 "처음 세 장은 훌륭해! 마지막 장만 고치자"라고 말합니다. 이는 학생이 포기하지 않게 하고 복잡한 긴 작업을 훨씬 빠르게 학습하도록 돕습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →