← 최신 논문
🤖 AI

Retry Policy Gradients in Continuous Action Spaces

이 논문은 경로 미분 추정량(pathwise derivative estimators)을 도입하여 ReMax의 재시도 기반 목적 함수를 연속 행동 공간으로 확장함으로써, 정책 경사(policy-gradient) 지형을 재형성하여 명시적인 엔트로피 정규화 없이도 SAC와 대등한 성능을 달성하고 확률적 탐색을 촉진하는 ReMAC 알고리즘을 제시한다.

원저자: Soichiro Nishimori, Paavo Parmas

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Soichiro Nishimori, Paavo Parmas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 방을 가로질러 걷는 법을 가르치고 있다고 상상해 보세요. 로봇은 눈이 가려져 있어서 어디를 디뎌야 할지 추측만 할 수 있습니다. 인공지능의 세계에서는 이것을 **강화 학습(Reinforcement Learning)**이라고 부릅니다. 로봇은 다양한 움직임을 시도하고, 잘했을 때 "점수(보상)"를 받으며, 자신의 실수를 통해 배웁니다.

가장 큰 문제는 **탐험(exploration)**입니다. 어떻게 하면 로봇이 단순히 안전하고 지루한 단계만을 반복하는 대신, 새로운 것들을 시도하게 만들 수 있을까요?

기존 방식: "노이즈" 추가하기

전통적으로 과학자들은 로봇이 탐험하도록 만들기 위해 뇌에 약간의 "노이즈"나 무작위성을 추가했습니다. 이는 마치 로봇에게 "헤이, 가끔은 그냥 다리를 무작위로 까닥거려 봐!"라고 말하는 것과 같습니다. 이 방법은 효과가 있지만, 요리에 향신료를 넣는 것과 같아서 아주 정밀하게 측정해야 하고 결국에는 제거해야 합니다. 그렇지 않으면 요리 맛이 이상해지기 때문입니다.

새로운 아이디어: "재시도(Retry)" 전략

이 논문은 ReMax(Retry Maximum의 약자)라고 불리는 새로운 학습 방식을 소개합니다.

로봇에게 무작위로 행동하라고 지시하는 대신, ReMax는 게임의 규칙을 바꿉니다. 당신이 시험을 보고 있다고 상상해 보세요.

  • 기존 방식: 당신은 질문 하나에 단 한 번의 기회를 얻습니다. 당신은 최선의 추측을 선택하고, 그것이 당신의 점수가 됩니다.
  • ReMax 방식: 당신은 같은 질문에 대해 M번(예를 들어 4번 또는 8번) 시험을 볼 기회를 얻습니다. 당신은 8개의 답변을 모두 적고, 그중 가장 좋은 것을 골라 그것을 당신의 점수로 삼습니다.

로봇은 자신의 선택지를 열어두는 것(즉, 약간의 '확률적' 변동성을 갖는 것)이 여러 번의 시도 중에서 훌륭한 답을 우연히 발견할 확률을 높여준다는 것을 배우게 됩니다. 로봇은 별도의 "노이즈" 지시 없이도, 여러 번의 시도 중 최선을 찾는 과정에서 자연스럽게 탐험을 하게 됩니다.

연속적인 공간(Continuous Spaces)에서는 어떤 일이 벌어질까?

이 논문은 로봇이 관절을 단순히 "왼쪽"이나 "오른쪽"이 아닌, 어떠한 각도로도 움직일 수 있는 **연속적 행동 공간(continuous action spaces)**에 초점을 맞춥니다.

저자들은 이 "재시도" 전략이 로봇의 학습 경로를 어떻게 변화시키는지에 대한 놀라운 발견을 했습니다:

  1. "밀기(Push)" (방향): 로봇이 목표에서 멀리 떨어져 있고 경직되게 움직일 때(낮은 무작위성), "재시도" 전략의 수학적 원리는 로봇이 더 무작위적으로 변하도록 자연스럽게 밀어붙입니다. 이는 마치 로봇이 "나는 구석에 갇혔어, 빠져나갈 길을 찾으려면 더 많이 꿈틀거려야 해"라고 깨닫는 것과 같습니다.
  2. "브레이크(Brake)" (크기): 로봇이 완벽한 해결책에 가까워지면, "재시도" 전략은 부드러운 브레이크 역할을 합니다. 이는 학습 속도를 늦춥니다. 이는 로봇이 완벽한 지점을 지나쳐 과하게 달려가는 것을 방지하는 데 좋습니다. 로봇이 안착하기 전에 조금 더 오래 탐험하도록 유지해 줍니다.

"ReMAC" 로봇

저자들은 이를 테스트하기 위해 ReMAC(ReMax Actor-Critic)이라는 특정 로봇 뇌를 구축했습니다. 그들은 매우 성공적인 표준 로봇 뇌인 SAC를 가져와서, "노이즈" 지시 사항을 "재시도" 지시 사항으로 단순히 교체했습니다.

결과:

  • 성능: ReMAC 로봇은 세계 최고의 로봇들(SAC)만큼 잘 걷는 법을 배웠습니다.
  • 탐험: 추가적인 "노이즈" 향신료 없이도, ReMAC 로봇은 이론이 예측한 대로 정확히 더 오랫동안 더 다양한 움직임(높은 엔트로피)을 자연스럽게 유지했습니다.
  • 주의점: "재시도" 방식은 로봇이 한 번에 여러 결과를 시뮬레이션해야 하므로, 약간 더 많은 컴퓨터 연산 능력을 필요로 합니다.

Adam 옵티마이저의 반전

논문은 또한 로봇을 훈련시키는 데 사용되는 컴퓨터 도구(Adam)에 "안정화 파라미터"라는 작은 설정값이 일종의 볼륨 조절 노브처럼 작동한다는 것을 발견했습니다.

  • 이 노브를 낮게 설정하면, "재시도" 전략의 "브레이크" 효과가 약해져서 로봇이 빠르게 학습하지만 너무 빨리 안착해 버릴 수 있습니다.
  • 이 노브를 높게 설정하면, 브레이크 효과가 강해져서 로봇이 더 오랫동안 탐험을 지속하게 합니다.

요약하자면

이 논문은 AI에게 노이즈를 추가하여 무작위성을 강요할 필요가 없다는 것을 보여줍니다. 대신, AI에게 여러 번의 시도 중 최선을 찾는 데 최적화하도록 가르치면, AI는 약간의 예측 불가능함을 갖는 것이 최선의 해결책을 찾는 가장 똑똑한 방법임을 자연스럽게 깨닫게 됩니다. 이는 추가적인 규칙 없이도 호기심을 장려하는 영리하고 내장된 방식입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →