← 최신 논문
🤖 machine learning

HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

본 논문은 희소 보상 하의 GRPO 스타일 강화학습에서 초기 학습 불안정성을 해결하기 위해 부정적 이득 업데이트의 가중치를 낮추고 응답별 길이 정규화를 평균 길이 정규화로 대체하여 다양한 벤치마크와 모델 규모에서 우수한 성능과 안정성을 달성하는 히스테리시스 정책 최적화 (HPO) 와 그 적응형 변형 (A-HPO) 을 소개한다.

원저자: Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어려운 퍼즐, 예를 들어 복잡한 수학 문제나 네트워크 문제 해결 작업을 로봇에게 가르친다고 상상해 보세요. 로봇에게 프롬프트를 주면, 로봇은 답을 생성해 보려고 합니다. 때로는 정답을 맞추지만, 대부분은 특히 초기 단계에서는 틀립니다.

이 논문은 이러한 로봇들을 훈련시키는 새로운 방법인 히스테레틱 정책 최적화 (Hysteretic Policy Optimization, HPO) 를 소개합니다. 이는 기존 방법 (GRPO) 의 개선된 변형으로, 로봇이 정답을 찾기 위해 고군분투할 때 학습 속도를 훨씬 빠르게 하고 안정성을 높여줍니다.

간단한 비유를 사용한 상세한 설명은 다음과 같습니다:

문제: "시끄러운 교실"

현재의 훈련 방법 (GRPO) 에서 교사 (알고리즘) 는 로봇이 시도한 8 개의 시도 묶음 (batch) 을 살펴봅니다.

  1. 희귀한 성공 문제: 어려운 작업에서 로봇은 8 개 중 1 개 또는 2 개만 정답을 맞출 수 있습니다. 나머지 6 개는 틀립니다.
  2. 볼륨 문제: 현재 방법은 모든 틀린 답을 정답만큼이나 심각하게 다룹니다. 틀린 답이 너무 많기 때문에, 교사는 "그렇게 하지 마!"라고 외치는 소리를 "잘했어!"라는 칭찬 한마디에 대해 6 번이나 내게 됩니다.
  3. 길이 문제: 현재 방법은 또한 답의 길이를 기준으로 답을 평가합니다.
    • 로봇이 짧은 정답을 내놓으면 거대한 "잘했어!" 보상을 받습니다.
    • 로봇이 길고 지저분한 오답을 내놓으면, 그 "그렇게 하지 마!"라는 처벌은 너무 많은 단어에 퍼지기 때문에 희석됩니다.

결과: 로봇은 혼란에 빠집니다. 모든 틀린 답의 소음에 압도당해, 길고 무거운 처벌을 피하기 위해 아주 짧고 무작위적인 답을 추측하기 시작할 수 있습니다. 이는 사소한 실수로 100 번이나 꾸중을 들은 학생이 더 이상 완전한 문장을 쓰려 하지 않고, 그냥 "예" 또는 "아니요"라고만 써서 일을 끝내려 하는 것과 같습니다.

해결책: HPO (현명한 코치)

저자들은 고군분투하는 학생을 어떻게 다루는지 아는 더 현명한 코치처럼 행동하는 HPO 를 제안합니다. 이는 두 가지 주요 트릭을 가지고 있습니다:

1. "볼륨 조절기" (히스테레틱 가중치)

모든 틀린 답을 동일하게 취급하는 대신, 코치는 부정적인 피드백의 볼륨을 낮춥니다.

  • 비유: 로봇이 6 명이 "틀렸어!"라고 외치고 1 명이 "맞았어!"라고 속삭이는 방 안에 있다고 상상해 보세요.
  • 구식 방법: 코치는 7 명 모두를 똑같이 듣습니다. "틀렸어!"라는 군중이 "맞았어!"라는 속삭임을 압도합니다.
  • HPO 방법: 코치는 "틀렸어!"라는 군중에게 "음소거 버튼"을 겁니다. 그들은 여전히 그들을 듣지만, 볼륨을 현저히 낮춥니다. 이를 통해 드문 "맞았어!"라는 속삭임이 실제로 들리고 학습될 수 있게 됩니다.
  • 적응형 버전 (A-HPO): 이것이 가장 똑똑한 버전입니다. 코치는 고정된 음소거 버튼을 사용하지 않습니다. 대신 실시간으로 "틀렸어!"라고 외치는 사람과 "맞았어!"라고 말하는 사람의 수를 세어봅니다. "틀렸어!"라는 군중이 거대하면 그들을 강력하게 음소거합니다. 로봇이 나아지고 "맞았어!"라는 군중이 커짐에 따라, 코치는 로봇이 다시 실수에서 배우도록 "틀렸어!"라는 군중의 볼륨을 서서히 높입니다.

2. "공정한 평균" (평균 길이 정규화)

코치는 개별 답의 길이를 기준으로 답을 평가하는 것을 멈추고, 전체 그룹의 평균 길이를 기준으로 평가하기 시작합니다.

  • 비유: 구식 방법에서는 짧고 정답인 답에 금별을 주었지만, 길고 틀린 답에는 거의 보이지 않는 작은 빨간 X 를 주었습니다. 이는 로봇이 게으르고 간결하게 답하도록 장려했습니다.
  • HPO 방법: 코치는 "우리는 그룹의 평균 노력에 기반하여 모두를 평가할 것이다"라고 말합니다. 이는 로봇이 더 큰 보상을 받기 위해 짧은 답을 써서 시스템을 속이려는 시도를 막습니다. 이는 로봇이 몇 단어를 쓰든 상관없이 문제를 완전히 생각하도록 장려합니다.

실험에서 일어난 일

연구자들은 두 가지 작업에서 이를 테스트했습니다:

  1. TeleLogs: 복잡한 5G 네트워크 오류를 수정하는 작업 (미스터리 해결을 위한 탐정처럼).
  2. Countdown: 숫자를 조합하여 목표 숫자에 도달하는 수학 게임.

결과:

  • 더 빠른 학습: 새로운 방법 (A-HPO) 을 사용한 로봇은 특히 실패가 많았던 초기 단계에서 훨씬 더 빠르게 학습했습니다.
  • 더 높은 점수: 네트워크 작업에서 새로운 방법은 0.84의 점수에 도달하여, 구식 방법 (0.73) 과 다른 경쟁 방법들을 압도적인 차이로 능가했습니다.
  • "단락 회로" 방지: 때때로 로봇이 포기하고 매우 짧고 무용한 답을 쓰게 만들었던 구식 방법과 달리, 새로운 방법은 정확도를 높이면서도 답을 길고 사려 깊게 유지했습니다.

결론

AI 에게 자주 실패하는 어려운 작업을 가르칠 때, 모든 실패를 모든 성공과 동등하게 중요하게 취급해서는 안 됩니다. 그렇게 하면 AI 는 압도되어 시도하는 것을 멈춥니다.

HPO는 다음과 같은 간단한 해결책입니다: "실패를 경청하되, 드문 성공들을 압도하지는 마세요. 또한 답의 길이가 점수 시스템을 속이게 하지 마세요." 피드백을 균형 있게 조정함으로써, AI 는 더 효율적으로 학습하고 더 어려운 문제를 해결합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →