← 최신 논문
🤖 machine learning

Using Reward Uncertainty to Induce Diverse Behaviour in Reinforcement Learning

본 논문은 보상 불확실성을 보상 함수에 대한 분포로 취급하도록 목적 함수를 재구성함으로써, 기존의 엔트로피 정규화나 휴리스틱 방법들에 내재된 성능-다양성 간의 상충 관계를 제거하고, 에이전트의 다양하고 제어 가능한 행동을 자연스럽게 유도하는 새로운 강화 학습 프레임워크를 제안한다.

원저자: Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 이야기를 쓰거나, 수학 문제를 풀거나, 새로운 약을 발견하는 법을 가르치고 있다고 상상해 보세요. 예전 방식(이를 "강화 학습"이라고 부릅니다)에서는 로봇에게 단 하나의 엄격한 규칙 책을 주었습니다: "가장 높은 점수를 받는 행동을 정확히 수행하라."

문제는 무엇일까요? 로봇은 빠르게 지루하고 단조로운 '한 가지 기술만 가진 달인'이 되어버린다는 것입니다. 로봇은 단 하나의 완벽한 답을 찾아내어 매번 그것만 반복하며, 다른 모든 좋은 가능성들을 무시하게 됩니다. 만약 당신이 준 규칙 책이 조금이라도 틀렸다면(인간이 로봇을 판단할 때 흔히 일어나는 일입니다), 로봇은 그 작은 실수를 과하게 학습하여 끔찍한 행동을 하기 시작할 수 있습니다.

이 논문은 로봇을 가르치는 더 똑똑한 방법을 제안합니다. 로봇에게 단 하나의 규칙 책을 주는 대신, 서로 조금씩 다른 여러 개의 규칙 책이 담긴 상자를 주는 것입니다. 그리고 당신은 로봇에게 이렇게 말합니다: "나는 어떤 규칙 책이 '진짜'인지 100% 확신할 수 없으니, 제발 이 모든 규칙 책에 대해 모두 능숙해지도록 학습해라."

다음은 이 논문의 새로운 방법인 ROSA(Randomized Objectives, Set Actions)가 일상적인 비유를 통해 어떻게 작동하는지에 대한 설명입니다.

1. "규칙 책 상자" (보상의 불확실성)

현실 세계에서 우리는 종종 우리가 정확히 무엇을 원하는지 알지 못합니다.

  • 예전 방식: 당신은 요리사에게 "완벽한 스테이크를 만들어라"라고 말합니다. 요리사는 특정한 스테이크 하나를 만들어 영원히 그것만을 내놓습니다. 만약 당신이 실제로 레어 스테이크를 원했지만 "완벽한 것"이라고 말했다면, 요리사는 꼼짝도 할 수 없습니다.
  • 새로운 방식 (ROSA): 당신은 요리사에게 이렇게 말합니다. "여기 10명의 심사위원이 있다. 심사위원 A는 레어를 좋아하고, B는 미디엄을, C는 웰던을 좋아한다. 오늘 어떤 심사위원이 맞을지 나는 모른다. 그러니 이들 중 어떤 심사위원이 오더라도 만족시킬 수 있는 스테이크를 만드는 법을 배워라."

로봇은 "진짜" 규칙이 무엇인지 모르기 때문에, 선택지를 열어두고 다양한 스타일 사이를 전환할 준비를 하는 것이 가장 현명한 전략임을 배웁니다. 이는 단순히 무작위성을 강요하는 것이 아니라, 자연스럽게 다양성을 만들어냅니다.

2. "최선의 다수 선택" 기법 (집합 행동)

로봇은 이 규칙 책 상자를 어떻게 다루는 법을 배울까요?

  • 예전 방식: 로봇은 하나의 행동을 시도하고, 점수를 얻고, 업데이트합니다. 만약 점수가 낮으면 로봇은 패닉에 빠집니다.
  • 새로운 방식 (ROSA): 로봇이 시험을 치르고 있다고 상상해 보세요. 질문 하나에 답하고 결과가 좋기를 바라는 대신, 로봇은 동시에 다섯 가지의 서로 다른 답을 적습니다.
    • 그런 다음, 상자 안에 있는 모든 가능한 "규칙 책"(심사위원)에 대하여, 로봇은 자신의 다섯 가지 답 중에서 그 특정 심사위원을 위해 가장 좋은 것 하나를 고릅니다.
    • 로봇은 그 "최선의 선택"을 바탕으로 점수를 받습니다.
    • 마지막으로, 이 점수들을 모든 심사위원에 걸쳐 평균 냅니다.

이는 다음과 같이 말하는 것과 같습니다: "모든 것에 완벽할 필요는 없다. 다만 어떤 심사위원이 나타나더라도, 그를 감동시킬 수 있는 답 하나를 내 주머니 속에 넣어두기만 하면 된다."

3. 왜 이것이 "엔트로피"보다 나은가

과학자들은 이전에 "혼란 보너스"(엔트로피 정규화라고 불림)를 추가하여 로봇에게 다양성을 강제하려고 시도했습니다.

  • 비유: 이것은 학생에게 "네 답이 무질서하고 예측 불가능할수록 추가 점수를 주겠다"라고 말하는 것과 같습니다. 그러면 학생은 보너스를 받기 위해 정답이 틀리더라도 횡설수설하기 시작할 수 있습니다.
  • ROSA의 장점: ROSA는 무질서를 요구하지 않습니다. 대신 준비성을 요구합니다. 로봇이 다양성을 유지하는 이유는 무작위로 행동하기 위해서가 아니라, 다양한 심사위원을 맞이할 준비를 해야 하기 때문입니다. 로봇은 점수를 얻는 것을 포기하지 않습니다. 오히려 불확실성을 다루는 능력이 더 좋아집니다.

4. 이 논문이 증명한 것

저자들은 이 아이디어를 여러 테스트를 통해 검증했습니다.

  • 상충하는 심사위원들: 두 심사위원이 서로 반대되는 것을 원할 때(예: "답을 짝수로 만들어라" vs "답을 홀수로 만들어라"), 기존 방식은 명령이 서로 상쇄되어 완전히 실패했습니다. ROSA는 맥락에 따라 짝수와 홀수 사이를 전환하며 둘 다 수행하는 법을 배웠습니다.
  • 다수의 정답: 수학 문제에는 문제를 푸는 여러 가지 방법이 있습니다(짧고 간결하게, 혹은 길고 상세하게). 기존 방식은 한 가지 스타일을 골라 그것만 고수했습니다. ROSA는 모든 유효한 스타일을 생성하는 법을 배워 사용자에게 더 많은 선택지를 제공했습니다.
  • 노이즈가 섞인 심사위원: 심사위원이 혼란스러워하거나 실수를 할 때(현실 세계의 불확실성을 시뮬레이션함), ROSA는 혼란에 빠지지 않았습니다. 기존 방식들이 나쁜 습관에 갇히는 동안, ROSA는 건강한 답변의 다양성을 유지했습니다.

결론

이 논문은 다양성은 버그가 아니라, 확신이 없을 때 똑똑해지기 위한 핵심 기능이라고 주장합니다.

보상을 단 하나의 숫자가 아니라 가능성의 분포로 취급하고, 로봇이 한 번에 잠재적 답변의 집합을 살펴보도록 훈련함으로써, 우리는 다음과 같은 시스템을 얻게 됩니다:

  1. 강건함(Robust): 규칙이 약간 틀리더라도 망가지지 않습니다.
  2. 다양성(Diverse): 자연스럽게 다양한 양질의 솔루션을 제공합니다.
  3. 효율성(Efficient): 단순히 무작위로 행동하려 시간을 낭비하지 않고, 미래가 불확실할 때 그것이 합리적인 행동이기 때문에 다양성을 유지합니다.

요약하자면: 하나의 답만을 아는 전문가를 훈련시키는 대신, ROSA는 어떤 상황에도 대비할 수 있는 제너럴리스트(Generalist)를 훈련시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →