← 최신 논문
🤖 machine learning

A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs

본 논문은 비정상적 준-마르코프 결정 과정에서 올바른 평균 보상률을 계산하기 위한 새로운 수정 조화 평균 연산자를 도입하여, 기존 비율 기반 접근법의 한계를 극복하는 견고한 모델 없는 강화 학습 알고리즘을 가능하게 합니다.

원저자: Erel Shtossel, Alicia Vidler, Uri Shaham, Gal A. Kaminka

게시일 2026-05-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Erel Shtossel, Alicia Vidler, Uri Shaham, Gal A. Kaminka

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 문서는 간단한 언어와 일상적인 비유를 사용하여 해당 논문을 설명합니다.

전체적인 그림: "속도계" 문제

배달 기사가 가장 빠른 경로를 찾아내려 한다고 상상해 보세요. 두 가지 옵션이 있습니다.

  • 경로 A: 10 분에 10 마일을 운전합니다.
  • 경로 B: 20 분에 20 마일을 운전합니다.

두 경로 모두 마일당 소요 시간이 동일해 보입니다 (마일당 1 분). 하지만 교통 상황이 변한다면 어떨까요? 경로 A 는 월요일에는 빠르지만 화요일에는 2 시간 동안 정체에 걸리는 반면, 경로 B 는 일정하게 유지된다면요?

인공지능 (AI), 특히 강화 학습 (Reinforcement Learning) 세계에서는 에이전트 (로봇이나 거래 봇 등) 가 길고 끝없는 여정 동안 가장 좋은 "평균 속도" (보상률) 를 학습해야 합니다. 이 논문은 여정이 예측 불가능할 때, AI 가 이 평균 속도를 계산하는 데 사용하는 현재 도구들은 결함이 있다고 주장합니다.

구식 방법: "평균의 평균" 실수

이 논문은 최상의 평균 속도를 계산하려는 두 가지 기존 방법 ( SMARTRelaxed-SMART ) 을 살펴봅니다.

  • 결함: 이러한 방법들은 이동한 총 거리소요된 총 시간으로 나누어 평균 속도를 계산합니다.
    • 비유: 10 시간 동안 100 마일을 운전했다고 가정해 봅시다. 그들은 "좋습니다, 당신의 평균 속도는 시속 10 마일입니다"라고 말합니다.
    • 문제점: 속도가 일정하다면 이 방식은 잘 작동합니다. 하지만 속도가 극적으로 변한다면 (때로는 몇 시간 동안 교통 체증에 걸렸다가, 때로는 고속도로를 질주한다면), 단순히 총 거리를 총 시간으로 나누는 것은 오해의 소지가 있는 숫자를 만들어냅니다. 이는 10 분짜리 여정과 10 시간짜리 여정을 단순히 "두 번의 여정"으로만 취급할 뿐, 보상의 시기가 중요하다는 사실을 간과합니다.

저자들은 보상 (벌어들인 돈) 과 시간 (행동 소요 시간) 이 연관되어 있을 때 (예: 긴 시간 기다릴 때만 큰 보상을 받는 경우) 구식 방법들이 수학을 잘못 계산한다고 보여줍니다. 그들은 두 가지가 사과와 오렌지를 섞는 것처럼 무관하다고 가정하지만, 실제로는 종종 서로 밀접하게 연결되어 있습니다.

새로운 해결책: "조화 평균"

저자들은 조화 평균 (Harmonic Mean) 이라는 수학적 도구를 사용하여 평균을 계산하는 새로운 방법을 제안합니다.

  • 비유: 목적지로 갔다가 돌아오는 운전 상황을 생각해 보세요.
    • 가는 길은 시속 20 마일로 운전합니다.
    • 오는 길은 시속 40 마일로 운전합니다.
    • 틀린 수학 (산술 평균): (20+40)/2=30(20 + 40) / 2 = 30 마일/시간.
    • 올바른 수학 (조화 평균): 느린 속도 (시속 20 마일) 로 더 많은 시간을 보냈기 때문에, 전체 여정의 실제 평균 속도는 40 보다 20 에 더 가깝습니다. 정답은 대략 시속 26.7 마일입니다.

조화 평균은 속도나 분당 수익과 같은 비율을 평균내는 올바른 방법입니다. 하지만 함정이 하나 있습니다: 영 (zero) 속도가 있으면 (0 으로 나눌 수 없음) 나 음수 (negative) 속도가 있으면 (거꾸로 운전) 표준 조화 평균은 작동하지 않습니다. 현실에서 AI 에이전트는 종종 보상이 0 이거나 돈을 잃는 (음수 보상) 경우가 있습니다.

혁신: "수정된 조화 평균"

깨진 수학을 고치기 위해 저자들은 수정된 조화 평균 (Modified Harmonic Mean) 을 발명했습니다.

  • 작동 방식: 여정을 세 가지 더미로 분리하는 똑똑한 계산기를 상상해 보세요.
    1. 양수 여정 (돈을 벌었습니다).
    2. 음수 여정 (돈을 잃었습니다).
    3. 영 (zero) 여정 (손익분기점에 도달했습니다).
  • 이는 양수 여정과 음수 여정에 대해 각각 "조화 평균"을 계산한 후, "영" 여정을 중립적으로 취급하며 이를 혼합합니다.
  • 결과: 이 새로운 계산기는 때로는 돈을 잃고, 때로는 돈을 벌며, 때로는 아무것도 하지 않고 기다리는 등 messy 한 실제 세계 데이터를 처리할 수 있습니다. 환경이 혼란스러울 때에도 보상의 진정한 "속도"를 정확하게 파악합니다.

새로운 알고리즘: "조화 R-학습 (Harmonic R-Learning)"

이 새로운 수학을 사용하여 저자들은 조화 R-학습 (Harmonic R-Learning) 이라는 새로운 AI 학습 알고리즘을 만들었습니다.

  • 기능: 주식 상승을 기다리는 것과 즉시 매도하는 것과 같이 행동에 서로 다른 시간이 소요되는 상황에서 의사결정을 하는 방법을 학습합니다.
  • 더 나은 이유: "보상"과 "시간"이 연관되어 있을 때 혼란을 겪지 않습니다. 행동의 진정한 가치를 파악하는 반면, 구식 알고리즘들은 총 보상이 높다는 이유만으로 느리고 위험한 행동을 훌륭한 것으로 착각할 수 있습니다.

증명: 두 가지 테스트

저자들은 두 가지 시나리오에서 새로운 알고리즘을 기존 알고리즘과 비교하여 테스트했습니다.

  1. "가짜" 교통 테스트: 처음에는 좋아 보이지만 실제로는 함정인 경로와, 처음에는 느려 보이지만 장기적으로는 승자인 경로를 가진 간단한 컴퓨터 시뮬레이션을 만들었습니다.

    • 결과: 구식 알고리즘들은 혼란을 겪고 잘못된 경로를 선택했습니다. 새로운 조화 R-학습은 그 속임수를 간파하고 올바른 경로를 선택했습니다.
  2. 비트코인 거래 테스트: 비트코인 거래의 실제 데이터를 사용했습니다. 비트코인은 매우 격렬하여 가격이 급등락하며, 때로는 포지션을 오랫동안 보유하다가 때로는 몇 초 만에 거래합니다.

    • 결과: 소요 시간과 벌어들인 돈이 연관되어 있을 때 (일반적인 현실 시나리오), 새로운 알고리즘이 구식 알고리즘보다 더 많은 수익을 냈습니다. 두 요소가 연관되지 않았을 때는 새로운 알고리즘이 구식 알고리즘만큼 잘 수행되어, 이를 사용하는 것이 해가 되지 않는다는 것을 입증했습니다.

요약

이 논문은 다음과 같이 말합니다: "AI 에서 평균 보상을 계산하는 구식 방식은 각 속도에 보낸 시간을 고려하지 않고 속도를 평균내는 것과 같습니다. 세상이 messy 할 때 실패합니다. 우리는 (영수와 음수를 포함한) messy 한 데이터를 처리하고 AI 에게 올바른 평균 속도를 제공하여 복잡하고 시간이 변하는 환경에서 더 나은 의사결정을 내릴 수 있도록 도와주는 새로운 '수정된 조화 평균' 계산기를 발명했습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →