Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning
이 논문은 비누적 마르코프 결정 과정(NCMDP)을 표준 MDP로 변환하는 일반적인 매핑을 도입하여, 기존의 강화 학습 기법을 직접 적용해 임의의 보상 함수를 최적화할 수 있게 하고 다양한 작업 전반에서 향상된 성능과 훈련 효율성을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에는 기계가 어떻게 의사결정을 내리는지 가르치기 위해 사용되는 강력한 프레임워크가 있습니다. 로봇이 걷는 법을 배우거나, 컴퓨터 프로그램이 비디오 게임을 마스터하거나, 트레이딩 알고리즘이 주식 포트폴리오를 관리하는 모습을 상상해 보십시오. 이러한 시스템은 주변 환경에 대응하여 일련의 행동을 차례대로 수행하며 작동합니다. 매 움직임마다 시스템은 그 행동이 좋았는지 나빴는지를 알려주는 신호, 흔히 '보상(reward)'이라 불리는 것을 받습니다. 수십 년 동안 이러한 시나리오에서 성공을 위한 표준 규칙은 단순했습니다. 바로 시간이 흐름에 따라 수집된 모든 보상의 총합을 극대화하는 것입니다. 만약 로봇이 앞으로 한 걸음 내디딜 때마다 작은 점수를 받는다면, 목표는 여정의 끝까지 가능한 한 많은 점수를 얻는 것입니다. 마르코프 결정 과정(Markov decision process)으로 알려진 이 접근 방식은 산업용 로봇부터 자율주행 자동차에 이르기까지 모든 것을 안내하며 매우 성공적으로 활용되어 왔습니다.
하지만 현실 세계는 단순히 점수를 합산하는 표보다 훨씬 더 복잡할 때가 많습니다. 때로는 가장 중요한 결과가 발생한 모든 좋은 일의 총량이 아니라, 발생했던 최악의 순간이나 시간 경과에 따른 성과의 일관성일 수 있습니다. 우주선이 행성에 착륙하는 경우를 생각해 보십시오. 목표는 단순히 안전하게 착륙하는 것이 아니라, 비행이 얼마나 부드러웠는지와 상관없이 하강하는 동안 내내 위험한 속도를 초과하지 않도록 보장하는 것입니다. 금융 분야에서 투자자는 1년 동안 만든 총 이익보다는 그 이익이 얼마나 변동했는지에 더 관심을 가질 수 있으며, 위험한 도박보다는 꾸준한 수익을 추구할 수 있습니다. 이러한 시나리오는 연구자들이 '비누적 목적 함수(non-cumulative objectives)'라고 부르는 것을 포함하는데, 여기서 최종 점수는 최대값이나 평균 이익 대 변동성 비율과 같이 전체 보상의 이력에 대한 특정 함수에 달려 있습니다. 지금까지 인공지능에게 이러한 복잡하고 이력에 의존적인 목표를 최적화하도록 가르치는 것은 어려웠으며, 새로운 문제에 적용하기 까다로운 맞춤형 알고리즘을 필요로 하는 경우가 많았습니다.
막스 플랑크 광학 연구소(Max Planck Institute for the Science of Light)와 에를랑겐-뉘른베르크 대학교(Friedrich-Alexander-Universität Erlangen-Nürnberg)의 연구진은 이 문제에 대한 일반적인 해결책을 개발했습니다. 그들은 이러한 복잡한 비누적 과제들을 기존의 강력한 인공지능 도구들이 이미 해결할 수 있는 표준 형식으로 변환하는 방법을 발견했습니다. 새로운 유형의 학습 알고리즘을 처음부터 발명하는 대신, 그들은 다리를 놓았습니다. 그들은 기계가 현재 상황을 인식하는 방식과 즉각적인 피드백을 계산하는 방식을 약간 수정함으로써, 어떤 복잡한 목표라도 표준적인 '보상의 합' 문제로 변환될 수 있음을 보여주었습니다. 이를 통해 연구자들은 현재 사용 가능한 가장 진보된 기성 학습 소프트웨어를 가져와, 소프트웨어 자체를 수정할 필요 없이 이전에는 손이 닿지 않았던 문제들에 직접 적용할 수 있게 되었습니다.
그들의 방법의 핵심은 인공 에이전트에게 약간의 기억력을 부여하는 것입니다. 표준 설정에서 에이전트는 결정을 내리기 위해 현재의 상태만을 알면 됩니다. 하지만 목표가 보상의 전체 이력(예를 들어 지금까지 본 최고 속도)에 달려 있다면, 에이전트는 그 정보를 가지고 다녀야 합니다. 연구진은 에이전트의 '상태(state)'를 지금까지 관찰한 최고 또는 최저 보상과 같은 과거의 요약 정보를 포함하도록 확장하는 시스템을 제안했습니다. 동시에, 에이전트가 각 단계에서 받는 즉각적인 보상을 조정했습니다. 에리전트는 단순히 현재의 행동을 반영하는 보상을 받는 대신, 전체 여정 동안 합산되었을 때 복잡한 목표를 완벽하게 재구성할 수 있는 계산된 값을 받게 됩니다. 예를 들어, 목표가 최대 속도를 최소화하는 것이라면, 에리전트는 새로운 속도 기록을 세울 때만 벌칙을 받는 방식으로 보상을 받아, '최대값의 최소값' 문제를 표준적인 '합'의 문제로 바꿀 수 있습니다.
이 접근 방식은 다양한 어려운 과제들을 통해 그 범용성을 입증하며 테스트되었습니다. 달 착륙선 시뮬레이션에서 연구진은 우주선의 최대 속도를 엄격히 제한하면서 착륙하도록 에이전트를 훈련시켰습니다. 그들은 비행 끝에 벌칙을 더하는 방식으로 목표를 근사하려 했던 표준 방식과 이들의 방법을 비교했습니다. 최대 속도를 연속적인 학습 과정의 일부로 취급한 새로운 방법은 안전한 착륙과 효율적인 이동 사이에서 훨씬 더 나은 균형을 찾아냈습니다. 금융 영역에서는 평균 이익을 이익의 변동성으로 나눈 위험 조정 수익률 지표인 샤프 지수(Sharpe ratio)를 극대화하는 포트폴리오 최적화에 이 기술을 적용했습니다. 기존 방식들은 이 비율을 대략적으로 추정하는 데 의존해야 했습니다. 새로운 매핑을 사용함으로써, 에이전트들은 정확한 비율을 직접 학습하여 훈련 기간 동안 훨씬 더 나은 투자 전략을 학습할 수 있었습니다.
연구진은 또한 양자 논리 게이트의 가장 효율적인 배치를 찾거나 양자 컴퓨팅에 사용되는 복잡한 다이어그램을 단순화하는 것과 같은 이산 최적화 문제도 탐구했습니다. 이러한 과제에서 목표는 종 often 경로상의 모든 개선 사항의 합이 아니라, 긴 탐색 과정 중 도달한 단 하나의 최적 상태를 찾는 것입니다. 여기서 새로운 방법은 에이전트가 더 대담하게 탐색할 수 있도록 해주었습니다. 에이전트는 더 나은 솔루션에 도달하기 위해 필요한 일시적인 후퇴에 대해 벌칙을 받지 않았기 때문에, 표준적인 누적 보상을 사용하는 에이전트보다 더 빠르게 학습하고 더 높은 품질의 솔루션을 찾아냈습니다. 양자 오류 정정(quantum error correction)과 관련된 한 실험에서, 이 새로운 방법은 성능을 상당한 차이로 개선하며 더 짧은 시간 내에 더 나은 솔루션을 찾아냈습니다.
이 연구의 강점은 단순함과 일반성에 있습니다. 연구진은 새로운 학습 알고리즘을 만든 것이 아니라, 번역 계층(translation layer)을 만들었습니다. 이는 로보틱스에서 금융에 이르기까지 특정 분야의 전문가들이 자신의 문제를 가져와 이 매핑을 적용하기만 하면, 현재 사용 가능한 가장 강력한 강화 학습 도구들을 즉시 사용할 수 있음을 의미합니다. 이 방법은 예측 가능한 환경과 무작위 노이즈가 가득한 환경 모두에서 작동하며, 단순한 목표와 복잡한 목표를 모두 처리할 수 있습니다. 연구진은 에이전트에게 요구되는 확장된 메모리가 문제를 약간 더 크게 만들 수 있다고 언급했지만, 현대의 딥러닝 기술은 이를 처리하기에 충분한 역량을 갖추고 있습니다. 결과적으로, 이 연구는 복잡한 현실 세계의 목표와 정교한 인공지능 도구 사이의 장벽을 제거하는 통합된 프레임워크를 제공하며, 기계가 이전에는 정의하기 너무 어려웠던 전략들을 학습할 수 있는 문을 열어주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.