← 최신 논문
🤖 machine learning

Learning to Control Coupled-Dynamics Environments with Joint Markov Decision Processes

이 논문은 비매개변수적 분포 벨만 최적성 연산자를 정의하고 이것이 최적 결합 수익 법칙으로 수렴함을 증명함으로써, 표준 MDP가 버리는 반사실적 결과 간의 의존성을 보존하는 결합 마르코프 결정 과정(JMDP)을 위한 최적 제어 방법을 소개한다.

원저자: Ege C. Kaya, Aliasghar Pourghani, Mahsa Ghasemi, Vijay Gupta, Abolfazl Hashemi

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ege C. Kaya, Aliasghar Pourghani, Mahsa Ghasemi, Vijay Gupta, Abolfazl Hashemi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 에이전트는 마치 아이가 방 안을 돌아다니는 법을 배우는 것처럼 환경과 상호작용하며 의사결정을 내리는 법을 배운다. 수십 년 동안, 이러한 학습을 위한 표준적인 수학적 프레임워크는 마르코프 결정 과정(Markov decision process)이었다. 이 모델에서 에이전트는 특정 행동을 시도하고, 발생하는 단 하나의 결과를 관찰하며, 그 경험을 사용하여 성능을 개선한다. 이 방식은 단순히 시간이 지남에 따라 평균 보상을 극대화하는 것이 목표일 때 잘 작동한다. 그러나 이 표준적인 관점은 모든 가능한 행동을 마치 별개의, 고립된 우주에 존재하는 것처럼 취급한다. 이는 만약 에이전트가 다른 경로를 선택했더라도, 그 결과는 완전히 독립적인 주사위 던지기에 의해 생성되었을 것이라고 가정한다. 많은 현실 세계의 상황에서 이러한 가정은 너무 단순하다. 종종 서로 다른 선택들의 잠재적 결과는 공유된 근본적인 현실에 의해 연결되어 있다. 예를 들어, 갑작스러운 돌풍은 조종사가 어느 방향으로 비행하려고 의도했는지와 상관없이 드론의 궤적에 영향을 미칠 수 있다. 이러한 결과들이 공통된 원인에 의해 서로 묶여 있을 때, 표준 모델은 그 가능성들이 서로 어떻게 연관되어 있는지에 대한 중요한 정보를 버리게 된다.

퍼듀 대학교의 연구진은 이러한 연결된 시나리오를 다루기 위한 새로운 방법을 개발하여, 고립된 선택이라는 개념을 넘어 모든 행동의 잠재적 미래를 함께 계산하는 프레임워크로 나아갔다. 그들은 이를 결합 마르코프 결정 과정(Joint Markov decision process)이라 부른다. 그들의 방법은 "왼쪽으로 돌면 어떻게 될까?"라고 묻고 나서, 마치 질문 사이에 세상이 초기화되는 것처럼 별도로 "오른쪽으로 돌면 어떻게 될까?"라고 묻는 대신, "내가 왼쪽으로 돌고 북풍이 불면 어떻게 될까? 그리고 똑같이 북풍이 부는 상황에서 내가 오른쪽으로 돌면 그때는 어떻게 될까?"라고 묻는다. 이들은 이러한 반사실적 결과들—다른 선택이 이루어졌더라면 일어났을 일들—을 동일한 무작위성의 순간에 연결함으로써, 서로 다른 행동들이 어떻게 서로에게 영향을 미치는지 파악할 수 있다. 이는 안전이 중요한 작업이나 자원 배분과 같이, 옵션들의 관계를 이해하는 것이 단일 옵션의 가치를 아는 것만큼이나 중요한 상황에서 매우 중요하다.

연구팀의 작업은 에이전트가 이러한 복잡하고 연결된 환경에서 최선의 전략을 찾는 법을 가르치는 데 집중되어 있다. 그들은 만약 매 단계마다 명확하게 우월한 행동이 하나 존재한다면, 에이전트의 학습 과정이 결국 완벽한 전략에 안착할 것이며, 모든 가능한 미래 보상에 대한 수학적 묘사가 정답으로 수렴할 것임을 증명했다. 또한 그들은 두 행동이 평균적으로는 똑같이 좋아 보일 때라도, 그 관계가 특정 방식으로 안정화되기만 한다면 에이전트가 그들 사이의 올바른 관계를 여전히 학습할 수 있음을 보여주었다. 이를 통해 시스템은 평균 보상뿐만 아니라, 서로 다른 행동에 대한 보상이 어떻게 함께 움직이는지도 계산할 수 있다. 예를 들어, 한 행동에 대한 높은 보상이 다른 행동에 대한 낮은 보상을 동반하는 경향이 있는지, 혹은 그들이 함께 오르고 내리는 경향이 있는지를 결정할 수 있다.

이러한 아이디어를 테스트하기 위해, 연구진은 단순한 상태 체인부터 복잡한 그리드 월드, 그리고 균형 잡는 막대를 포함한 연속 제어 작업에 이르기까지 다양한 환경에서 시뮬레이션을 실행했다. 한 실험에서 그들은 운전자가 안전한 경로와 두 개의 위험한 경로 중 하나를 선택할 수 있는 경로 선택 문제를 조사했다. 이 위험한 경로들은 공유된 날씨 조건에 의해 연결되어 있었다: 만약 바람이 한 경로에 유리했다면, 다른 경로에는 불리한 경우가 많았다. 이 새로운 방법을 사용함으로써, 에이전트는 두 위험한 경로 사이로 교통량을 분산시키는 법을 배웠다. 이 경로들이 부정적으로 연결되어 있었기 때문에, 이 분산 전략은 완전한 실패의 가능성을 제거했는데, 이는 경로 간의 연결을 무시하는 표준적인 방법으로는 달성할 수 없었던 결과였다. 또 다른 테스트에서는 신경망을 훈련시켜 데이터로부터 이러한 관계를 학습하게 했다. 신경망은 숨겨진 행동 간의 연결성을 성공적으로 복구해 냈으며, 이는 결합된 정보가 단지 이론적인 개념이 아니라 현대 머신러닝 시스템이 학습하고 사용할 수 있는 것임을 입증했다.

이러한 발견은 서로 다른 가능성들이 어떻게 연결되어 있는지에 대한 구조를 보존함으로써, 인공지능이 더 견고하고 미묘한 의사결정을 내릴 수 있음을 시사한다. 연구진은 자신들의 수학적 도구가 단순하고 복잡한 시나리오 모두에서 정답으로 신뢰성 있게 수렴함을 입증했다. 그들은 표준적인 방법들이 선택지들 사이의 미묘한 상호작용을 놓칠 수 있는 반면, 자신들의 접근 방식은 동일한 조건 하에서 서로 다른 행동에 대해 세상이 어떻게 반응하는지에 대한 전체 그림을 포착한다는 것을 보여주었다. 이는 단순히 에이전트가 얻을 수 있는 평균 점수를 높이는 것에 그치지 않고, 에이전트가 위험과 보상의 지형을 이해하는 방식을 근본적으로 변화시켜, 서로 다른 선택의 운명이 불가분하게 묶여 있는 환경을 항해할 수 있게 한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →