Where Entropy Is Measured Matters: Policy Geometry in Bounded Continuous-Control PPO
이 논문은 유계 연속 제어(bounded continuous-control) PPO에서 엔트로피를 측정하는 위치(잠재 공간 대 실행된 행동 공간)의 선택이 뚜렷한 평균-분산 결합을 도입함으로써 학습된 정책의 기하학적 구조를 근본적으로 변화시키며, 이로 인해 행동이 경계 근처에 군집화되는 빈도에 유의미한 영향을 미치고 궁극적으로 작업 성능에 영향을 미친다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에는 기계가 물리적 세계와 어떻게 움직이고 상호작용하는지를 가르치는 데 전념하는 한 분야가 있습니다. 연속 제어(continuous control)라고 알려진 이 분야는 컴퓨터가 마치 어린아이가 균형을 잡는 법을 배우는 것처럼, 시행착오를 통해 걷거나 달리고 일어서는 법을 배우도록 요구합니다. 이를 위해 컴퓨터는 '정책(policy)'이라 불리는 수학적 가이드를 사용하여, 자신이 보는 것에 기반하여 다음에 어떤 행동을 취할지 제안합니다. 수십 년 동안 이 가이드의 표준 도구는 종 모양의 곡선, 즉 가장 가능성 높은 행동을 제시하면서도 약간의 무작위적인 변동을 허용하는 통계적 형태였습니다. 그러나 현실 세계에는 한계가 있습니다. 로봇의 다리는 특정 지점 이상으로 뒤로 꺾일 수 없으며, 근육은 무한한 힘으로 수축할 수 없습니다. 컴퓨터의 매끄럽고 경계가 없는 제안이 이러한 단단한 벽에 부딪힐 때, 그 제안들은 잘려 나가거나 형태를 맞추기 위해 찌그러지게 됩니다. 오랫동안 연구자들은 로봇이 성능을 잘 발휘한다면, 그 한계를 어떻게 처리하는지에 대한 세부 사항은 중요하지 않다고 가정해 왔습니다. 그들은 오직 최종 점수에만 관심을 두었습니다. 로봇이 빠르게 걷는가? 로봇이 똑바로 서 있는가?
새로운 연구는 컴퓨터가 80개의 근육을 가진 시뮬레이션된 다리로 걷는 법을 배울 때 컴퓨터의 마음속에서 어떤 일이 일어나는지를 면밀히 조사함으로써 이 가정을 반박합니다. 연구진은 로봇이 자신의 불확실성을 측정하는 방식이 학습하는 경로의 형태를 변화시킨다는 것을 발견했습니다. 그들은 컴퓨터가 물리적 한계를 무시하는 방식으로 불확실성을 허용할 때, 허용된 범위의 벽 바로 앞까지 자신의 행동을 밀어붙이는 법을 배운다는 것을 발견했습니다. 이는 마치 로봇이 가운데에 편하게 서 있을 수 있음에도 불구하고 끊임없이 상자의 가장자리에 손을 대고 있는 것과 같습니다. 이러한 행동은 로봇의 근육이 느리거나 한계가 너무 타이트해서 발생하는 것이 아닙니다. 대신, 이것은 학습 알고리즘이 자신의 '호기심' 또는 무작위성을 계산하는 방식에서 비롯된 직접적인 결과입니다. 이 연구는 만약 컴퓨터의 내부적인, 경계가 없는 생각으로부터가 아니라 실제 로봇이 취하는 물리적인 행동으로부터 이 호기심을 측정하도록 변경한다면, 로봇이 완전히 다른 기하학적 구조를 학습하게 된다는 것을 보여줍니다. 로봇은 벽을 밀어내는 것을 멈추고, 유사하거나 심지어 더 나은 성능을 달성하면서도 범위의 중심에 편안하게 머무는 법을 배웁니다.
조사는 인간과 유사한 다리를 가진 복잡한 시뮬레이션에서 시작되었으며, 이 다리는 80개의 별개 근육을 갖추고 걷는 과제를 수행했습니다. 연구진은 이 다리를 움직이게 하기 위해 대중적인 학습 방법을 사용하여 인공지능을 훈련시켰습니다. 그들은 기이한 현상을 관찰했습니다. 컴퓨터는 성공적으로 걷는 법을 배우고 있었지만, 근육이 할 수 있는 최대 또는 최소치의 거의 끝단에 해당하는 명령을 거의 항상 보내고 있었습니다. 약 89%의 시간 동안 근육 명령은 최대 또는 최소 한계치의 5% 이내에 있었습니다. 마치 보행자가 자신의 구속에 끊임없이 저항하고 있는 것 같았습니다. 연구팀은 처음에 이것이 물리적인 문제, 즉 근육이 자연스럽게 활성화되고 비활성화되는 방식이나 시뮬레이션이 신호를 필터링하는 특정 방식 때문일 것이라고 의심했습니다. 그들은 근육의 활성화 시간을 대칭적으로 만들고 필터를 제거함으로써 시뮬레이션의 물리학을 변경하여 이 아이디어들을 테스트했습니다. 이러한 변화 중 어느 것도 문제를 해결하지 못했습니다. 로봇은 여전히 벽을 밀어냈습니다. 이는 물리적 세계가 원인이 아님을 입증했으며, 학습 알고리즘 자체를 지목했습니다.
로봇이 왜 이렇게 행동하는지 이해하기 위해, 연구진은 문제를 두 부분, 즉 로봇이 가고자 하는 평균적인 방향과 그 방향에 더해지는 무작위성 또는 변동성으로 나누었습니다. 그들은 간단한 질문을 던졌습니다. 로봇이 벽 근처에 있는 이유는 무모하게 추측하고 있기 때문인가, 아니면 의도적으로 벽을 향하고 있기 때문인가? 정확히 동일한 시점에 대해 반사실적 테스트(counterfactual test)를 실행한 결과, 무작위성을 모두 제거하고 로봇이 평균적인 계획을 완벽하게 따르도록 강제하더라도 여전히 벽 근처에 있고 싶어 한다는 것을 발견했습니다. 사실, 평균적인 계획 자체가 종종 가능한 동작 범위를 벗어나 가리키고 있었고, 이로 인해 컴퓨터는 행동을 가장 가까운 한계치로 절단(clip)해야 했습니다. 로봇의 '마음'은 외부로 돌출되어 의도된 행동을 경계 너머로 밀어냈고, 물리적 한계가 그것들을 붙잡고 있었던 것입니다. 이는 단순히 로봇에게 덜 무작위적이 되라고 말하는 것만으로는 문제를 해결할 수 없음을 의미했습니다. 로봇은 애초에 중심을 향하도록 배워야 했습니다.
이 문제를 해결하는 핵심은 컴퓨터가 자신의 불확실성을 측정하는 방식에 있었습니다. 표준 설정에서 컴퓨터는 물리적 행동으로 번역되기 전의 내부적이고 경계가 없는 생각들을 바탕으로 무작위성을 계산합니다. 이 내부 공간에서 수학은 중심과 가장자리를 동일하게 취급하며, 벽에서 떨어져 있어야 할 이유를 제공하지 않습니다. 그러나 연구진은 만약 컴퓨터가 행동이 물리적 세계로 번역된 후에 불확실성을 측정한다면 수학이 변할 것이라는 점을 깨달았습니다. 물리적 세계는 단단한 한계를 가지고 있기 때문에, 공간의 가장자리는 중심과는 다르게 보입니다. 컴퓨터가 이 물리적 공간에서 불확실성을 계산할 때, 수학은 자연스럽게 평균적인 행동을 벽에서 멀어지게 하고 중간으로 끌어당기는 힘을 만들어냅니다. 이것은 관점의 미묘한 변화입니다. 즉, 무작위성이 생성되는 곳이 아니라 그것이 중요한 곳에서 무작위성을 측정하는 것입니다.
이를 테스트하기 위해 연구진은 동일한 걷기 과제에 대해 세 가지 다른 버전의 학습 알고리즘을 실행했습니다. 첫 번째 버전에서 컴퓨터는 자신의 내부적인 생각 속에서 불확실성을 측정했습니다. 두 번째 버전에서는 불확실성을 전혀 측정하지 않았습니다. 세 번째 버전에서는 물리적 행동 속에서 불확실성을 측정했습니다. 결과는 놀라웠습니다. 내부적인 생각 속에서 불확실성을 측정한 버전은 매우 무작위하게 학습하여 행동을 벽 쪽으로 밀어붙였습니다. 불확실성을 측정하지 않은 버전은 매우 정밀하게 학습했지만 여전히 벽 근처를 목표로 삼았습니다. 오직 물리적 행동 속에서 불확실성을 측정한 버전만이 평균적인 행동을 허용 범위의 중심에 편안하게 유지하는 법을 배웠습니다. 이 버전은 가장 "내부적인" 기하학적 구조를 가졌으며, 이는 로봇이 자신의 한계에 저항하지 않고 있음을 의미했습니다.
연구팀은 완전히 다른 과제인 시뮬레이션된 개가 일어서는 법을 가르치는 실험을 반복했습니다. 이 과제는 38개의 서로 다른 관절을 포함하며, 첫 번째 시뮬레이션의 결과가 우연이 아님을 확인하기 위해 다른 소프트웨어 코드베이스를 사용했습니다. 동일한 패턴이 나타났습니다. 물리적 행동에서 불확실성을 측정한 버전은 움직임을 중심에 유지하는 법을 배웠지만, 다른 버전들은 가장자리로 치우쳤습니다. 이는 발견된 내용이 걷는 다리나 첫 번째 소프트웨어에 국한된 것이 아님을 확인해주었습니다. 연구진은 또한 컴퓨터에게 직접적인 페널티를 주어 중심을 향하도록 명령하는 것이 효과가 있는지 테스트했습니다. 그들은 직접적인 페널티가 로봇을 중심으로 밀어낼 수는 있지만, 무작위성과 전반적인 성능 측면에서 다른 종류의 행동을 만들어낸다는 것을 발견했습니다. 이는 물리적 공간에서 불확실성을 측정하는 것이 문제를 해결하는 하나의 효과적인 방법이지만 유일한 방법은 아니라는 것을 보여주었습니다. 이는 자연스럽게 로봇의 목표와 변동성을 결합하지만, 그 결과로 나타나는 무작위성과 성능의 균형은 동일한 목적을 달성하는 다른 방법들과 상당히 다를 수 있습니다.
연구는 로봇이 현실 세계에서 움직이는 법을 배울 때, 불확실성을 어디에서 측정할 것인가가 결정적인 설계 결정이라는 결론을 내립니다. 단순히 과제에서 높은 점수를 얻는 것만으로는 충분하지 않습니다. 로봇이 움직이는 방식을 배우는 과정은 그 안정성과 안전성에 매우 중요합니다. 만약 로봇이 끊임없이 자신의 한계에 부딪히며 배우게 된다면, 환경이 미세하게 변할 때 취약하거나 실패하기 쉽습니다. 물리적 공간에서 불확실성을 측정함으로써, 로봇은 자신을 안전하고 중심에 있게 만드는 기하학적 구조를 학습합니다. 이러한 통찰은 로봇을 가르치는 표준적인 방식이 업데이트되어야 할 수도 있음을 시사합니다. 학습 과정 중에 물리적 한계를 무시하는 대신, 알고리즘은 물리적 한계를 고려하여 로봇이 끊임없이 벽을 밀어내는 것이 아니라 자연스럽고 중심 잡힌 우아함으로 움직이도록 보장해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.