Privileged observations enable rapid and reliable policy discovery directly in the physical world
이 논문은 카오스적인 물리 시스템에 대한 특권적 관측(privileged observations)이 강화 학습 에이전트가 실제 세계에서 직접 고성능 정책을 빠르게 발견할 수 있게 하는 데 결정적임을 입증하며, 그러한 유동 데이터를 결여한 에이전트들은 항력을 줄이는 전략은 성공적으로 학습했음에도 불구하고 항력을 증가시키는 전략은 학습하는 데 실패했다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
물속을 헤엄치는 수영객을 상상해 보십시오. 만약 그들이 자신 주변에서 소용돌이치는 조류를 볼 수 있다면, 저항을 가로지르는 방식으로 몸을 틀거나, 혹은 자신을 앞으로 밀어내기 위해 물을 붙잡는 방식으로 몸을 움직이는 법을 배울 수도 있을 것입니다. 이것이 바로 능동적 유동 제어(active flow control)의 본질입니다. 이는 엔지니어들이 물체의 이동을 개선하거나 정지 상태를 유지하기 위해, 보이지 않는 혼돈스러운 유체의 움직임을 조작하려고 노력하는 분야입니다. 수십 년 동안 과학자들은 흐름 속에서 실린더를 회전시키는 것이 물이 물체에 가하는 압력에 변화를 줄 수 있다는 사실을 알고 있었습니다. 때로는 일정한 회전이 항력을 줄여 물체가 더 쉽게 미끄러져 나가게 합니다. 반대로, 어떤 경우에는 특정한 리듬의 회전이 실제로 항력을 높여 물체를 뒤로 잡아두기도 합니다. 문제는 특히 물의 흐름이 예측하기 어렵고 무질서하기 때문에, 최선의 결과를 얻기 위해 그 회전의 정확한 타이밍과 속도를 찾아내는 일이었습니다.
보통 엔지니어들이 컴퓨터에게 이러한 시스템을 제어하는 법을 가르치고자 할 때, 그들은 물의 가상 모델을 구축하고 컴퓨터가 그 안에서 연습하게 합니다. 하지만 가상 모델은 결코 완벽할 수 없습니다. 실제 물이 가진 작고 무질서한 세부 사항들을 놓치기 때문입니다. 그래서 ETH 취리히의 연구진은 시뮬레이션을 완전히 건너뛰기로 했습니다. 그들은 물리적인 수로를 구축하고, 컴퓨터 에이전트가 실제의 요동치는 물로부터 직접 학습하도록 만들었습니다. 그들이 던진 질문은 단순하지만 심오했습니다. 물을 제어하는 최선의 방법을 배우기 위해서, 컴퓨터는 학습하는 동안 물이 물체 주변에서 소용돌이치는 모습을 반드시 보아야 하는가? 아니면 단지 물체가 받는 밀고 당기는 힘만을 느껴서도 그것을 알아낼 수 있는가?
연구진은 물이 루프를 그리며 순환하는 투명한 탱크인 탁상형 수로를 설치했습니다. 그 안에는 유동 속에 놓인 실린더가 있으며, 모터는 실린더를 어떤 속도나 방향으로든 회전시킬 수 있습니다. 실린더에 물이 얼마나 강하게 밀어붙이는지를 측정하기 위해, 그들은 민감한 토크 센서를 사용했습니다. 물을 관찰하기 위해 그들은 입자 영상 유속계(particle image velocimetry)라고 불리는 기술을 사용했습니다. 이는 미세한 입자가 포함된 물에 레이저 시트를 투사하고 빠르게 사진을 찍는 방식입니다. 사진 사이에서 이 입자들이 어떻게 움직이는지 추적함으로써, 컴퓨터는 실린더 바로 뒤편의 물의 속도와 방향에 대한 상세하고 실시간적인 지도를 구축할 수 있습니다. 이 지도는 '특권적 관측(privileged observation)'이며, 즉 학습 중에는 컴퓨터가 볼 수 있지만 나중에는 굳이 필요하지 않을 수도 있는 추가 정보입니다.
그들은 실린더를 제어하기 위해 범용 학습 에이전트(인공지능의 일종)를 훈련시켰습니다. 한 실험 세트에서 에이전트는 항력의 느낌과 물의 상세한 지도를 모두 제공받았습니다. 또 다른 실험 세트에서는 물의 지도를 숨긴 채 항력의 느낌만을 제공받았습니다. 목표는 두 가지였습니다. 첫째, 항력을 최대한 줄일 수 있는 회전 방식을 찾는 것, 둘 second, 항력을 최대한 높일 수 있는 회전 방식을 찾는 것이었습니다.
결과는 놀라웠으며 예상치 못한 비대칭성을 드러냈습니다. 에이전트가 물의 상세한 지도를 가졌을 때, 학습 속도는 믿기 힘들 정도로 빨랐습니다. 실제 물과 상호작용한 지 불과 몇 분 만에, 에이전트는 항력을 약 32% 감소시키는 전략을 발견했습니다. 또한 항력을 약 25% 증가시키는 전략도 빠르게 찾아냈습니다. 이 수치들은 수십 년간의 연구를 통해 개발된 기존의 가장 뛰어난 인간 설계 전략들과 일치하거나 오히려 이를 약간 상회하는 수준이었습니다.
그러나 연구진이 물의 지도를 숨기고 오직 항력 측정값만을 사용하여 학습하도록 강제했을 때, 이야기는 완전히 달라졌습니다. 에이절트는 항력을 줄이는 방법은 여전히 배울 수 있었으며, 결국 약 31%의 감소를 달-성했습니다. 다만 시간이 조금 더 걸렸고 변동성이 컸습니다. 하지만 항력을 높이는 것이 목표가 되었을 때, 에이전트는 실패했습니다. 물의 흐로를 보지 못하면, 아무도 항력을 유의미하게 높이는 전략을 학습하지 못했습니다. 최선의 전략이 존재하고 물리적으로도 가능한 상태였음에도 불구하고, 에이전트는 물이 더 강하게 밀어붙이도록 만드는 방법을 알아내지 못했습니다.
왜 이런 일이 발생했는지 이해하기 위해, 연구진은 물이 어떻게 움직이는지 면밀히 살펴보았습니다. 그들은 실린더가 회전을 시작할 때마다, 목표가 항력을 높이든 줄이든 상관없이 물이 일단 실린더를 덜 밀어내는 반응을 보인다는 것을 발견했습니다. 이 초기 항력 감소는 자연스러운 물리적 반응입니다. 항력을 줄이려는 에이전트에게 이 초기 감소는 자신이 올바른 방향으로 가고 있다는 도움이 되는 신호였습니다. 하지만 항력을 높이려는 에이전트에게 이 초기 감소는 혼란스러웠습니다. 그것은 자신이 달성하고자 하는 목표와 정반대의 느낌이었기 때문입니다. 물의 전체적인 그림을 파악하여 항력이 결국 상승할 것이라는 점을 이해할 수 있게 해주는 상세한 지도가 없었기에, 에이전트는 이 초기 하락 구간에 갇혀버려 올바른 전략을 배우지 못했습니다.
이어 연구진은 물의 지도를 가지고 학습한 전략을 지도 없이 사용할 수 있는지 테스트했습니다. 그들은 물의 지도를 가졌을 때 에이전트가 사용했던 정확한 회전 패턴을 기록한 뒤, 새로운 관찰 없이 그 패턴들을 고정된 순서로 다시 재생했습니다. 놀랍게도, 이 고정된 시퀀스들은 실시간으로 생각하는 에이전트만큼이나 잘 작동했습니다. 에이전트는 매우 효과적으로 작동하는 특정 움직임 세트를 학습했으며, 이를 실행하는 데는 계속해서 물을 관찰할 필요가 없었던 것입니다. 이는 물의 지도가 과업을 '수행'하는 데는 필요하지 않았지만, 과업을 '발견'하는 데는 절대적으로 필요했다는 것을 증명합니다.
이 발견은 학습에 있어 중요한 구분을 강조합니다. 해결책을 '찾는 데' 필요한 것과 그것을 '사용하는 데' 필요한 것은 종종 다릅니다. 이 경우, 물의 흐름에 대한 풍부하고 상세한 시야는 에이전트를 안내하며 유체의 혼란스러운 초기 반응을 헤쳐나가도록 돕는 스승 역할을 했습니다. 일단 에이전트가 올바른 길을 찾으면, 눈을 가리고도 그 길을 걸을 수 있었습니다. 이 연구는 복잡한 물리적 시스템에서 학습 단계 동안 추가적인 정보에 접근하는 것이, 비록 그 정보가 실제로 시스템이 작동할 때는 가용하지 않더라도 성공과 실패를 가르는 결정적인 요인이 될 수 있음을 시사합니다. 인공지능이 무질서하고 혼돈스러운 현실 세계를 마스터하기 위해서는, 실제로 사용하게 될 것보다 더 많은 것을 볼 수 있도록 허용되어야 할지도 모른다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.