← 최신 논문
💻 computer science

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

이 논문은 새로운 학습 에이전트와 전용 안전 중심 합리적 에이전트를 통합함으로써, 사전 지도나 연결성 없이 미지의 환경에서 안전 필수적인 지상 로봇이 인지적으로 근거한 런타임 학습을 수행할 수 있도록 하는 완전 자율 온디바이스 프레임워크인 CogRun을 소개한다.

원저자: Yihao Cai, Yanbing Mao, Christian Lebiere

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yihao Cai, Yanbing Mao, Christian Lebiere

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 번도 본 적 없는 숲속에 투입된 로봇을 상상해 보십시오. 이 로봇은 쓰러진 나뭇가지, 숨겨진 구멍, 울퉁불퉁한 지면이 깔린 경로를 통과해야 하는 임무를 맡았습니다. 인공지능의 세계에서 이 시나리오는 근본적인 난관을 의미합니다. 오늘날 대부분의 로봇은 완벽하게 시뮬레이션된 세계나 통제된 실험실에서 훈련되어, 예측 가능하고 정적인 환경에서 움직이는 법을 배웁니다. 하지만 이러한 기계들이 야생의 숲이나 재난 지역처럼 혼란스럽고 변화무쌍한 현실에 배치되면 종종 어려움을 겪습니다. 그들이 미리 프로그래밍된 지식은 오히려 걸림돌이 되는데, 그 이유는 그들이 마주한 세상이 배웠던 세상과 일치하지 않기 때문입니다. 더욱이, 이 로봇들은 의사결정을 처리하기 위해 클라우드에 있는 강력한 컴퓨터와 지속적인 연결에 의존하는 경우가 많습니다. 멀고 험준한 지형에서는 그 연결이 자주 끊기며, 이로 인해 로봇은 고립되거나 실시간으로 적응하지 못하는 상태가 됩니다. 따라서 과제는, 인간의 개입 없이도 안전하게 작동하면서, 스스로 현장에서 즉각적으로 학습할 수 있는 기계를 만드는 것입니다.

연구진은 로봇이 미지의 물리적 공간을 실제로 이동하는 동안 안전하게 학습할 수 있도록 설계된 '코그런(CogRun)'이라는 새로운 시스템을 통해 이 과제를 해결했습니다. 핵심 아이디어는 로봇이 데이터를 서버로 보낼 필요 없이, 완전히 자체 탑재된 컴퓨터를 통해 현장에서 즉각적인 학습을 수행하도록 하는 것입니다. 이 접근 방식은 로봇이 새로운 장애물과 변화하는 조건에 직면한 순간 바로 적응할 수 있게 해줍니다. 이 시스템은 현실 세계에서의 학습은 위험하다는 이해를 바탕으로 구축되었습니다. 단순히 무엇이 효과적인지 알아보기 위해 새로운 시도를 하는 로봇은 넘어지거나 충돌할 수 있기 때문입니다. 이를 해결하기 위해 연구진은 로봇의 학습 과정이 별도의 비학습형 안전 시스템에 의해 끊임없이 모니터링되고 안내되는 프레임워크를 설계했습니다. 이를 통해 로봇이 더 잘 움직이는 방법을 배우는 동안에도, 넘어지거나 무언가와 충돌할 수 있는 위험한 발걸음을 내딛지 않도록 보장합니다.

이 프레임워크는 로봇의 두뇌를 함께 작동하는 세 가지 뚜렷한 부분으로 나누어 운영됩니다. 첫 번째 부분은 '학습 에이전트(Learning Agent)'로, 호기심 많은 탐험가 역할을 합니다. 이 에이전트는 다양한 움직임을 시도하고, 그 결과를 관찰하며, 경험한 내용을 바탕으로 성능을 개선하려고 노력합니다. 그러나 이 에이전트는 여전히 학습 중이기에 실수를 할 수 있습니다. 이러한 실수가 재앙이 되는 것을 방지하기 위해, 두 번째 부분인 '합리적 에이전트(Rational Agent)'가 엄격한 안전 파수꾼 역할을 합니다. 이 에이전트는 학습하지 않으며, 로봇이 똑바로 서 있고 충돌을 피할 수 있도록 확립된 검증된 규칙에 의존합니다. 만약 학습 에이전트가 위험해 보이는 움직임을 제안하면, 합리적 에이전트가 즉시 제어권을 가져와 안전한 기동을 실행합니다. 세 번째 구성 요소인 '코디네이터(Coordinator)'는 실시간으로 로봇의 상태를 관찰하고 어느 시점에 어떤 에이전트가 제어권을 가질지 결정합니다. 로봇이 안전하게 움직이고 있다면 코디네이터는 학습 에이전트가 운전하도록 허용합니다. 로봇이 위험한 상황에 진입하는 순간, 코디네이터는 제어권을 합리적 에이전트에게 넘겨 위험이 지나갈 때까지 통제하게 합니다.

이 시스템이 독특한 점은 경험의 기억을 처리하는 방식에 있습니다. 로봇이 학습할 때는 자신이 무엇을 했고 그 결과가 어떠했는지에 대한 방대한 양의 데이터를 생성합니다. 대부분의 시스템은 이 데이터를 단순한 목록으로 저장하고 무작별로 예시를 골라 학습합니다. 연구진은 변화하는 환경에서 오래되거나 관련 없는 데이터가 학습 과정을 혼란스럽게 만들 수 있다는 점에서 이 방식이 비효식적이라는 것을 발견했습니다. 대신, 코그run은 인간의 기억 작동 방식에서 영감을 얻은 방법을 사용합니다. 이 시스템은 과거의 경험이 현재 상황과 얼마나 유사한지, 얼마나 최근에 발생했는지, 그리고 유사한 상황이 얼마나 자주 발생했는지라는 세 가지 요소를 기준으로 기억의 우선순위를 정합니다. 이를 통해 로봇은 몇 시간 전의 전혀 다른 조건에서의 데이터에 시간을 낭비하는 대신, 젖은 잎 위에서 미끄러질 뻔했던 바로 그 순간과 같은 가장 관련성 높은 순간에 학습을 집중할 수 있습니다.

연구진은 이 시스템을 테스트하기 위해 사족 보행 로봇에 적용하여 실제 미지의 숲에 배치했습니다. 환경은 데드 존(dead zones), 깊은 함몰 지점, 그리고 추락을 숨길 수 있는 잎사귀로 덮인 구멍들로 가득했습니다. 로봇은 시작점에서 목표 지점까지 30미터를 이동하는 임무를 맡았습니다. 이 테스트에서 로봇은 사전 지도 없이 지형을 탐색하는 법을 배워야 했습니다. 결과는 이 시스템이 전체 학습 과정 동안 로봇을 성공적으로 안전하게 유지했음을 보여주었습니다. 표준적인 안전 시스템은 로봇이 넘어지는 것은 막을 수 있었지만, 너무 조심스러워 효율적으로 움직이지 못하는 경우가 많았습니다. 반면, CogRun 시스템은 불과 수십 번의 시도만으로 로봇이 매끄럽고 효율적인 경로를 학습하도록 해주었습니다. 로봇은 울퉁불퉁한 지형을 다루기 위해 보폭과 속도를 조절하는 법을 배웠으며, 결국 고정된 사전 프로그래밍 전략을 사용했을 때보다 훨씬 빠르게 목표에 도달했습니다.

또한 연구진은 이 접근 방식이 다른 유형의 기계에도 적용 가능한지 확인하기 위해 시뮬레이션된 숲 환경에서 오프로드 자율 주행 차량에 시스템을 테스트했습니다. 그들은 이 시스템을 안전을 다루려는 다른 고급 학습 방법들과 비교했습니다. 시뮬레이션에서 다른 시스템들은 자주 균형을 잃거나 장애물에 충돌하며 임무 완수에 실패했습니다. 대조적으로, CogRun 시스템은 대다수의 주행을 안전 위반 없이 완료했습니다. 로봇은 밀집된 나무와 바위가 많은 경로를 항해하며, 지형이 예상치 못하게 변할 때도 안정성을 유지했습니다. 연구진은 안전 기반의 행동과 학습 기반의 행동을 결합하는 능력이 핵심적이었다고 언급했습니다. 안전 파수꾼의 신중한 움직임과 학습 에이전트의 적응형 움직임을 정교하게 혼합함으로써, 로봇은 위험의 경계선을 넘지 않으면서도 새로운 해결책을 탐구할 수 있었습니다.

이 연구는 로봇이 클라우드 연결이나 환경에 대한 사전 지도 없이도 현실 세계에서 지속적으로 학습하는 것이 가능하다는 것을 입증합니다. 개선을 추구하는 학습 에이전트와 안전을 보장하는 합리적 에이전트를 결합하고, 가장 관련성 높은 경험을 우선시하는 기억 시스템을 사용함으로써, 연구진은 기계가 예측 불가능한 물리적 세계의 본질에 적응할 수 있는 프레임워크를 만들어냈습니다. 실험 결과는 이 접근 방식이 복잡하고 미지의 환경에서 작동하는 로봇의 안전성과 효율성을 크게 향상시킬 수 있음을 시사하며, 이는 재난 복구, 탐사, 그리고 지형이 너무 위험하거나 예측 불가능하여 인간이 직접 조작하기 어려운 기타 중요한 작업에서 더 유능한 기계를 구현하는 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →