Towards smart and adaptive agents for active sensing on edge devices
이 논문은 기존의 TinyML 방식이 가진 한계를 극복하기 위해 에지 장치가 카메라 움직임을 동적으로 계획하고 제어할 수 있도록 함으로써, 자원이 제한된 에지 장치에서 실시간 적응형 능동 센싱을 가능하게 하는 소형 능동 추론 기반 에이전트 시스템을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
단순히 세상을 기록하는 것이 아니라, 마치 인간의 눈이 전체적인 그림을 그리기 위해 세부 사항을 따라 이리저리 움직이는 것처럼 무엇을 볼지 능동적으로 선택하는 카메라를 상상해 보십시오. 이것은 기계가 데이터를 수동적으로 기다리는 것이 아니라, 가장 유용한 정보를 수집하기 위해 센서를 움직이는 개념인 '능동적 감지(active sensing)'의 영역입니다. 오랫동안 꿈꿔온 목표는 이러한 종류의 스마트하고 적응 가능한 행동을 보안 카메라나 로봇처럼 현장에서 바로 작동하는 작고 배터리로 구동되는 장치에 구현하는 것이었으며, 이를 위해 데이터를 멀리 떨어진 클라우드 서버로 보낼 필요가 없도록 하는 것이었습니다. 문제는 이러한 기능을 수행할 수 있는 강력한 인공지기능 시스템은 보통 방대한 양의 컴퓨팅 파워와 메모리를 요구하기 때문에, 이러한 작고 로컬한 장치에서 실행하는 것이 불가능했다는 점입니다.
연구진은 이제 이 간극을 메우는 시스템을 구축하여, 작은 컴퓨터 보드 크기의 장치에서도 실시간으로 보고, 계획하고, 카메라를 움직일 수 있는 스마트한 에이전트를 만들어냈습니다. 최근 발표된 연구에 따르면, 이 작업은 두 가지 서로 다른 인공지능 접근 방식을 결합하는 것이 가능하다는 것을 보여줍니다. 하나는 이미지 속의 객체를 인식하는 데 탁월한 방식이고, 다른 하나는 불확실성 속에서 의사결정을 내리는 데 탁월한 방식입니다. 그 결과, 인간이 세부 사항에 집중하기 위해 빠르게 움직이는 눈의 움직임인 '사카드(saccade, 안구 도약)'의 이름을 딴 '사카드 에이전트'가 탄생했습니다. 이 에이전트는 사람을 추적하거나 자율적으로 방을 탐색하도록 카메라를 제어할 수 있습니다. 이 시스템은 완전히 엣지 장치에서 실행되므로, 모든 것을 로컬에서 처리하여 빠른 반응을 보장하고 데이터 프라이버시를 유지합니다.
연구진은 특정한 문제에 직면했습니다. 사람이나 자동차 같은 것들을 찾아내는 데 매우 뛰어난 표준 딥러닝 모델들은 경직되어 있다는 점입니다. 일단 훈련되고 나면, 환경이 변하거나 새로운 것을 찾기 위해 다음에 어디를 봐야 할지 결정해야 할 때 적응하는 데 어려움을 겪습니다. 이 모델들은 방대한 양의 데이터와 컴퓨팅 파워에 의존하는데, 이는 작고 저전력인 장치가 필요로 하는 것과는 정반대되는 특성입니다. 이를 해결하기 위해 연구진은 딥러닝 모델을 더 크거나 똑똑하게 만들려고 시도하지 않았습니다. 대신, 그 위에 '능동적 추론(active inference)'이라는 원리에 기반한 두 번째 지능 계층을 추가했습니다. 이 접근 방식은 에이전트를 세상을 향해 끊임없이 자신의 믿음을 업데이트하는 과학자로 취급합니다. 에이전트는 "내가 무엇을 볼 것이라고 예상하는가?" 그리고 "무엇이 나를 놀라게 할 것인가?"라고 자문합니다. 만약 카메라가 새로운 것을 보지 못한다면, 에이전트는 더 많은 것을 배우기 위해 다른 곳으로 이동하기로 결정합니다. 만약 사람과 같이 흥미로운 것을 발견한다면, 그 사람에게 집중합니다. 이 의사결정 과정은 매우 가벼워서 메모리를 아주 적게 사용하며, 덕분에 더 무거운 객체 탐지 소프트웨어와 함께 실행될 수 있습니다.
이 아이디어를 테스트하기 위해 연구진은 엣지 분야의 인공지능 작업을 위해 설계된 강력한 컴퓨터인 NVIDIA Jetson 장치를 사용하여 물리적 프로토타입을 제작했습니다. 연구진은 이 장치를 건물 등에서 흔히 볼 수 있는 보안 카메라와 유사하게 팬(pan) 및 틸트(tilt)가 가능한 카메라에 연결했습니다. 시스템에는 장면을 관찰하고 렌즈를 어디로 향하게 할지 결정하는 단순하지만 강력한 임무가 주어졌습니다. 시스템의 첫 번째 부분인 인지 모듈은 YOLO라는 잘 알려진 객체 탐지 도구를 사용하여 비디오 피드를 스캔하고 사람이나 물체를 찾았습니다. 이 도구는 장치의 하드웨어에서 빠르게 실행되도록 최적화되었습니다. 두 번째 부분인 계획 모듈은 카메라가 본 사물 목록을 가져와서 능동적 추론을 사용하여 다음 움직임을 결정했습니다. 이는 사람을 계속 주시할 것인지, 아니면 새로운 것이 나타나는지 확인하기 위해 빈 영역을 스캔할 것인지 계산했습니다.
결과는 이 조합이 하드웨어의 엄격한 제한 내에서 놀라울 정도로 잘 작동한다는 것을 보여주었습니다. 소프트웨어를 포함한 전체 시스템은 단 304MB의 메모리 점유율 안에 들어갔는데, 이는 인공지능 시스템치고는 매우 작은 크기입니다. 한 구성에서는 카메라가 영상을 처리하고 다음에 어디를 볼지 결정하는 데 초당 108번의 동작을 수행할 수 있었는데, 이는 인간의 관찰자에게 즉각적으로 느껴질 만큼 빠른 속도입니다. 또 다른 설정에서는 메모리보다 속도를 우선시하여 초당 45프레임의 영상 분석을 수행하면서도 초당 250번의 의사결정을 내렸습니다. 연구진은 의사결정에 걸리는 시간이 매우 짧아서 시스템이 비디오 피드를 쉽게 따라잡을 수 있으며, 이를 통해 카메라가 지연 없이 움직이는 대상을 부드럽게 추적하거나 방을 훑을 수 있다는 것을 발견했습니다.
이 성과가 중요한 이유는 단순히 카메라가 움직였기 때문이 아니라, 어떻게 움직였느냐에 있습니다. 에이전트는 미리 프로그래밍된 경로를 따르지 않았습니다. 대신, 실시간으로 환경에 반응했습니다. 만약 사람이 프레임 안으로 들어오면 카메라는 그 사람에게 고정됩니다. 사람이 움직이면 카메라도 따라갑니다. 만약 사람이 떠나고 방이 비게 되면, 에이전트는 다른 일이 일어나고 있는지 확인하기 위해 방의 나머지 부분을 스캔하기로 결정합니다. 이러한 행동은 인간이 주변 환경을 탐색할 때 중요한 것에 집중하는 것과 전체적인 그림을 파악하는 것 사이의 균형을 맞추는 방식을 모방합니다. 연구진은 소형 로봇에 장착된 카메라를 통해 이 시스템이 인간의 개입 없이도 기계가 새로운 환경을 효율적으로 탐색하고 정보를 수집하는 데 도움을 줄 수 있음을 입증했습니다.
또한 연구진은 속도와 메모리 사용량 사이의 최적의 균형을 찾기 위해 하드웨어에서 소프트웨어를 실행하는 다양한 방법을 신중하게 테스트했습니다. 그들은 장치의 그래픽 프로세서에 특화된 도구들을 사용하는 것이 표준적인 방법보다 훨씬 빠르게 시스템을 실행할 수 있다는 것을 발견했습니다. 그러나 의사결정 부분과 같이 매우 작은 부분의 경우, 강력한 그래픽 프로세서에서 실행하려고 하면 작업을 관리하는 오버헤드가 추가적인 이점보다 커져 오히려 속도가 느려진다는 사실도 발견했습니다. 이 발견은 적절한 소프트웨어 도구를 적절한 하드웨어에 매칭하는 것이 실제 사용을 위한 데 매우 중요한 단계임을 강조합니다.
이 연구는 스마트 장치의 미래가 반드시 거대한 클라우드 기반의 슈퍼컴퓨터를 필요로 하는 것은 아님을 시사합니다. 견고한 시각 능력과 가벼운 계획 능력을 결합함으로써, 스마트하면서도 효율적인 에이전트를 만드는 것이 가능하다는 것을 보여주었습니다. 연구진은 이러한 시스템이 독립적으로 작동하며, 복잡하고 변화하는 환경에서 정보를 수집하기 위해 순식간의 결정을 내릴 수 있음을 보여주었습니다. 현재 시스템은 카메라 제어에 집중하고 있지만, 동일한 원리가 붐비는 방을 항해하는 로봇이나 실종자를 찾는 드론과 같은 다른 작업에도 적용될 수 있습니다. 이 연구는 능동적 추론이 예측 불가능한 현실 세계를 다룰 수 있는 적응력 있고 자원 효율적인 기계를 만드는 유망한 길을 제시하며, 지능형 감지의 힘을 엣지로 직접 가져오는 결론을 맺습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.