PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model
이 논문은 OpenPangu-7B 파운데이션 모델을 기반으로 구축되었으며, 시각 및 언어 모달리티를 정렬하고 전문가 궤적에 적응하기 위해 2단계 학습 전략을 채택하여, Ascend 910B 하드웨어에서 혼합 정밀도 연산과 DeepSpeed를 활용함으로써 홀드아웃 데이터에 대해 62.29%의 정규화된 액션 일치도(Normalized Action Match)를 달성한 오프라인 시각-언어 내비게이션 시스템인 PGN을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 단순히 정해진 명령 목록을 따르는 것이 아니라, 인간 친구처럼 당신을 실제로 이해할 수 있는 세상을 상상해 보십시오. 이것이 바로 '체화된 AI(embodied AI)'의 꿈입니다. 즉, 기계에게 몸(또는 카메라와 바퀴)을 주고, 방을 보고 당신의 목소리를 들으며 어떻게 움직여야 할지 스스로 판단할 수 있는 두뇌를 부여하는 것입니다. 가장 큰 과제는 픽셀과 색상으로 이루어진 시각적 세계와 문장 및 지시사항으로 이루어진 언어적 세계라는 매우 다른 두 언어를 연결하는 것입니다. 이것은 마치 시로 쓰인 지도만을 가지고 집 안을 돌아다니는 법을 개에게 가르치는 것과 같습니다. "주방을 지나 걸어가라"라는 말을 일련의 물리적인 회전과 발걸음으로 번역할 방법이 필요합니다. 이것이 시각-언어 내비게이션(Vision-Language Navigation, VLN)의 핵심 퍼즐입니다. 이는 단순히 사물을 인식하는 것만이 아니라, 방의 흐름을 시간에 따라 이해하고, 자신이 어디에 있었는지 기억하며, 단순한 문장에 기초하여 다음에 무엇을 할지 결정하는 것에 관한 것입니다.
중국 전자과기대학교의 연구진이 구축한 새로운 시스템인 PGN을 소개합니다. 이 시스템은 'OpenPangu-7B'라는 강력한 '두뇌'를 사용하여 이 퍼즐을 풀도록 설계되었습니다. OpenPangu를 이미 말하고 글을 쓸 줄 알지만 보고 움직이는 법은 모르는 초지능형 사전 학습 언어 모델이라고 생각하면 됩니다. 연구진의 목표는 로봇에게 사진과 지시사항을 보여줌으로써 이 거대한 언어 모델이 가상 주택을 탐색하는 법을 가르치는 것이었습니다. 그들은 단순히 로봇을 깊은 물 속에 던져 넣은 것이 아니라, 2단계의 훈련 캠프를 구축했습니다. 먼저, 연구진은 'Q-Former'라는 번역 모듈을 사용하여 언어 두뇌를 특수 카메라 눈(비전 인코더)에 연결함으로써 로봇이 '보는' 법을 가르쳤습니다. 이를 통해 로봇은 꽃병 사진이 '꽃병'이라는 단어와 관련이 있다는 것을 이해할 수 있었습니다.
로봇이 이미지와 단어 사이의 연결을 이해할 수 있게 되자, 두 번째 단계인 이동 학습이 시작되었습니다. 팀은 시스템에 '전문가'(실수를 하지 않는 컴퓨터 프로그램)가 수행한 완벽한 내비게이션 경로 수천 개의 사례를 입력했습니다. 로봇은 최근 다섯 번의 방 스냅샷 시퀀스를 보고 지시사항을 읽은 뒤, 결정적으로 행동하기 전에 생각하도록 학습되었습니다. 단순히 "왼쪽으로 돌아"라고 내뱉는 대신, 모델은 행동을 확정하기 전에 "좋아, 왼쪽에 주방이 보이니 왼쪽으로 돌아야겠어"라고 인간이 말하는 것처럼 짧은 추론 텍кси트를 먼저 생성하도록 훈련받았습니다. 그들은 로로봇에게 올바른 관측 이력을 제공하고 다음 동작을 예측하도록 요청한 500개의 숨겨진 테스트 경로에서 이 시스템을 테스트했습니다. 결과는 유망했습니다: 최신 버전(V9)에서 로봇은 전문가의 행동을 62.29%의 확률로 일치시켰으며, 거의 항상(100%의 확률로) 비어 있지 않은 답변을 내놓았습니다. 그러나 저자들은 이것이 '교사 강제(teacher-forced)' 테스트라는 점을 매우 주의 깊게 언급합니다. 이것은 마치 학생이 매 단계마다 선생님이 정답지를 들어 보여주는 객관식 퀴즈를 푸는 것과 같습니다. 로봇이 실수를 했을 때 스스로 회복할 수 있는지, 혹은 도움 없이 실제의 무질서한 환경에서 성공적으로 목표에 도달할 수 있는지에 대해서는 아직 테스트되지 않았습니다. 이 시스템은 대규모 언어 모델이 내비게이션 지시를 이해하고 전문가의 행동과 정렬되도록 적응될 수 있음을 보여주지만, 논문은 이 로봇이 실제로 혼자서 집을 탐색할 수 있는지에 대한 진정한 시험은 여전히 미래의 과제로 남아 있다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.