← 최신 논문
💻 computer science

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

이 논문은 초소형 항공 표적을 위한 최초의 픽셀 수준 개방형 어휘 데이터셋인 **DroneEyes**와, 스트리밍 항공 영상 내 작은 객체에 대한 실시간적이고 자원 효율적인 이해를 가능하게 하는 의미론적 인지 토큰 라우터 및 계층적 메모리 뱅크를 특징으로 하는 메모리 증강 멀티모달 거대 언어 모델인 **SkyAnchor**를 소개한다.

원저자: Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

게시일 2026-07-23
📖 5 분 읽기🧠 심층 분석

원저자: Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 번화한 도시 위를 비행하는 작고 첨단 기술이 집약된 드론의 조종사라고 상상해 보세요. 당신의 임무는 단순히 예쁜 사진을 찍는 것이 아닙니다. "저 빨간 차를 찾아줘" 또는 "저 흰색 트럭을 보여줘"와 같이 인간 운영자의 질문에 실시간으로 답해야 합니다. 이것이 바로 컴퓨터가 하늘에서 무엇을 보고 있는지 이해하려고 노력하는 **항공 시각(aerial vision)**의 세계입니다. 하지만 여기에는 함정이 있습니다. 드론이 보는 대상은 종종 거대한 피크닉 매트 위의 개미 한 마리처럼 믿기지 않을 정도로 작습니다. 더욱 어려운 점은 드론이 비행 중이기 때문에, 전체 영화를 다 볼 때까지 기다릴 수 없으며 영상이 스트리밍되는 대로 프레임 단위로 즉각 반응해야 한다는 것입니다. 이를 **스트리밍 비디오 이해(streaming video understanding)**라고 합니다.

이제 마라톤을 하면서 친구에게 그 작은 개미를 묘사한다고 상상해 보세요. 모든 발걸음의 거대한 사진첩을 들고 뛸 수는 없습니다(그것은 너무 무겁습니다). 하지만 1초 전의 상황을 잊어버린다면, 군중 속에서 개미를 놓칠 수도 있습니다. 이것이 바로 연구자들이 **멀티모달 대규모 언어 모델(MLLMs)**에서 직면하는 정확한 문제입니다. 이들은 매우 똑똑한 AI 뇌를 가지고 있어 보고 읽을 수 있지만, 보통 아주 작은 세부 사항에 압도되거나 영상이 계속 흘러갈 때 과거를 잊어버리곤 합니다. 이 논문은 이 AI 뇌가 배터리 전력을 다 써버리거나 혼란에 빠지지 않으면서도, 라이브 드론 영상 속에서 작고 움직이는 물체를 포착하도록 가르치는 과제를 다룹니다.


작은 타겟 문제 (The Tiny Target Problem)

연구진은 기존의 AI 도구들이 이 특정 작업에 매우 서툴다는 점을 깨닫는 것부터 시작했습니다. 대부분의 AI 모델은 사람이나 강아지가 공원에 있는 것처럼 대상이 크고 보기 쉬운 영상으로 훈련되었습니다. 드론 영상을 AI에게 보여주면, AI는 공간을 절약하기 위해 전체 이미지를 압축하여 작은 자동차를 거대한 건물과 똑같이 취급합니다. 그 결과는 어떨까요? 작은 자동차는 흐릿함 속에 길을 잃고 맙니다.

이를 해결하기 위해 팀은 먼저 DroneEyes라는 새로운 훈련장을 구축했습니다. 이것은 2,140개의 고해상도 드론 영상이 담긴 거대한 도서관과 같지만, 특별한 점이 있습니다. 모든 프레임의 모든 작은 물체가 픽셀 단위의 정밀도로 윤곽이 그려져 있다는 것입니다. 그들은 단순히 물체 주위에 상자를 그리는 데 그치지 않고, 작은 은색 자동차나 멀리 있는 보행자의 정확한 형태를 따라 그렸습니다. 이 데이터셋은 176,000개 이상의 질문-답변 쌍을 포함하고 있어, AI가 이러한 작은 것들을 찾을 뿐만 아니라 "원형 광장에 있는 빨간 조형물이다"와 같이 상세하게 묘사할 수 있도록 가르칩니다.

SkyAnchor를 만나보세요: 드론의 새로운 뇌

이 새로운 데이터를 바탕으로 팀은 SkyAnchor라는 새로운 AI 모델을 만들었습니다. 기존 모델이 저글링을 하며 책을 읽으려는 학생이라면, SkyAnchor는 잘 정리된 노트와 마법 형광펜을 가진 학생과 같습니다. SkyAnchor는 두 가지 영리한 기술을 통해 드론 시각의 두 가지 주요 난제를 해결합니다.

  1. 마법 형광펜 (Semantics-Aware Token Router):
    보통 AI가 영상을 볼 때, 이미지를 수천 개의 작은 퍼즐 조각(토큰이라고 불림)으로 나눕니다. 그리고 배경의 지루한 하늘조차도 모든 조각을 동등하게 취급합니다. SkyAnchor는 스마트 형광펜처럼 작동하는 "라우터"를 사용합니다. 이 라우터는 이미지를 스캔하여 "이 하늘 조각은 지루하니까 무시하자"라고 말하면서도, "이 작은 자동차는 중요하니까 모든 세부 사항을 유지하자!"라고 판단합니다. 이를 통해 AI는 거대한 이미지 전체를 처리할 필요 없이 작은 타겟에 뇌의 힘을 집중할 수 있으며, 에너지를 절약하고 디테일을 선명하게 유지할 수 있습니다.

  2. 두 권의 노트 시스템 (Hierarchical Memory Bank):
    드론은 비행 중이므로, 물체가 현재 어디에 있는지 알기 위해 몇 초 전에 무엇을 보았는지 기억해야 합니다. 하지만 모든 것을 영원히 기억할 수는 없습니다. 그렇지 않으면 메모리가 즉시 가득 찰 것입니다. SkyAnchor는 두 층의 메모리 시스템을 사용합니다.

    • "누구"에 대한 노트 (Semantic Memory): 물체의 정체를 저장합니다. "저것은 은색 세단이다"라는 것을 기억합니다. 이 부분은 AI가 추적 중인 대상을 잊지 않도록 메모리에 오랫동안 머뭅니다.
    • "어디"에 대한 노트 (Tracking Memory): 마지막 몇 초간의 움직임만을 담는 단기적인 슬라이딩 윈도우입니다. "차가 방금 왼쪽으로 움직였다"라는 것을 기억합니다.
      "누구인지"와 "어디에 있는지"를 분리함으로써, SkyAnchor는 드론이 줌인하거나 줌아웃하더라도 혼란을 느끼거나 물체를 놓치지 않고 부드럽게 추적할 수 있습니다.

연구 결과

팀은 새로운 DroneEyes 데이터셋으로 SkyAnchor를 테스트하고 현재 사용 가능한 가장 똑똑한 AI 모델들과 비교했습니다. 결과는 인상적이었습니다. 물체를 묘사하는 작업에서 SkyAnchor는 최고의 범용 모델보다 두 배 더 높은 점수를 기록했습니다. 작은 물체를 찾고 윤곽을 그리는 작업(referring segmentation)에서는 SkyAnchor가 훨씬 더 작고 가벼움에도 불구하고 차세대 모델보다 15.3% 더 높은 성능을 보였습니다.

하지만 진짜 테스트는 이 AI가 한 번도 본 적 없는 완전히 새로운 환경을 처리할 수 있는지였습니다. 연구진은 해양 장면을 특징으로 하는 SkyFind라는 다른 데이터셋을 던져주었습니다. 추가 훈련 없이도 SkyAnchor는 물체를 정확하게 찾는 능력에서 이전의 최고 기록을 25.9% 개선했습니다. 이는 SkyAnchor가 단순히 훈련 영상을 암기한 것이 아니라, 작은 것을 포착하는 일반적인 기술을 배웠음을 시사합니다.

실제 비행

마지막으로, 팀은 SkyAnchor를 컴퓨터 실험실에만 두지 않았습니다. 그들은 대학교 캠퍼스 위를 나는 실제 드론에 탑재했습니다. 클라우드로 데이터를 보낼 필요 없이 소형 휴대용 컴퓨터(NVIDIA Jetson AGX Orin)에서 실행될 수 있도록 소프트웨어를 최적화했습니다. 결과는 어떠했을까요? 시스템은 표준 설정보다 3.05배 더 빠르게 작동하여, 드론이 비행하는 동안 실시간으로 질문에 답하고 윤곽을 그릴 수 있게 해주었습니다.

실제 세계의 영상에서 SkyAnchor는 드론이 움직이고 시야가 변하는 와중에도 빨간색 SUV, 자갈길에 숨겨진 은색 자동차, 심지어 연못의 비단잉어까지 성공적으로 추적했습니다. 그림자에 길을 잃거나 비슷하게 생긴 물체 때문에 혼란을 겪지도 않았습니다.

핵심 요약

이 논문은 고품질의 새로운 데이터셋과 스마트한 메모리 시스템, 그리고 초점 유지형 라우터를 결합함으로써, 라이브 드론 영상 속의 아주 작은 것들을 포착하는 능력을 크게 향상시킬 수 있음을 보여줍니다. 이는 이를 수행하기 위해 거대하고 무거운 컴퓨터가 필요한 것이 아니라, 효율적이고 메모리를 인식하는 모델이 드론에 탑재되어 운영자가 원하는 것을 지금 바로 찾도록 도울 수 있음을 증명합니다. 이 논문은 특정 데이터셋과 실제 테스트에서 강력한 결과를 보여주었지만, 동시에 향후 연구가 시스템을 더욱 빠르게 만들고 타겟을 시야에 계속 두기 위해 드론의 비행 경로를 자동으로 제어하는 법을 가르치는 데 집중될 것임을 암시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →