← 최신 논문
💻 computer science

QMSR: Query-Conditioned Mask-wise Expert Routing for Robust Open-Vocabulary Underwater Object Retrieval

본 논문은 쿼리 조건부 마스크 단위 전문가 라우팅 프레임워크인 QMSR을 제안하며, 이는 각 쿼리-후보 쌍에 대해 사전 학습된 수중 이미지 개선 전문가를 원시 표현과 적응적으로 선택 및 융합함으로써 고정된 개선 전략의 한계를 극복하고 복잡한 수중 환경에서 오픈 보캐블러리 객체 검색 성능을 크게 향상시킨다.

원저자: Fuming Zhang, Dongyue Huang, Junjie Wen, Lihua Xie

게시일 2026-09-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fuming Zhang, Dongyue Huang, Junjie Wen, Lihua Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수면 아래 깊은 곳, 바다는 빛이 지상에서와 다르게 작동하는 공간입니다. 물은 색을 흡수하고, 빛을 산란시키며, 세상을 탁하고 대비가 낮은 안개 속으로 변화시킵니다. 이러한 심해를 탐사하는 로봇에게 이러한 시각적 왜곡은 커다란 장애물입니다. 특정 도구를 집어 올리거나 파편을 식별하는 것과 같은 유용한 작업을 수행하기 위해 로봇은 명확하게 "볼" 수 있어야 합니다. 최근 몇 년 동안 과학자들은 기계가 언어를 통해 이미지를 이해할 수 있게 해주는 강력한 컴퓨터 시스템을 개발했습니다. 인간은 단순히 "빨간색 렌치를 찾아줘"와 같은 요청을 입력할 수 있고, 컴퓨터는 이미지를 스캔하여 그것을 찾아낼 수 있습니다. 하지만 이 기술은 수중에서 어려움을 겪습니다. 바다가 만들어내는 탁하고 색상이 변형된 이미지는 컴퓨터를 혼란스럽게 하여, 시각적 장면을 설명하는 단어와 일치시키는 것을 어렵게 만듭니다.

오랫동안 이 문제에 대한 표준적인 해결책은 이미지를 먼저 수정하는 것이었습니다. 연구자들은 수중 사진을 깨끗하게 만들고, 로봇이 물체를 식별하기 전에 가장자리를 선명하게 하고 자연스러운 색상을 복원하도록 설계된 다양한 소프트웨어 도구들을 만들어 왔습니다. 가정은 단순했습니다. 더 선명한 사진이 항상 더 나은 답을 이끌어낼 것이라는 점이었습니다. 하지만 이 접근 방식에는 숨겨 된 결함이 있습니다. 바다는 균일하지 않습니다. 이미지의 어떤 부분은 흐릿할 수 있는 반면 다른 부분은 선명할 수 있으며, 서로 다른 물체는 서로 다른 시각적 단서에 의존할 수 있습니다. 이미지 전체를 더 밝게 만드는 소프트웨어 도구는 로봇이 목표물을 찾는 데 필요한 특정 색상이나 질감을 의도치 않게 지워버릴 수도 있습니다. 실제로 이번 연구의 연구진은 이러한 표준적인 수정 사항들을 모든 이미지에 적용하는 것이 오히려 로봇의 탐색 성능을 개선하는 것이 아니라 악화시킨다는 사실을 발견했습니다. 때로는 편집되지 않은 원래의 이미지가 올바른 물체를 찾는 데 가장 좋은 단서를 포함하고 있기도 했습니다.

이를 해결하기 위해 난양 공과대학교(Nanyang Technological University)와 홍콩 중국 대학교(The Chinese University of Hong Kong)의 연구진은 QMSR이라 불리는 새로운 시스템을 개발했습니다. 모든 이미지를 하나의 정형화된 세척 과정에 강제로 통과시키는 대신, 이 시스템은 각 잠재적 물체를 개별적으로 평가하는 스마트한 의사 결정자처럼 작동합니다. 로봇이 "플라스틱 컵을 찾아줘"와 같은 명령을 받으면, 시스템은 먼저 이미지를 해당 물체를 포함할 수 있는 많은 작은 후보 조각, 즉 마스크(mask)로 분해합니다. 각 조각에 대해 시스템은 다음과 같은 결정적인 질문을 던집니다. "이 특정 이미지 조각이 내가 찾고자 하는 단어와 일치하도록 보정될 필요가 있는가?"

시스템은 각각이 약간씩 다른 방식으로 수중 사진을 수정하도록 훈련된 9가지의 서로 다른 이미지 세척 전문가 라이브러리에 접근할 수 있습니다. 어떤 전문가는 푸른 색조를 복원하는 데 더 뛰어날 수 있고, 다른 전문가는 가장자리를 선명하게 하는 데 탁월할 수 있습니다. 이 새로운 프레임워크는 이미지 전체를 위한 단 하나의 전문가를 선택하지 않습니다. 대신, 로봇이 사냥하고 있는 특정 물체와 검사 중인 이미지의 특정 조각을 살펴봅니다. 그런 다음 그 특정 쌍(pair)에 가장 적합한 단 하나의 세척 전문가를 선택합니다. 만약 시스템이 특정 이미지 조각이 이미 충분히 선명하거나, 혹은 보정을 하는 것이 오히려 필요한 단서를 가릴 것이라고 판단하면, 그 조각을 있는 그대로 두기로 결정합니다. 이것이 중요한 차이점입니다. 시스템은 이미지를 언제 강화하지 말아야 할지를 배우며, 탐색에 필수적일 수 있는 가공되지 않은 정보를 보존합니다.

연구진은 방대한 양의 수중 이미지와 텍텍스트 쿼리(query)를 사용하여 이 접근 방식을 테스트했습니다. 그들은 이 새로운 방법이 모든 것에 하나의 세척 도구를 사용하는 기존 방식 및 세척을 전혀 하지 않는 방식과 어떻게 다른지 비교했습니다. 결과는 놀라웠습니다. 새로운 시스템은 로봇이 올바른 물체를 찾는 능력을 상당한 폭으로 향상시켰으며, 가장 우수한 고정 세척 전략보다 거의 26% 더 높은 성능을 보였습니다. 또한 이 시스템은 매우 유연하다는 것을 입증했습니다. 연구진이 훈련 과정에서 본 적 없는 단어와 물체로 테스트했을 때도 전통적인 방식보다 훨씬 더 나은 성능을 보여주었습니다. 이는 시스템이 단순히 특정 수정법을 암기한 것이 아니라, 시각적 단서와 언어를 어떻게 매칭하는지에 대한 일반적인 규칙을 학습했음을 시사합니다.

아마도 가장 놀라운 발견은 시스템이 훈련 중에 어떤 세척 방법이 최선인지 전달받을 필요가 없었다는 점일 것입니다. 대신, 시스템은 자신의 선택에 따른 최종 결과를 관찰함으로써 학습했습니다. 연구진은 모든 정답에 접근할 수 있는 "교사(teacher)" 프로그램이 각 물체에 대해 어떤 전문가를 선택해야 하는지 안내하는 특별한 훈련 기법을 사용했습니다. 시간이 흐르면서 시스템은 오직 원본 이미지와 텍스트 명령만을 사용하여 이러한 결정을 스스로 내리는 법을 배웠습니다. 결과적으로 거의 모든 상황에서 단 하나의 전문가를 선택하고 그 수정 사항을 얼마나 강하게 적용할지 결정하는 것만으로도 9명의 전문가를 모두 활용하는 효과를 충분히 포착할 수 있었습니다. 시스템은 '하나의 크기가 모든 것에 맞는(one-size-fits-all)' 접근 방식이 문제였으며, 수중에서 명확하게 보는 열쇠는 눈앞의 모든 물체에 대해 정확히 어떤 도구를, 언제 사용할지를 아는 것임을 학습했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →