← 최신 논문
🤖 AI

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

이 논문은 능동적인 시각적 추론과 5,000개의 고품질 궤적으로 구성된 합성 데이터셋을 활용하여 미세한 시각적 증거를 동적으로 수집함으로써 복잡한 오픈 월드 탐색 작업에서 최첨단 성능을 달성하는 시각 네이티브 멀티모달 에이전트 검색 시스템인 Visual-Seeker를 소개한다.

원저자: Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhengbo Zhang, Changtao Miao, Jinbo Su, Zhaowen Zhou, Chunxia Zhang, Xukai Wang, Ruiqi Liu, Kaiyuan Zheng, Jiansheng Cai, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려고 노력하고 있다고 상상해 보세요. 하지만 단순히 종이에 적힌 단서를 읽는 것이 아니라, 혼란스럽고 붐비는 사진 속에서 답을 찾아야 합니다.

문제점: "눈먼" 탐정
현재의 AI 탐정들(멀티모달 거대 언어 모델이라 불리는)은 텍스트를 읽고 단순한 사진을 보는 데는 뛰어나습니다. 하지만 경기장으로 가득 찬 사람들 혹은 아주 작은 디테일이 포함된 영화 포스터와 같이 복잡한 실제 세상의 사진을 마주하면, 그들은 종종 혼란에 빠집니다. 그들은 농구 선수가 어떻게 생겼는지는 알 수 있지만, 흐릿한 관중 사진 속에서 정확히 몇 번 저지를 입은 선수인지 찾아내는 것은 쉽지 않습니다.

게다가, 이 AI들이 인터넷에서 답을 찾으려고 할 때, 그들은 대개 사진을 정적인 "스냅샷"처럼 취급합니다. 사진을 한 번 보고, 텍텍스트 질문을 던진 뒤 멈춰버립니다. 그들은 확대하거나, 특정 얼굴을 크롭하거나, 원래의 사진과 비교하기 위해 새로운 사진을 적극적으로 찾아다니는 법을 모릅니다. 그들은 마치 범죄 현장 사진을 한 번 보고 나서, 눈을 감고 기억에 의존해 답을 추측하는 탐정과 같습니다.

해결책: Visual-Seeker
이 논문의 저자들은 새로운 AI 에이전트인 Visual-Seeker를 구축했습니다. Visual-Seeker를 단순히 사진을 응시하는 것이 아니라, 사진을 적극적으로 조사하는 탐정이라고 생각하십시오.

단순히 이미지를 쳐다보는 대신, Visual-Seeker는 다음과 같은 일을 합니다:

  1. 확대하기: 모자의 깃털 색깔이나 저지의 번호와 같은 아주 작은 디테일을 포착할 수 있습니다.
  2. 증거 찾기: 만약 사진이 충분히 명확하지 않다면, 인터넷으로 가서 "공식 DVD 커버"나 "팀 사진"을 검색하고, 새로운 이미지를 다운로드하여 원래 이미지와 비교해야 한다는 것을 스스로 압니다.
  3. 점 연결하기: 새로운 이미지에서 본 것과 원래의 질문을 결합하여 퍼즐을 해결합니다.

학습 방법: "훈련 시뮬레이터"
AI에게 단순히 "더 잘 보라"고 말할 수는 없습니다. 어떻게 해야 하는지 보여줘야 합니다. 연구진은 특별한 훈련 공장( "Active Visual Reasoning Data Pipeline"이라 불리는)을 구축했습니다.

비디오 게임 설계자가 신입 요원을 위한 훈련 과정을 만드는 것을 상상해 보세요:

  • 1단계 (대상): 그들은 무질서한 실제 사진을 가져와 AI에게 특정 인물이나 물체를 찾아내라고 요청합니다 (예: "분홍색 셔츠를 입은 남자를 찾아라").
  • 2단계 (흔적): 그들은 가짜 "보물 찾기" 경로를 만듭니다. AI는 마치 단서를 따라가는 탐정처럼 하나의 사실에서 다른 사실로 건너뛰어야 합니다.
  • 3단계 (반전): 결정적으로, 그들은 텍스트만으로는 충분하지 않다는 것을 AI가 깨닫도록 강제합니다. 그들은 "시각적 증거"를 학습 과정에 주입합니다. 그들은 AI가 "잠깐, 텍스트만 읽어서는 답을 낼 수 없어. 색깔을 확인하려면 모자 사진을 찾아봐야 해!"라고 깨닫게 만듭니다.

그들은 AI가 수동적인 독자가 아닌 능동적인 탐색자가 되도록 가르치기 위해 5,000개의 복잡한 훈련 시나리오를 만들었습니다.

결과: 새로운 챔피언
그들이 Visual-Seeker를 다른 최고 수준의 AI 모델들(대형 기술 기업들의 값비싼 독점 모델들을 포함하여)과 테스트했을 때, 승자는 Visual-Seeker였습니다.

  • 그것은 단순히 추측하는 것이 아니라, 실제로 직접 나가서 올바른 사진들을 찾아내고 세부 사항을 확대했습니다.
  • 그것은 "텍스트 전용" 전문가들보다 뛰어났으며, 심지어 현재 사용 가능한 가장 강력한 "멀티모달" 모델들 중 일부를 이겼습니다.
  • 그것은 AI에게 시각적 단서를 능동적으로 보고 검색할 도구를 제공한다면, 실제 세계의 퍼즐을 푸는 데 훨씬 더 똑똑해진다는 것을 증证明했습니다.

요약하자면
이전의 AI들은 교과서를 암기했지만 복잡한 실제 시험에는 적용하지 못하는 학생들과 같았습니다. Visual-Seeker는 돋보기, 지도, 그리고 카메라를 들고 시험장에 들어와 문제를 해결하기 위해 단계별로 증거를 적극적으로 수집하는 학생입니다. 이 논문은 이러한 "능동적인 보기" 접근 방식이 AI를 시각적인 세상에서 진정으로 똑똑하게 만드는 핵심임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →