← 최신 논문
💻 computer science

From Web to Pixels: Bringing Agentic Search into Visual Perception

본 논문은 객체의 위치 파악 전에 외부 지식을 통해 객체를 식별해야 하는 새로운 오픈 월드 시각 인식 과제인 'Perception Deep Research'를 소개하고, 이를 검색 기반 위치 추정, 분할 및 VQA 분야에서 최첨단 오픈 소스 성능을 입증하는 WebEye 벤치마크와 Pixel-Searcher 에이전트 프레임워크로 해결합니다.

원저자: Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"월도 찾기"(또는 "월리 찾기") 게임을 상상해 보세요. 하지만 약간의 변형이 있습니다.

고전적인 게임에서는 혼잡한 그림을 보고 월도의 외모를 바탕으로 그를 찾습니다. 빨간색과 흰색 줄무늬 셔츠, 모자, 안경이 그 특징입니다. 월도가 누구인지 알 필요는 없습니다. 단지 시각적 패턴을 포착하기만 하면 됩니다.

이 논문은 대부분의 현재 AI 비전 시스템이 고전적인 게임을 하고 있다고 주장합니다. 그들은 "빨간 차"나 "파란 셔츠를 입은 사람"처럼 보이는 것을 찾는 데는 뛰어납니다. 하지만 질문이 무언가가 어떻게 보이는지에 관한 것이 아니라, 사진에서 볼 수 없는 사실에 기반한 누구인지에 관한 것일 때 그들은 어려움을 겪습니다.

새로운 도전: "미스터리 게스트"

저자들은 Perception Deep Research(지각 심층 연구) 라는 새롭고 더 어려운 버전의 게임을 소개합니다.

혼잡한 파티 사진이 있다고 상상해 보세요. 질문은 "빨간 셔츠를 입은 사람을 찾아라"가 아닙니다. 대신 질문은 다음과 같습니다:

"2026 년 1 월, 해당 브랜드가 27 억 달러에 한 기업에 인수된 후, 스킨케어 브랜드의 글로벌 앰버서더가 된 사람을 찾아라."

이 문제는 단순히 사진을 보는 것만으로는 해결할 수 없습니다. 사진에는 인수 가격이나 앰버서더 발표 날짜가 표시되지 않습니다. 올바른 사람을 찾기 위해 AI 는 다음을 수행해야 합니다:

  1. 웹 헌트 수행: 인터넷을 검색하여 어떤 브랜드가 언제, 누구에 의해 인수되었는지, 그리고 앰버서더가 누구였는지 파악합니다.
  2. 미스터리 해결: "아, 사진 속 'Winter'라는 이름의 사람이 우리가 찾는 사람이다"라고 깨닫습니다.
  3. 픽셀 지시: 마지막으로 사진으로 돌아가 Winter 주위에 상자를 그립니다.

이 논문은 이를 **"웹에서 픽셀로 (From Web to Pixels)"**라고 부릅니다. 이는 인터넷상의 사실을 이미지의 특정 지점과 연결하는 것입니다.

그들이 개발한 도구들

AI 가 이를 수행할 수 있는지 테스트하기 위해 팀은 두 가지 주요 도구를 만들었습니다.

1. WebEyes(테스트 코스)
이를 AI 를 위한 전문 장애물 코스로 생각하세요. 여기에는 120 개의 복잡한 이미지와 수백 개의 까다로운 질문이 포함되어 있습니다.

  • 변형: 모든 질문은 AI 가 이미지에서 어디를 봐야 할지 추측하기 전에 숨겨진 사실 (유명인의 최근 역할, 제품 출시일, 캐릭터의 배경 이야기 등) 을 찾아봐야 합니다.
  • 목표: AI 는 단순히 질문에 답하는 것뿐만 아니라, 정답과 일치하는 사진 속의 정확한 사람이나 사물을 가리켜야 합니다.

2. Pixel-Searcher(스마트 탐정)
이는 이 테스트를 수행하기 위해 저자들이 만든 새로운 AI 에이전트입니다. 단순히 이미지를 응시하고 추측하는 대신, Pixel-Searcher 는 돋보기와 노트북을 든 탐정처럼 행동합니다.

  • 1 단계: 검색. 질문을 분해합니다. "앰버서더는 누구였나?" "거래는 언제 이루어졌나?" 웹을 검색하고 결과를 읽습니다.
  • 2 단계: 추론. 단서들을 연결합니다. "좋아, 거래는 1 월에 이루어졌고 앰버서더는 Winter 야."
  • 3 단계: 추적. 다시 이미지로 돌아갑니다. 검색에서 언급된 특정 옷이나 특징을 확인하며 Winter 와 비슷하게 보이는 사람을 찾고 그 주위에 상자를 그립니다.

그들이 발견한 것들

연구자들은 Pixel-Searcher 를 다른 똑똑한 AI 모델들과 비교하여 테스트했습니다. 그 결과는 다음과 같습니다:

  • 구형 AI 모델: 이러한 "미스터리 게스트" 질문을 마주했을 때, 표준 AI 모델들은 혼란스러워했습니다. 그들은 사진에서 본 것이나 훈련을 통해 이미 "알고 있던" 것만으로 추측하려 했습니다. 숨겨진 사실을 찾을 수 없기 때문에 종종 잘못된 사람을 선택했습니다.
  • Pixel-Searcher: 이 새로운 에이전트는 오픈소스 모델 중 가장 좋은 성과를 거두었습니다. 실제로 웹을 검색하고 단서를 통해 추론함으로써 훨씬 더 자주 올바른 표적을 성공적으로 찾았습니다.

여전히 어려움을 겪는 부분:
논문은 AI 가 사람을 완벽하게 상자로 묶지 못해서 실패하는 것이 아니라, 과정의 더 초기 단계에서 실패한다고 지적합니다.

  • 부적절한 검색: 때로는 잘못된 것을 검색하거나 중요한 사실을 놓칩니다.
  • 잘못된 신원: 올바른 사실을 파악하지만 사진 속 잘못된 사람을 가리킵니다 (예: 앰버서더가 "Winter"라는 사실을 알지만, Winter 라는 이름의 잘못된 사람을 가리킵니다).
  • 연결 (Binding): "사실"(Winter) 과 "시각"(사진 속 사람) 을 연결하는 데 어려움을 겪습니다.

큰 그림

이 논문은 AI 가 세상을 진정으로 이해하려면 단순히 형태를 보는 "카메라"가 될 수 없다고 결론 내립니다. 정보를 찾아보고 퍼즐을 풀고, 그 지식을 활용하여 사진 속 올바른 것을 가리킬 수 있는 "연구자"가 되어야 합니다. 그들은 이 새로운 분야를 **Perception Deep Research(지각 심층 연구)**라고 부르며, 다른 과학자들이 더 나은 "탐정" AI 를 구축할 수 있도록 WebEyes 와 Pixel-Searcher 라는 도구를 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →