VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch
이 논문은 비주얼 딥서치(Visual DeepSearch)를 위한 복잡한 멀티홉 시각적 추론 및 반복적인 이미지 검사 수행 능력을 평가하기 위해 설계된 새로운 벤치마크이자 평가 환경인 VistaHop을 소개하며, 이를 통해 현재의 최첨단 모델들이 여전히 이러한 과업에서 상당한 어려움을 겪고 있음을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 해결하기 위해 탐정을 고용한다고 상상해 보십시오. 과거에 대부분의 "AI 탐정 테스트"는 단순한 수수께끼와 같았습니다. AI에게 사진 한 장을 보여주고 "자동차 색깔이 무엇인가요?"라고 묻는 식이었죠. AI는 딱 한 번 훑어보고, 색상을 추측한 뒤 바로 다음으로 넘어갔습니다.
하지만 실제 세상의 수사는 훨씬 더 어렵습니다. 때로는 사건을 해결하기 위해 신발에 새겨진 아주 작은 로고를 확대해서 보고, 그 브랜드의 역사를 찾아보고, 그 공장이 어디에 있는지 알아낸 뒤, 그곳의 날씨를 확인하고, 이 모든 점들을 연결하여 누가 현장에 있었는지 알아내야 할 때도 있습니다.
이 논문인 VistaHop은 AI 탐정들이 실제로 이러한 심층적이고 다단계적인 작업을 수행할 수 있는지 확인하기 위해 훨씬 더 까별한 테스트를 구축하는 것에 관한 것입니다.
문제점: "한 번 훑어보기"의 함정
저자들은 현재의 AI 테스트가 너무 쉽다고 주장합니다. 그것은 마치 탐정에게 사진을 주며 "이 사진에 개가 있나요?"라고 묻는 것과 같습니다. AI는 그냥 한 번 쓱 보고는 "네"라고 답합니다.
진정한 "시각적 딥서치(Visual DeepSearch)"는 다릅니다. 이는 AI에게 다음과 같은 능력을 요구합니다:
- 자세히 보기: 이미지의 특정 부분(예: 표지판의 아주 작은 글자)을 확대해서 보기.
- 왔다 갔다 하기: 단서를 놓쳤음을 깨닫고, 다시 확대하고, 사진의 다른 부분을 살펴보기.
- 점들을 연결하기: 사진에서 본 것과 외부 지식(예: 데이터베이스 검색)을 결 many 단계에 걸쳐 결합하기.
저자들은 기존의 테스트들이 AI가 텍스트 힌트를 사용하거나 실제로 세부 사항을 "보지" 않고 추측하게 함으로써 속임수를 쓰도록 허용하기 때문에 실패한다고 말합니다.
해결책: VistaHop (더 복잡한 "장애물 코스")
이를 해결하기 위해 팀은 복잡한 장애물 코스처럼 설계된 새로운 벤치마크(테스트 세트)인 VistaHop을 만들었습니다.
- 설정: 그들은 번화한 도시 거리나 박물관 같은 고품질 사진 300장을 수집했습니다.
- 과업: 그들은 AI가 긴 여정을 떠나도록 강제하는 350개의 질문을 만들었습니다.
- 예시: "오른쪽 하단에 있는 주황색 컨테이너를 보세요. 그 회사의 로고를 찾으세요. 그 회사가 언제 설립되었는지 찾아보세요. 이제 그 본사가 있는 도시를 찾으세요. 그 도시가 설립된 연도는 언제인가요? 두 연도를 빼세요."
- 규칙: AI는 단순히 추측해서는 안 됩니다. 반드시 이미지의 특정 부분을 보았고, 로고를 찾았으며, 단서의 사슬을 따라갔음을 증명해야 합니다. 만약 AI가 이미지를 보지 않고 질문의 텍스트만을 사용하여 답하려고 한다면, 테스트는 이를 잡아내어 답변을 거부합니다.
그들은 또한 AI가 훈련할 수 있는 "체육관"인 VistaArena를 구축했습니다. 이를 통해 AI는 돋보기(이미지 크롭/확대), 검색 엔진(사실 찾기), 계산기와 같은 도구를 사용할 수 있습니다.
결과: AI는 아직 초보 단계이다
저자들은 사용 가능한 가장 똑똑한 AI 모델들(SenseNova, GPT-5, Gemini 등)을 이 장애물 코스에 통과시켰습니다.
판결은 어떠했을까요? AI는 매우 고전했습니다.
- 가장 뛰어난 모델조차 첫 시도에서 정답률이 약 **24%**에 불과했습니다.
- AI가 검색 도구를 사용하지 않고 오직 이미지만 보도록 강제했을 때, 정답률은 8% 미만이었습니다.
- AI는 도구(확대 및 검색)를 사용할 수 있을 때 더 나아졌지만, "단서의 사슬"이 너무 길어지거나 사진의 여러 다른 지점을 살펴봐야 하는 경우에는 여전히 자주 실패했습니다.
시사점
이 논문은 AI가 이미지를 "보는" 데는 능숙해지고 있지만, 끈기 있는 조사관이 되는 데는 여전히 매우 서투르다는 결론을 내립니다. AI는 너무 빨리 포기하거나, 미세한 세부 사항을 놓치거나, 이미지를 다시 확인하러 돌아가는 것을 잊어버리는 경 경향이 있습니다.
저자들이 VistaHop을 만든 것은 제품을 팔기 위해서가 아니라, 우리가 진정으로 복잡한 시각적 미스터리를 이해하는 AI를 원한다면 더 나은 테스트와 더 나은 훈련 방법이 필요하다는 것을 세상에 보여주기 위함입니다. 그들은 다른 연구자들이 더 나은 "탐정"을 만들 수 있도록 자신들의 데이터와 코드를 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.