← 최신 논문
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

본 논문은 능동적 탐색, 통제된 오프라인, 그리고 개방형 웹 검색 시나리오에 걸쳐 텍스트 및 시각적 증거를 동적으로 통합하는 시스템의 능력에서 나타나는 중요한 현재적 한계를 부각시키는 인터레이스드 멀티모달 에이전트 검색을 위한 포괄적인 벤치마크 및 평가 프레임워크인 InterLV-Search 를 소개합니다.

원저자: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 미스터리를 해결하려고 노력한다고 상상해 보세요. 예를 들어 일련의 단서를 바탕으로 특정 인물을 찾는 것처럼요.

구식 방법 (이전 벤치마크):
대부분의 현재 AI '탐정'들은 다음과 같이 훈련됩니다: 용의자의 사진을 주고 "이 사람은 누구인가?" 또는 "그 사람의 모자 색은 무엇인가?"라고 묻습니다. AI 는 사진을 보고 답합니다. 사진만으로는 부족할 경우, AI 는 인터넷에서 그 사람에 대한 텍스트를 검색할 수 있지만, 사진을 단지 시작점이나 최종 답변으로만 취급합니다. AI 는 조사 중간에 발견한 사진을 이용해 방향을 바꾸는 경우는 거의 없습니다. 마치 범죄 현장 사진을 본 후 신문 기사만 읽을 뿐, 신문 3 페이지에서 발견한 새로운 사진이 실제로는 완전히 다른 도시를 가리킨다는 사실을 전혀 깨닫지 못하는 탐정처럼요.

새로운 방법 (InterLV-Search):
이 논문의 저자인 "InterLV-Search"는 AI 가 훨씬 더 어려운 일을 할 수 있는지 테스트하기 위한 새로운 훈련장 (벤치마크) 을 구축했습니다. 바로 **교차 멀티모달 에이전트 검색 (Interleaved Multimodal Agentic Search)**입니다.

이를 사건을 해결하기 위해 지도 (텍스트) 를 보거나 사진 (이미지) 을 보는 것을 끊임없이 전환해야 하는 탐정으로 생각하세요.

  • 반전: AI 는 사진을 발견하고 그것을 살펴본 후, "아! 이 사진 속 건물의 로고가 특정 브랜드 이름을 검색해야 함을 알려주고 있군"이라고 깨닫습니다. 그런 다음 그 브랜드를 검색하고, 자동차의 새로운 사진을 찾아 번호판을 확인한 뒤, 번호판이 특정 도시를 검색하도록 지시합니다.
  • 목표: 사진은 단순히 답변이 아닙니다. 사진은 조향 장치입니다. 사진은 AI 에게 다음에 어디로 가야 하는지 알려줍니다.

세 가지 난이도 수준

이 논문은 비디오 게임처럼 난이도가 점진적으로 상승하는 세 가지 수준에서 AI 를 테스트합니다:

  1. 레벨 1: "사진 찾기" 챌린지.

    • 과제: AI 는 "이 해적선이 등장하는 게임을 찾아라"와 같은 텍스트 설명을 받습니다. AI 는 배가 무엇인지 파악하고, 그것을 검색하여 이미지를 찾은 다음, 이미지와 관련된 질문 (예: "이 배는 어떤 엔진을 사용하는가?") 에 답해야 합니다.
    • 비유: 숨겨진 물건에 대한 수수께끼를 받습니다. 수수께끼에 답하기 전에 먼저 그 물건을 찾아야 합니다.
  2. 레벨 2: "제어된 미로" 챌린지.

    • 과제: AI 는 지도가 있는 닫힌 방 (제어된 오프라인 데이터베이스) 에 있습니다. 텍스트 단서로 시작해 사진을 찾고, 그 사진이 새로운 단서를 제공하면 또 다른 사진을 찾는 식으로 이어집니다.
    • 비유: 빨간 문 사진 하나를 찾으면 파란 차에 대한 텍스트 단서로 이어지고, 그것이 다시 노란 새 사진으로 이어지는 보물찾기를 상상해 보세요. AI 는 문 사진을 보고 차를 찾아야 할지 결정해야 합니다. 만약 사진을 무시하고 텍스트만 계속 읽는다면 길을 잃게 됩니다.
  3. 레벨 3: "야생 인터넷" 챌린지.

    • 과제: 이제 AI 는 실제이고 messy 한 인터넷 세상으로 나갑니다. 단서를 검색하고, 사진을 찾으며, 일부 사진이 가짜이거나 관련이 없다는 것을 깨닫고, 서로 다른 경로들을 비교 (예: "이 영화는 60 분인가 90 분인가?") 하여 계속할 올바른 경로를 선택해야 합니다.
    • 비유: 이는 전 인터넷을 이용해 사건을 해결하려는 탐정과 같습니다. 그들은 나쁜 사진이 있는 사이트부터 잘못된 날짜가 기재된 사이트까지 수백만 개의 웹사이트를 분류해야 하며, 이미지에서 무엇을 보았는지에 따라 어떤 경로를 따라갈지 결정해야 합니다.

그들은 무엇을 발견했는가?

저자들은 GPT-5, Gemini, Claude 와 같은 가장 똑똑한 AI 모델들을 이 새로운 테스트에 적용했습니다.

  • 결과: AI 모델들은 현재 이 작업에 매우 서툴러습니다. 가장 뛰어난 모델들조차도 정답의 50% 미만만 맞췄습니다.
  • 문제점: AI 모델들은 텍스트를 읽는 데는 뛰어나고 단일 이미지를 보는 데도 뛰어납니다. 하지만 검색 중간에 발견된 사진이 전체 검색 계획을 바꿔야 할 때, 그 점들을 연결하는 데는 어려움을 겪습니다. 그들은 사진을 봐야 할 때 텍스트만 찾거나, 사진을 새로운 단서가 아닌 단순한 "최종 확인"으로만 취급하는 경우가 많습니다.

도구 상자 (InterLV-Agent)

모두가 동일한 규칙으로 플레이하도록 하기 위해, 저자들은 InterLV-Agent라는 표준 "게임 컨트롤러"를 구축했습니다. 이 도구를 통해 AI 는 웹 브라우저를 사용하고, 이미지를 검색하며, 이미지를 자르고, 지금까지 찾은 내용을 기록하는 "노트북" (기억) 을 유지할 수 있습니다. 이는 AI 가 실패했을 때, 그것이 퍼즐을 풀지 못해서인지, 아니면 올바른 도구가 없어서인지 명확히 구분할 수 있도록 보장합니다.

요약

간단히 말해, 이 논문은 다음과 같이 말합니다: "우리는 AI 탐정들을 위한 더 어렵고 새로운 테스트를 만들었습니다. 우리는 AI 가 점점 더 똑똑해지고 있지만, 검색 중간에 발견한 사진을 이용해 생각을 바꾸고 다음 단서를 찾는 데는 여전히 효과적으로 활용하지 못한다는 사실을 발견했습니다. 이는 지도를 읽고 사진을 볼 수는 있지만, 그 사진이 실제로는 다른 길을 가라고 알려주고 있다는 사실을 알아차리지 못하는 탐정처럼 보입니다."

저자들은 이 테스트와 도구들을 공개하여 다른 연구자들이 이러한 '교차 (interleaved)' 사고 방식을 더 잘 활용하는 AI 를 구축할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →