← 최신 논문
💻 computer science

FreeRet: MLLMs as Training-Free Retrievers

FreeRet 는 후보 검색을 위해 의미적으로 기반된 임베딩을 생성하고 정밀한 재순위를 위해 내재된 추론 능력을 활용함으로써 오프더셸 멀티모달 대규모 언어 모델 (MLLM) 을 강력한 2 단계 검색기로 활용하는 학습이 필요 없는 플러그앤플레이 프레임워크로, 추가적인 미세 조정이 필요 없이 과도하게 훈련된 모델들을 능가합니다.

원저자: Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, Limin Wang

게시일 2026-05-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, Limin Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수백만 권의 책을 읽고 수많은 이미지를 본 천재적이고 독서량이 풍부한 사서가 있다고 가정해 봅시다. 이 사서는 매우 똑똑하여 복잡한 이야기를 이해할 뿐만 아니라 새로운 이야기까지 쓸 수 있습니다. 하지만 전통적으로 이 사서를 검색 엔진(질문에 기반하여 특정 항목을 찾는 역할) 으로 활용하려면, 가혹하고 비용이 많이 드는 수년의 재교육을 시켜야 했습니다. 즉, 그들에게 특정 "검색 규칙"을 암기하게 하고, 자연스럽게 "대화"하고 "생각"하는 능력을 무시하도록 강요해야 했습니다.

FreeRet이라는 논문은 다음과 같은 간단한 질문을 던집니다: 사서를 전혀 재교육하지 않아도 될까요? 그들의 기존 지능을 활용해 검색 작업을 수행하도록 요청할 수는 없을까요?

다음은 이를 세 가지 간단한 단계로 설명한 방법입니다:

1. "최종 필터" 문제 (어휘화 계층 생략)

비유: 사서가 복잡한 책을 요약하려고 한다고 상상해 보세요. 그들은 책의 깊은 의미를 완벽하게 이해합니다. 하지만 말하기 직전에, 그들의 생각을 "번역기"를 통과시켜야 합니다. 이 번역기는 사전과 일치하도록 "고양이", "달리다", "행복" 같은 단순하고 흔한 단어만 사용하도록 강요합니다. 이 번역기는 말하기에는 훌륭하지만, 책의 깊고 미묘한 의미를 망쳐버립니다.

해결책: 논문은 AI 의 뇌 마지막 부분 (최종 MLP 계층) 이 바로 이런 번역기 역할을 한다고 발견했습니다. 이 계층은 AI 가 깊은 의미보다는 단순한 단어 매칭에 집중하도록 강요합니다.

  • FreeRet 의 트릭: 그들은 AI 에게 이 최종 번역기를 건너뛰도록 지시합니다. 단순한 단어로 강제되기 의 "생각"을 가져옵니다. 이는 이미지나 텍스트에 대한 훨씬 더 풍부하고 정확한 "요약"을 제공하여, 코드 한 줄도 변경하지 않고도 초기 검색을 훨씬 더 똑똑하게 만듭니다.

2. "모호한 요약" 문제 (제어된 생성)

비유: 똑똑한 사람에게 "이 그림을 한 단어로 요약해 보세요"라고 요청하면, 그들은 "물건"이나 "것"이라고 답할 수 있습니다. 기술적으로는 단어이지만, 나중에 올바른 그림을 찾는 데는 쓸모가 없습니다. 또는 "성장"이라고 답할 수도 있습니다 (이미지의 잘못된 부분에 집중하는 경우).

해결책: 논문은 단순히 "한 단어"를 요청하는 것은 너무 느슨하다는 것을 깨달았습니다.

  • FreeRet 의 트릭: AI 가 말하기 전에 엄격한 일련의 지침 (프롬프트) 을 제공합니다. *"이미지와 텍스트를 보고 주요 의미를 포착하세요. 'the'나 'is' 같은 작은 단어는 사용하지 마세요. 주제에 집중하세요."*라고 말합니다.
  • 이러한 구체적인 규칙을 제공함으로써, AI 는 실제로 올바른 매칭을 찾는 데 도움이 되는 훨씬 더 정확한 "한 단어" 요약을 생성합니다.

3. "프레임 효과" 문제 (재순위화 트릭)

비유: 당신이 피의자의 유무를 판단하는 판사라고 상상해 보세요.

  • "피의자가 옳은가 아니면 틀린가?"라고 묻는다면, 도덕적 판단처럼 들리기 때문에 "옳다"라고 말해야 한다는 도덕적 압박감을 느낄 수 있습니다.
  • "피의자가 참인가 아니면 거짓인가?"라고 묻는다면 더 중립적으로 느낄 수 있습니다.
  • 논문은 의미가 동일하더라도 질문하는 방식에 따라 AI 의 답변이 달라진다는 것을 발견했습니다. 이를 "프레임 효과"라고 합니다.

해결책: 논문은 AI 에게 단순히 "예" 또는 "아니오"라고 말하게 하는 것은 편향을 초래한다는 것을 발견했습니다.

  • FreeRet 의 트릭: 그들은 질문을 **객관식 문제 (MCQ)**로 바꿉니다. "관련성이 있는가?"라고 묻는 대신, *"후보가 질의와 일치합니까? A. 예, 일치합니다. B. 아니오, 일치하지 않습니다."*라고 묻습니다.
  • 이 형식은 AI 가 훈련 데이터에서 수백만 번 본 것입니다. 이는 AI 가 "예"나 "틀린" 같은 단어의 감정적 무게를 무시하고 중립적인 판사처럼 행동하게 만들어, 훨씬 더 정확한 최종 결과를 이끌어냅니다.

결과: "플러그 앤 플레이" 슈퍼 검색 엔진

이 논문은 MMEB(이미지 찾기부터 비디오 질문 답변까지 36 가지 유형의 검색 작업을 포함) 라는 대규모 벤치마크에서 이를 테스트했습니다.

  • 놀라운 사실: 훈련 데이터 0 개추가 비용 0을 사용한 그들의 방법인 FreeRet수백만 개의 예제로 훈련된 모델들을 능가했습니다.
  • 장점: 모델을 재교육하지 않았기 때문에, AI 는 원래의 모든 초능력을 유지합니다. 여전히 대화하고, 이야기를 쓰며, 복잡한 주제에 대해 추론할 수 있습니다. "검색 봇"과 "똑똑한 비서" 사이에서 선택할 필요가 없습니다. FreeRet 은 동일한 모델이 두 가지 작업을 모두 완벽하게 수행하게 합니다.

간단히 말해: FreeRet 은 똑똑한 AI 모델에게 검색 방법을 배우도록 강요할 필요가 없음을 보여줍니다. 우리는 단지 그들에게 올바른 질문을 하고, 기존에 훈련된 뇌를 활용해 일을 하도록 하면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →