Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval
이 연구는 GPT-4.1 및 Claude Sonnet 4.6과 같은 프런티어 LLM들이 Flickr30k 데이터셋에서 구글의 네이티브 멀티모달 Gemini Embedding 2와 대등한 검색 성능을 달anim하는 반면, 후자는 사전 계산 가능한 임베딩 덕분에 저지연 애플리케이션에 있어 여전히 우위에 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 혼란스러운 건초더미 속에서 특정한 바늘 하나를 찾으려 한다고 상상해 보세요. 하지만 여기 반전이 있습니다. 그 바늘은 단순한 금속 조각이 아니라 하나의 '사진'이며, 당신은 그것을 단어로 설명하고 있습니다. 이것이 바로 컴퓨터 과학의 한 분야인 **멀티모달 검색(multimodal retrieval)**의 세계입니다. 기계가 이미지(보는 것)와 텍스트(읽는 것)를 연결하는 법을 배우는 영역이죠. 수년 동안 이를 수행하는 표준 방식은 두 개의 별도 '두뇌'를 구축하는 것이었습니다. 하나는 텍스트를 읽어 비밀 코드로 변환하는 두뇌이고, 다른 하나는 사진을 보고 또 다른 비밀 코드로 변환하는 두뇌입니다. 그런 다음 컴퓨터는 이 두 코드를 서로 맞추려고 시도하는데, 이는 마치 눈을 아주 세게 가늘게 뜨고 정사각형 못을 둥근 구멍에 억지로 끼워 맞추려는 것과 같습니다.
최근 이 영역에 두 가지 새로운 슈퍼 도구가 등장했습니다. 첫 번째는 **프런티어 거대 언어 모델(LLM)**입니다. 이들은 엄청나게 똑똑하고 모든 것을 알고 있는 사서라고 생각하면 됩니다. 이들은 25장의 사진과 하나의 문장을 보고, 즉시 모든 사진을 읽고 서로 비교하여 가장 적합한 것을 골라낼 수 있습니다. 두 번째는 **네이티브 멀티모달 임베딩(Natively Multimodal Embeddings)**입니다. 이들은 '이미지'와 '텍스트'라는 두 언어를 처음부터 유창하게 구사하는 만능 번역기와 같습니다. 두 개의 별도 두뇌가 서로 대화할 필요 없이, 모든 것을 하나의 통일된 비밀 코드로 변환합니다. 모두가 던지는 큰 질문은 이것입니다. 우리는 모든 사진을 읽고 서로 비교하는 초스마트 사서가 정말로 필요한가, 아니면 만능 번역기가 혼자서도 충분히 빠르고 정확하게 그 일을 해낼 수 있는가? 이 질문은 매우 중요합니다. 만약 사서가 너무 느리다면, 길을 걷는 동안 자신의 사진 갤러리를 검색하는 것과 같은 실시간 앱에는 사용할 수 없기 때문입니다.
이 논문은 Flickr30k라는 데이터셋을 사용하여 이 두 가지 접근 방식 사이의 고스란한 경주를 설정합니다. 이 데이터셋은 인간이 작성한 설명이 포함된 31,000장의 이미지를 담고 있습니다. 이 경주를 진정으로 공정하고 어렵게 만들기 위해, 연구진은 단순히 무작위 사진을 모델에 던져준 것이 아닙니다. 그들은 똑똑한 시스템조차 속이도록 설계된, 정답과 매우 유사해 보이지만 미세하게 틀린 '하드 네거티브(hard negatives)' 사진들을 만들어냈습니다. 연구진은 네 명의 헤비급 선수들을 테스트했습니다: 만능 번역기인 Gemini Embedding 2와 Amazon Nova 2를 대상으로, 초스마트 사서인 GPT-4.1 및 Claude Sonnet 4.6과 대결시켰습니다.
결과는 속도광들에게는 충격적이었지만, 정확도 중시파들에게는 안도감을 주었습니다. 정답을 맞히는 데 있어서는 만능 번역기와 초스마트 사서가 막상막하였습니다. 연구 결과, Gemini Embedding 2, GPT-4.1, 그리고 Claude Sonnet 4.6은 통계적으로 동일한 성능을 보였습니다. 그들은 너무나 비슷해서 정확도만으로는 구분할 수 없었으며, 이 모델들 모두 까다로운 시나리오에서 약 80%의 확률로 올바른 이미지를 찾아냈습니다. 이 논문은 사서들이 압도적으로 우월하다는 생각을 명시적으로 부정하며, 새로운 임베딩 모델들이 건초더미 속에서 올바른 바늘을 찾는 데 있어 그들만큼이나 날카롭다는 것을 보여주었습니다. 그러나 한 모델, Amazon Nova 2는 뒤처졌는데, 정답을 맞히는 빈도가 약 13퍼센트 포인트 낮았습니다. 이는 아마도 이 모델이 이 특정 유형의 이미지 검색보다는 일반적인 작업들을 위해 설정되었기 때문일 것입니다.
하지만 진짜 이야기는 누가 정확도 경주에서 이겼느냐가 아니라, 누가 마라톤을 완주하느냐에 있습니다. 여기서 두 접근 방식은 극명하게 갈립니다. 초스마트 사서(LLM)들은 매 질문마다 그룹 내의 모든 사진을 살펴봐야 합니다. 연구진은 이를 측정했으며, 1,000개의 쿼리를 순위를 매기는 데 GPT-4.1은 6,100초 이상, Claude Sonnet 4.6은 9,415초 이상이 걸린다는 것을 발견했습니다. 이는 몇 시간의 기다림을 의미합니다. 반면, 만능 번역기(임베딩 모델)는 다르게 작동합니다. 이들은 도서관에 발을 들이기도 전에 모든 책에 바코드를 찍어두는 것처럼, 모든 사진의 비밀 코드를 미리 계산해 둘 수 있습니다. 일단 이 '사전 계산(pre-computation)'이 완료되면, 1,000개의 쿼리에 대한 적절한 사진을 찾는 데 걸리는 시간은 2초 미만이었습니다.
저자들은 초스마트 사서들이 추론과 이미지 간의 상호 비교에는 뛰어나지만, 즉각적인 실행이 필요한 모든 일에는 만능 번역기가 명백한 승자라고 결론짓습니다. 만약 사용자가 눈 깜짝할 사이에 방대한 이미지 컬렉션을 검색해야 하는 앱을 만들고 있다면, 임베딩 모델이 더 나은 선택입니다. 사서들은 사진 컬렉션이 매초 바뀌거나 규모가 매우 작아서 사전 계산 단계가 무용지물인 경우에 여전히 유용할 수 있지만, 속도와 규모의 측면에서는 새로운 임베딩 모델이 거인들의 정확도에 필적하면서도 천 배 더 빠르게 달릴 수 있음을 입증했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.