← 최신 논문
🤖 machine learning

Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

본 논문은 핀터레스트 검색(Pinterest Search)에 배포되어 인간의 주석과 일치함으로써 온라인 A/B 실험에서의 측정 효율성을 크게 개선하고, 쿼리 커버리지를 확장하며, 최소 탐지 가능 효과(Minimum Detectable Effects)를 줄이는 시각-언어 모델(VLM) 기반의 자동화된 관련성 평가 파이프라인을 제시한다.

원저자: Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

게시일 2026-08-04
📖 2 분 읽기☕ 가벼운 읽기

원저자: Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신의 생각에 따라 매초 스스로 재배치되는 선반들이 있는 거대하고 끝없는 도서관을 걷고 있다고 상상해 보십시오. 이것이 바로 수십억 개의 디지털 아이템 속에서 사람들이 정확히 필요로 하는 것을 찾도록 돕는 데 전념하는 컴퓨터 과학 분야인 현대 웹 검색의 세계입니다. 오랫동안, 사서(또는 컴퓨터 알고리즘)가 일을 잘하고 있는지 알 수 있는 유일한 방법은 모든 책의 추천 항목을 확인하기 위해 인간 독자 팀을 고용하는 것이었습니다. 그들은 제목을 읽고, 사진을 보고, 다음과 같이 결정했습니다. "이것이 정말로 그 사람이 요청한 것인가?" 하지만 인간은 지치기 마련이고, 시간이 너무 오래 걸리며, 모든 것을 확인하기 위해 충분한 인원을 고용하는 데는 엄청난 비용이 듭니다. 최근 과학자들은 '시각-언어 모델(Vision-Language Model, VLM)'이라는 새로운 종류의 "슈퍼 독자"를 발견했습니다. 이것들을 텍스트를 읽는 동시에 이미지를 볼 수 있고, 인간처럼 이미지 뒤에 숨겨진 이야기를 이해할 수 있는 AI 탐정이라고 생각하십시오. 모두가 던지는 큰 질문은 이것입니다. 이 AI 탐정들이 인간 독자의 역할을 수행할 만큼 신뢰받을 수 있는지, 그리고 만약 그렇다면, 우리가 더 나은 검색 엔진을 만드는 데 도움이 될 만큼 충분히 빠를 것인가 하는 점입니다.

Pinterest 팀의 이 논문은 그들이 어떻게 AI 탐정에게 검색 결과를 채점하도록 가르쳤는지, 그리고 그것이 기존 방식보다 더 효과적임을 어떻게 증명했는지에 대한 이야기를 들려줍니다. 그들은 AI가 사용자의 검색 질문, 아이템(핀이라 불리는)의 사진, 그리고 그것을 설명하는 모든 텍스트를 살펴본 뒤, 그것이 얼마나 관련성이 있는지 1점에서 5점 사이의 점수를 부여하는 시스템을 구축했습니다. 팀은 이 AI가 인간 심사위원과 약 83%의 일치율을 보이며 놀라울 정도로 정확하며, 거의 항상 인간의 점수와 1점 이내의 차이를 유지한다는 것을 발견했습니다. 하지만 진짜 마법은 단순히 AI가 뛰어나다는 점이 아니라, 그것이 번개처럼 빠르다는 점에 있습니다. 인간 팀이 한 묶음의 검색 결과를 라벨링하는 데 이틀이 걸릴 수 있는 반면, AI는 단 두 시간 만에 이를 해냅니다. AI가 훨씬 빠르고 저렴하기 때문에, 팀은 작고 무작위적인 샘플의 검색 결과만을 사용하는 대신 훨씬 더 스마트하고 조직적인 샘플링 방법을 사용하기 시작할 수 있었습니다. 이러한 변화를 통해 그들은 이전에는 보이지 않았던 검색 품질의 미세한 개선 사항들을 포착할 수 있었습니다. 이 AI 기반 시스템으로 전환함으로써, 그들은 "최소 검출 가능 효과(Minimum Detectable Effect)"—우리가 신뢰성 있게 측정할 수 있는 가장 작은 변화—를 6배 줄였습니다. 이는 이제 그들이 검색 엔진이 작동하는 방식의 미묘하고 의미 있는 변화를 포착하여, 느린 인간의 확인 작업에 돈과 시간을 낭비하지 않고도 사용자가 정확히 찾고 있는 것을 찾을 수 있도록 보장할 수 있음을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →