← 최신 논문
💻 computer science

Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs

본 논문은 증류된 크로스 인코더가 높은 신뢰도의 매칭을 해결하고 에이전트 기반 시각-언어 모델이 모호한 사례를 처리하는 캐스케이드 아키텍처를 채택하여, 계산 비용과 인간의 주석 요구 사항을 최소화하면서도 커버리지를 극대화하는 확장 가능하고 비용 효율적인 상품 연결 시스템을 제시한다.

원저자: Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인터넷이라는 거대하고 혼란스러운 시장에서, 수백만 명의 독립적인 판매자들은 서로 다른 이름, 서로 다른 사진, 때로는 누락되거나 혼란스러운 세부 정보를 사용하여 동일한 품목을 등록합니다. 특정 브랜드의 커피 메이커와 같은 단일 제품이 카탈로그에 수천 번씩 등장할 수 있으며, 각 항목은 마지막 모습과 조금씩 다를 수 있습니다. 검색 엔진과 추천 시스템을 구동하는 컴퓨터들에게 이는 혼란스러운 안개를 형성합니다. 만약 시스템이 서로 다른 두 개의 리스팅이 실제로는 동일한 아이템이라는 것을 인식하지 못한다면, 리뷰를 통합하거나 판매량을 추적하거나 적절한 고객에게 제품을 보여줄 수 없습니다. "제품 연결(product linking)"의 목표는 이 안개를 걷어내고, 선반 위의 모든 아이템에 대해 단 하나의 올바른 정체성을 찾아내기 위해 소음 속을 분류하는 디지털 사서 역할을 하는 것입니다. 이것은 단순히 조직화의 문제가 아니라, 온라인 상점이 자신들이 무엇을 팔고 있는지 이해하는 기초입니다.

도어대시(DoorDash)의 연구진은 비용을 과도하게 들이지 않으면서도 수십억 개의 기록을 처리하며 이 문제를 거대한 규모로 해결할 수 있는 새로운 시스템을 구축했습니다. 그들은 모든 아이템을 똑같은 방식으로 취급하는 것이 자원 낭비라는 점을 깨달았습니다. 어떤 아이들은 이름과 코드가 완벽하게 일치하여 식별하기 쉽지만, 어떤 아이들은 쌍둥이가 되어 헤어진 것처럼 구별하기 위해 깊은 조사가 필요합니다. 모든 아이템을 확인하기 위해 강력하고 비싼 컴퓨터 두뇌를 사용하는 대신, 그들은 정말 필요할 때만 더 많은 노력을 기울이는 3단계 프로세스를 만들었습니다. 먼저, 시스템은 가능성이 높은 일치 목록으로 범위를 빠르게 좁힙니다. 그다음, 빠르고 가벼운 컴퓨터 프로그램이 이 쌍들을 확인합니다. 일치가 명백하면 시스템은 즉시 이를 수용합니다. 일치가 명백히 틀리면 이를 거부합니다. 하지만 프로그램이 확신하지 못하면, 이 어려운 사례를 더 발전된 인공지능 에이전트에게 전달합니다.

이 발전된 에이전트는 새로운 발견의 핵심입니다. 텍스트만 읽는 빠른 프로그램과 달리, 이 에이전트는 제품 사진을 볼 수 있으며 결정적으로 인터넷을 검색하여 추가적인 단서를 찾을 수 있습니다. 시스템이 이름은 비슷하지만 세부 정보가 모호한 혼란스러운 제품 쌍을 마주했을 때, 에이전트는 탐정처럼 행동합니다. 그것은 냄비 사진을 보고 이것이 무쇠로 만들어졌는지 스테인리스 스틸로 만들어졌는지 확인할 수도 있고, 바코드 번호를 사용하여 웹을 검색해 제조사의 공식 설명을 찾아낼 수도 있습니다. 원래의 기록 외부에서 증거를 수집하는 이 능력은 단순한 텍스트 매칭 도구가 해결하지 못할 사례들을 해결할 수 있게 해줍니다. 연구진은 이러한 "에스컬레이션(escalation)" 전략을 사용함으로써, 저렴하고 빠른 도구들만 사용했을 때 달성할 수 있었던 68%에서 크게 도약하여 거의 77%의 모든 제품을 자동으로 연결할 수 있었다는 것을 발견했습니다.

연구진은 또한 이러한 시스템을 훈련시키는 방법에 대한 놀라운 진실을 발견했습니다. 수백만 개의 사례를 라벨링하기 위해 수천 명의 사람을 고용하는 대신, 그들은 두 가지 서로 다른 고급 인공지능 모델을 사용하여 동일한 아이템을 채점했습니다. 그들은 두 모델이 모두 동의하는 답변만을 유지하여 매우 신뢰할 수 있는 훈련 데이터를 만들었습니다. 이 방법은 빠르고 가벼운 프로그램을 비싸고 느린 모델과 동일한 확신을 가지고 결정을 내릴 수 있도록 가르쳐 주었으며, 비용은 훨씬 적게 들었습니다. 또한 그들은 바코드의 원시 숫자를 시스템에 입력하는 것이 미리 만들어진 "일치" 또는 "불일치" 플래그를 주는 것보다 더 효과적이라는 것을 발견했는데, 이는 컴퓨터가 스스로 부분적인 일치와 오류를 학습할 수 있기 때문입니다. 그러나 바코드에 너무 의존하면 두 개의 서로 다른 제품이 우연히 동일한 코드를 공유할 때 실수가 발생할 수 있으므로 주의해야 했습니다. 그들은 바코드가 일치할 때마다 제품 이름을 재확인하도록 시스템을 가르침으로써, 드문 오류에 속지 않도록 해결했습니다.

빠른 필터와 스마트한 웹 검색 에이전트를 결합함으로써, 연구진은 정확하면서도 경제적인 시스템을 만들었습니다. 그들은 비용이 많이 드는 폐쇄형 인공지능을 실행 비용이 약 7분의 1 수준인 자체 호스팅 버전으로 교체하면서도 높은 정확도를 유지했습니다. 이 접근 방식은 온라인 마켓플레이스가 카탈로그를 더욱 철저하게 정리하여, 고객이 중복된 항목들의 흩어진 덩어리가 아닌 모든 제품에 대한 단일하고 명확한 항목을 볼 수 있도록 보장합니다. 결과적으로, 이는 세상의 물건들을 조직하는 더 스마트하고 효율적인 방법이며, 때로는 거대한 문제를 해결하는 최선의 방법이 모든 못에 가장 큰 망치를 사용하는 것이 아니라, 언제 전문가를 불러야 할지를 아는 것임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →