तकनीकी सारांश: वेब-स्केल सर्च के लिए विजन-लैंग्वेज मॉडल्स के साथ प्रासंगिकता मापन को उन्नत करना
समस्या विवरण
Pinterest जैसे व्यक्तिगत खोज (personalized search) सिस्टम में, यह सुनिश्चित करना कि खोज परिणाम उपयोगकर्ता के इरादे (सिमेंटिक रेलेवेंस) के अनुरूप हों, अत्यंत महत्वपूर्ण है। जबकि उपयोगकर्ता जुड़ाव मेट्रिक्स (क्लिक, सेव) आसानी से एकत्र किए जा सकते हैं, वे अक्सर स्थिति पूर्वाग्रह (position bias), प्रस्तुति प्रभाव और ध्यान (attention) जैसे भ्रमित करने वाले कारकों के कारण वास्तविक सिमेंटिक प्रासंगिकता को दर्शाने में विफल रहते हैं। फलस्वरूप, ऑनलाइन A/B प्रयोगों में प्रासंगिकता मूल्यांकन एक आवश्यक "गार्डरेल" के रूप में कार्य करता है ताकि उन ट्रेड-ऑफ्स का पता लगाया जा सके जहाँ जुड़ाव (engagement) तो बढ़ सकता है लेकिन प्रासंगिकता घट सकती है।
पारंपरिक रूप से, प्रासंगिकता मूल्यांकन मानव एनोटेशन (human annotation) पर निर्भर करता है। हालाँकि, यह दृष्टिकोण उच्च लागत, लंबे टर्नअराउंड समय और सीमित स्केलेबिलिटी से बाधित है। ये बाधाएं ऐसे माप डिजाइनों को मजबूर करती हैं जिनमें सैंपल साइज छोटा होता है, जो केवल बड़े मेट्रिक बदलावों को ही पकड़ पाते हैं और सूक्ष्म या विषम उपचार प्रभावों (heterogeneous treatment effects) या छोटे, सार्थक सुधारों को पहचानने में विफल रहते हैं। यह शोध पत्र एक स्केलेबल, लागत प्रभावी और विश्वसनीय स्वचालित प्रासंगिकता मूल्यांकन प्रणाली की आवश्यकता को संबोधित करता है जो वेब-स्केल पर कार्य कर सके।
कार्यप्रणाली (Methodology)
1. फाइन-ट्यून्ड विजन-लैंग्वेज मॉडल्स (VLMs)
लेखक एक एंड-टू-एंड पाइपलाइन का प्रस्ताव करते हैं जो ऑटोमेटेड प्रासंगिकता लेबलिंग के लिए फाइन-ट्यून्ड ओपन-सोर्स विजन-लैंग्वेज मॉडल्स (विशेष रूप से Qwen3-VL श्रृंखला) का उपयोग करती है।
- इनपुट प्रतिनिधित्व (Input Representation): मॉडल एक मल्टीमॉडल इनपुट को प्रोसेस करता जिसमें सर्च क्वेरी टेक्स्ट, पिन इमेज (Pin image), और व्यापक टेक्स्टुअल मेटाडेटा (पिन टाइटल/डिस्क्रिप्शन, लैंडिंग पेज टाइटल/डिस्क्रिप्शन, बोर्ड टाइटल्स, और ऐतिहासिक रूप से उच्च-जुड़ाव वाली क्वेरीज) शामिल हैं।
- प्रशिक्षण (Training): मॉडल को लगभग 0.8 मिलियन मानव-एनोटेटेड क्वेरी-पिन जोड़ों पर एक 5-स्तरीय रेटिंग स्केल (अत्यधिक प्रासंगिक से अत्यधिक अप्रासंगिक) का उपयोग करके फाइन-ट्यून किया गया है। इसका उद्देश्य क्रॉस-एन्ट्रॉपी लॉस को कम करके प्रासंगिकता स्कोर (1–5) की भविष्यवाणी करना है।
- अनुमान (Inference): मॉडल आउटपुट लॉजिट्स (logits) पर आर्गमैक्स (argmax) के माध्यम से एक अनुमानित प्रासंगिकता स्तर आउटपुट करता है। सिस्टम कई भाषाओं का समर्थन करने के लिए Qwen3-VL की क्रॉस-लिंगुअल क्षमताओं का लाभ उठाता है।
2. स्ट्रैटिफाइड सैंपलिंग डिज़ाइन (Stratified Sampling Design)
VLMs द्वारा प्रदान की गई लेबलिंग लागत और समय में कमी, सरल रैंडम सैंपलिंग से एक अधिक परिष्कृत स्ट्रैटिफाइड क्वेरी सैंपलिंग डिज़ाइन की ओर बढ़ने में सक्षम बनाती है।
- तर्क (Rationale): प्रासंगिकता का विचरण (variance) मुख्य रूप से क्वेरीज के बीच के अंतर (इरादा, सामग्री की गुणवत्ता, इन्वेंट्री गहराई) द्वारा संचालित होता है। स्ट्रैटिफिकेशन इस विचरण संरचना को लक्षित करता है।
- कार्यान्वयन (Implementation): क्वेरीज को रुचि श्रेणियों (interest categories) और लोकप्रियता खंडों (Head, Torso, Tail, Single) के आधार पर स्ट्रैटिफाई किया जाता है।
- सांख्यिकीय लाभ: "बिटवीन-स्ट्रेटा" (between-strata) विचरण घटक को समाप्त करके, स्ट्रैटिफाइड सैंपलिंग सैंपल मीन के विचरण को महत्वपूर्ण रूप से कम करती है। यह सीधे तौर पर मिनिमम डिटेक्टेबल इफेक्ट (MDE) को कम करता है, जिससे सिस्टम रैंकिंग प्रदर्शन में छोटे, सार्थक बदलावों का पता लगा सकता है।
- तुलना: लेखक नोट करते हैं कि CUPED जैसी वैकल्पिक विचरण न्यूनीकरण तकनीकें यहाँ कम उपयुक्त हैं क्योंकि Pinterest की इन्वेंट्री की गतिशील प्रकृति और प्री-ट्रीटमेंट कोवेरिएट्स की आवश्यकता के कारण, जो सामान्यीकरण (generalizability) से समझौता कर सकती हैं या डबल एनोटेशन लागत बढ़ा सकती है।
3. प्रासंगिकता मापन पाइपलाइन (Relevance Measurement Pipeline)
A/B प्रयोगों के लिए मूल्यांकन पाइपलाइन में शामिल हैं:
- सैंपलिंग: कंट्रोल और ट्रीटमेंट समूहों के बीच क्वेरी अंतर को ब्लॉक करने के लिए युग्मित (paired) सर्च क्वेरीज का चयन करना।
- लेबलिंग: फाइन-ट्यून्ड VLM प्रत्येक क्वेरी के लिए शीर्ष K (25 पर सेट) सर्च परिणामों के लिए प्रासंगिकता लेबल उत्पन्न करता है।
- मेट्रिक गणना: सिस्टम प्रत्येक क्वेरी के लिए $sDCG@K(एकnDCG@K$ का वेरिएंट, जो अत्यधिक प्रासंगिक दस्तावेजों की अनंत आपूर्ति मानता है) की गणना करता है और प्रयोग-स्तरीय मेट्रिक्स प्राप्त करने के लिए इन्हें एकत्रित करता है।
- विश्लेषण: स्ट्रेटा के माध्यम से विषमलक्षी उपचार प्रभावों (heterogeneous treatment effects) का विश्लेषण किया जाता है, जिसमें बेन्जामिनी-होचबर्ग प्रक्रिया के माध्यम से फॉल्स डिस्कवरी रेट को नियंत्रित किया जाता है।
मुख्य परिणाम
मानव निर्णयों के साथ संरेखण (RQ1)
सिस्टम को मानव एनोटेशन के विरुद्ध कड़ाई से सत्यापित किया गया था:
- सटीकता (Accuracy): VLM और मानव लेबल के बीच सटीक मिलान दर 82.9% है, और 94.2% रेटिंग एक बिंदु से अधिक के अंतर पर है।
- सहमति (Agreement): क्वाड्रेटिक वेटेड कप्पा (QWK) 0.507 है, जो अच्छा ऑर्डिनल एग्रीमेंट दर्शाता है।
- रैंक सहसंबंध (Rank Correlation): केंडल का τ 0.534 है और स्पीयरमैन का ρ 0.668 है, जो मजबूत रैंकिंग संरेखण दिखाता है।
- त्रुटि मेट्रिक्स: सभी लोकप्रियता खंडों में क्वेरी-स्तरीय $sDCG@K$ में औसत त्रुटि 0.03 के भीतर रहती है। महत्वपूर्ण रूप से, पेयर्ड डिफरेंस एरर (जो A/B टेस्टिंग में उपयोग किया जाता है) का परिमाण नगण्य है, जो सिंगल-ग्रुप एरर्स में देखे गए मामूली सकारात्मक पूर्वाग्रह को समाप्त करता है। यह VLM लेबल बायस के विरुद्ध युग्मित प्रायोगिक डिज़ाइन की मजबूती की पुष्टि करता है।
- मॉडल चयन: हालांकि Qwen3-VL-8B ने 4B वेरिएंट के समान प्रदर्शन किया, लेकिन Qwen3-VL-4B को इसके टाइट एरर डिस्ट्रीब्यूशन और कम कम्प्यूटेशनल लागत के कारण उत्पादन (production) के लिए चुना गया। इसने टेक्स्ट-ओनली XLM-RoBERTa बेसलाइन की तुलना में, विशेष रूप से विचरण न्यूनीकरण में, काफी बेहतर प्रदर्शन किया।
मेट्रिक संवेदनशीलता और दक्षता (RQ2)
स्ट्रैटिफाइड सैंपलिंग के साथ VLM-आधारित लेबलिंग में संक्रमण से प्रयोगात्मक संवेदनशीलता में पर्याप्त सुधार हुआ:
- MDE में कमी: मिनिमम डिटेक्टेबल इफेक्ट (MDE) 1.3%–1.5% की सीमा से घटकर ≤0.25% हो गया, जो संवेदनशीलता में 6 गुणा सुधार को दर्शाता है।
- विचरण न्यूनीकरण (Variance Reduction): केवल स्ट्रैटिफिकेशन ने समान सैंपल साइज (n=2000) के साथ सरल रैंडम सैंपलिंग की तुलना में मेट्रिक विचरण (σ^) को 52% कम कर दिया। जब स्ट्रैटिफिकेशन को बढ़े हुए सैंपल साइज (n=5000) के साथ जोड़ा गया, तो कुल विचरण न्यूनीकरण 67% तक पहुँच गया।
- परिचालन दक्षता (Operational Efficiency):
- टर्नअराउंड समय: 20 गुना से अधिक सुधरा (2 दिन से 2 घंटे तक)।
- लागत: प्रति-लेबल लागत में 99.98% की कमी आई (\0.10से2 \times 10^{-5}$ तक)।
- स्केल: सिस्टम अब पहले की तुलना में 4 गुना अधिक प्रासंगिकता मापन कार्य संभाल सकता है, जिससे अधिक व्यापक और बार-बार मूल्यांकन संभव हो गया है।
बहुभाषी प्रदर्शन (RQ3)
सिस्टम को गैर-अंग्रेजी बाजारों (फ्रांस, जर्मनी, ब्राजील) में सत्यापित किया गया था। हालांकि अंग्रेजी बाजारों की तुलना में रैंक सहसंबंध थोड़े कम थे, फिर भी वे मध्यम-से-मजबूत बने रहे। पेयर्ड डिफरेंस एरर शून्य के आसपास मजबूती से केंद्रित रहे, जो यह दर्शाता है कि प्रशिक्षण डेटा मुख्य रूप से अंग्रेजी होने के बावजूद यह दृष्टिकोण गैर-अंग्रेजी क्वेरीज के लिए प्रभावी रूप से सामान्यीकृत होता है।
महत्व और योगदान
यह शोध पत्र दावा करता है कि इसका प्राथमिक महत्व Pinterest के लाइव, उद्योग-स्तर के A/B एक्सपेरिमेंटेशन सिस्टम के भीतर एक VLM-आधारित प्रासंगिकता मूल्यांकन पाइपलाइन के एंड-टू-एंड डिज़ाइन और परिनियोजन (deployment) में निहित है। पिछले शैक्षणिक कार्यों के विपरीत जो मॉडल आर्किटेक्चर या प्रॉम्प्टिंग रणनीतियों पर ध्यान केंद्रित करते हैं, यह कार्य एक उत्पादन वातावरण में फाइन-ट्यून्ड VLMs द्वारा मानव एनोटेशन को बदलने की व्यावहारिक व्यवहार्यता को प्रदर्शित करता है।
मुख्य योगदानों में शामिल हैं:
- प्रोडक्शन परिनियोजन: एक सत्यापित पाइपलाइन जो फाइन-ट्यूनिंग से लेकर ऑनलाइन A/B टेस्टिंग तक व्यावहारिक पहलुओं को कवर करती है, जिसे लेखक एक उद्योग-स्तर के सर्च सिस्टम में इस समस्या को व्यापक रूप से संबोधित करने वाला पहला कार्य बताते हैं।
- प्रायोगिक संवेदनशीलता: यह प्रदर्शित करना कि VLM-आधारित मूल्यांकन विस्तारित क्वेरी सेट और परिष्कृत सैंपलिंग डिज़ाइन को सक्षम बनाता है, जिससे 6× MDE में कमी और प्रासंगिकता बदलावों का बेहतर पता लगाने में मदद मिलती है।
- विश्वसनीयता: यह सिद्ध करना कि फाइन-ट्यून्ड VLMs मानव निर्णयों के साथ निकटता से संरेखित मेट्रिक्स उत्पन्न करते हैं, जिसमें पेयर्ड डिफरेंस में कम पूर्वाग्रह है, जिससे वे उच्च-जोखिम वाले निर्णय लेने के लिए मानव लेबलिंग के एक विश्वसनीय विकल्प बन जाते हैं।
लेखक निष्कर्ष निकालते हैं कि यह दृष्टिकोण उन उद्योग पेशेवरों को व्यावहारिक अंतर्दृष्टि प्रदान करता है जो प्रासंगिकता मापन की दक्षता और संवेदनशीलता में सुधार करना चाहते हैं, साथ ही यह भी उल्लेख करते हैं कि भविष्य का कार्य व्यापक मल्टीमॉडल सर्च सेटिंग्स में इन क्षमताओं का विस्तार करने और गैर-अंग्रेजी बाजारों में प्रदर्शन के अंतर को और कम करने पर केंद्रित होगा।