← नवीनतम पेपर
🤖 AI

AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

यह शोध पत्र AutoRelAnnotator का प्रस्ताव करता है, जो एक लागत-कुशल प्रणाली है जो प्रायोजित खोज (sponsored search) के लिए बड़े पैमाने पर उच्च गुणवत्ता वाले प्रासंगिकता एनोटेशन (relevance annotations) उत्पन्न करने के लिए डोमेन-विशिष्ट फाइन-ट्यूनिंग, एक कैस्केडिंग आर्किटेक्चर और प्रति-वर्ग आइसोटोनिक अंशांकन (per-class isotonic calibration) को जोड़ता है, जिसने सफलतापूर्वक 15 करोड़ से अधिक क्वेरीज़ को संसाधित किया है और मानव लेबलिंग लागत एवं कंप्यूट खर्चों को काफी कम कर दिया है।

मूल लेखक: Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल ऑनलाइन स्टोर चलाते हैं, जैसे कि वॉलमार्ट। हर बार जब कोई ग्राहक कोई सर्च क्वेरी (जैसे "running shoes") टाइप करता है, तो आपके कंप्यूटर को यह तय करना होता है कि कौन से उत्पाद सबसे अधिक प्रासंगिक (relevant) हैं जिन्हें दिखाया जाना चाहिए। इस निर्णय को लेने के लिए, कंप्यूटर को उदाहरणों से सीखने की आवश्यकता होती है। लेकिन कंप्यूटर को कौन सिखाता है? इंसान।

समस्या यह है कि लाखों सर्च परिणामों को लेबल करने के लिए इंसानों को काम पर रखना बहुत धीमा (जिसमें कई दिन लगते हैं) और महंगा (जिसमें लाखों डॉलर का खर्च आता है) है। दूसरी ओर, लेबलिंग करने के लिए शानदार, महंगे AI मॉडल (जैसे GPT-4) का उपयोग करना तेज़ तो है, लेकिन वे आपके विशिष्ट स्टोर के उत्पादों को समझने में बहुत अच्छे नहीं हैं, जिससे गलतियाँ हो सकती हैं।

इस पेपर के लेखक, जो वॉलमार्ट ग्लोबल टेक से हैं, ने इस समस्या को हल करने के लिए AutoRelAnnotator नामक एक स्मार्ट सिस्टम बनाया है। इसे सर्च परिणामों को लेबल करने के लिए एक अत्यधिक कुशल "ट्राइएज सिस्टम" (Triage System) के रूप में समझें।

यह कैसे काम करता है, इसे सरल अवधारणाओं में नीचे दिया गया है:

1. "वन-साइज़-फिट्स-ऑल" AI के साथ समस्या

कल्पना कीजिए कि आपके पास विशेषज्ञों की एक टीम है। यदि आप एक विश्व प्रसिद्ध प्रोफेसर (एक बड़ा AI मॉडल) से "क्या यह एक लाल सेब है?" जैसा सरल कार्य करने के लिए कहते हैं, तो वे शायद बहुत अधिक सोच-विचार करेंगे, समय लेंगे और फिर भी गलत हो सकते हैं क्योंकि वे फल विशेषज्ञ नहीं हैं।
पेपर में पाया गया कि मानक, ऑफ-द-शेल्फ AI मॉडल उनके विशिष्ट स्टोर के लिए प्रासंगिकता (relevance) का निर्णय लेने में केवल 68-70% सटीक थे। उन्हें उपयोगी होने के लिए 89% सटीकता की आवश्यकता थी।

2. समाधान: एक तीन-परत वाला "फ़िल्टर" (द कैस्केड)

एक ही विशाल, महंगे AI से सब कुछ करवाने के बजाय, लेखकों ने एक रिले रेस (relay race) बनाई जिसमें तीन धावक हैं, जिनमें से प्रत्येक महंगा होने के साथ-साथ अधिक स्मार्ट भी होता जा रहा है।

  • धावक 1 (द स्प्रिंटर): एक छोटा, तेज़, सस्ता मॉडल (Cross-Encoder)। यह सर्च टर्म और प्रोडक्ट टाइटल को देखता है। यह बहुत तेज़ है (5 मिलीसेकंड)।
  • धावक 2 (द मिडिल डिस्टेंस): एक मध्यम आकार का मॉडल (Gemma-2B)। इसमें लगभग 50 मिलीसेकंड लगते हैं।
  • धावक 3 (द मैराथनर): एक बड़ा, शक्तिशाली मॉडल (LLaMA-8B)। इसमें 200 मिलीसेकंड लगते हैं।

रेस कैसे काम करती है:
सिस्टम धावक 1 से अनुमान लगाने के लिए कहता है।

  • यदि धावक 1 बहुत आश्वस्त है (जैसे, "मुझे 95% यकीन है कि यह एक परफेक्ट मैच है!"), तो सिस्टम उत्तर स्वीकार कर लेता है और रुक जाता है। महंगे धावकों को बुलाने की कोई आवश्यकता नहीं है।
  • यदि धाвकर 1 अनिश्चित है (जैसे, "मुझे लगता है कि यह एक मैच है, लेकिन मैं केवल 60% आश्वस्त हूँ"), तो वह बैटन (baton) धावक 2 को सौंप देता है।
  • यदि धावक 2 भी अनिश्चित है, तो वह धावक 3 को सौंप देता है।
  • यदि धावक 3 भी भ्रमित है, तो तीनों मॉडल अंतिम निर्णय लेने के लिए मिलकर वोट करते हैं।

जादू: यह "कैस्केड" दृष्टिकोण का अर्थ है कि सिस्टम केवल कठिन सवालों के लिए महंगे, धीमे मॉडलों का उपयोग करता है। आसान सवालों के लिए (जो अधिकांश हैं), यह सस्ते, तेज़ मॉडल का उपयोग करता है। इससे सटीकता खोए बिना कंप्यूटिंग लागत में आधा अंतर आता है।

3. गुप्त मंत्र: "कैलिब्रेशन" (द कॉन्फिडेंस कोच)

एक पेच है: AI मॉडल अक्सर अपनी निश्चितता के बारे में झूठ बोलते हैं। वे कह सकते हैं, "मैं 90% आश्वस्त हूँ," जबकि वास्तव में वे केवल 60% आश्वस्त होते हैं। यदि सिस्टम इस झूठ पर भरोसा करता है, तो यह बहुत जल्दी रुक जाता है और गलती करता है।

लेखकों ने एक कैलिब्रेशन कोच (विशेष रूप से, "पर-क्लास आइसोटोनिक कैलिब्रेशन") जोड़ा है।

  • इस कोच को एक रेफरी के रूप में समझें जो धावकों को देखता है और कहता है, "हे, जब आप 'क्लास A' पर 90% आश्वस्त होने का दावा करते हैं, तो वास्तव में आप केवल 80% आश्वस्त होते हैं। चलिए आपके कॉन्फिडेंस स्कोर को एडजस्ट करते हैं।"
  • पेपर में पाया गया कि प्रत्येक विशिष्ट प्रकार के उत्तर (जैसे, "परफेक्ट मैच" बनाम "बैड मैच") के लिए इन कॉन्फिडेंस स्कोर को अलग से ठीक करने से सिस्टम को अधिक सटीकता से क्वेरी रूट करने में मदद मिली। इसने अंतिम सटीकता में एक छोटा लेकिन सांख्यिकीय रूप से महत्वपूर्ण उछाल जोड़ा।

4. परिणाम: पहले मॉडल्स को ट्रेन करना

इससे पहले कि रिले रेस शुरू हो, लेखकों ने एक महत्वपूर्ण काम किया: उन्होंने तीनों मॉडल्स को फाइन-ट्यून (fine-tune) किया।

  • सामान्य AI मॉडल्स का उपयोग करने के बजाय जो दुनिया के बारे में सब कुछ जानते हैं लेकिन आपके स्टोर के बारे में कुछ भी नहीं, उन्होंने इन मॉडल्स को विशेष रूप से उनके अपने सर्च डेटा के 1.2 मिलियन उदाहरणों पर प्रशिक्षित किया।
  • उपमा: यह एक सामान्य डॉक्टर को विशेष रूप से "वॉलमार्ट के इन्वेंट्री" पर प्रशिक्षित करने जैसा है। अचानक, वे एक विशेषज्ञ बन जाते हैं।
  • इस कदम ने अकेले सटीकता को ~68% से बढ़ाकर ~89% कर दिया।

निचोड़ (The Bottom Line)

इन तीन सामग्रियों को मिलाकर, टीम ने एक "स्वीट स्पॉट" हासिल किया:

  1. फाइन-ट्यूनिंग ने मॉडल्स को सटीक बनाया (द "ब्रेन")।
  2. कैस्केडिंग ने प्रक्रिया को सस्ता और तेज़ बनाया (द "इकोनॉमी")।
  3. कैलिब्रेशन ने सुनिश्चित किया कि मॉडल्स को पता हो कि कब रुकना है और कब मदद मांगनी है (द "ट्रस्ट")।

वास्तविक दुनिया का प्रभाव:

  • गति: जिसे लेबल करने में मानव टीमों को 5 दिन लगते थे, अब उसमें 1 से 3 घंटे लगते हैं।
  • वॉल्यूम: उन्होंने 15 करोड़ (150 मिलियन) से अधिक एनोटेशन प्रोसेस किए।
  • लागत: उन्होंने हर सिंगल क्वेरी के लिए बड़े, शक्तिशाली मॉडल का उपयोग करने की तुलना में कंप्यूटिंग लागत को आधा कर दिया।

संक्षेप में, उन्होंने एक स्मार्ट, स्व-सुधार करने वाली असेंबली लाइन बनाई है जो विशेषज्ञों की एक टीम जितनी ही अच्छी तरह से सर्च परिणामों को लेबल करती है, लेकिन बहुत कम लागत और समय में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →