← नवीनतम पेपर
📊 statistics

Distributional Approximate Nearest Neighbour Search for Uncertainty-Aware Retrieval

यह शोध पत्र DINOSAUR को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो उपयोगकर्ताओं और वस्तुओं दोनों के लिए कई एम्बेडिंग को नमूना बनाकर एम्बेडिंग अनिश्चितता (embedding uncertainty) को अनुमानित निकटतम पड़ोसी खोज (approximate nearest neighbor search) में शामिल करता है, जिससे मौजूदा बुनियादी ढांचे के साथ अनुकूलता बनाए रखते हुए और रिकॉल हानि को न्यूनतम करते हुए विविध लॉन्ग-टेल सामग्री की प्राप्ति में सुधार होता है।

मूल लेखक: Olivier Jeunen

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Olivier Jeunen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लाखों किताबों वाली एक विशाल लाइब्रेरी में घूम रहे हैं। आप अपने वर्तमान मूड के लिए एकदम सही किताब ढूँढना चाहते हैं। एक आधुनिक रिकमेंडेशन सिस्टम (सिफारिश प्रणाली) में, यह लाइब्रेरी एक रोबोट लाइब्रेरियन द्वारा चलाई जा रही है जो एक विशेष मानचित्र का उपयोग करती है ताकि उन किताबों को ढूँढा जा सके जो आपके द्वारा पसंद की गई किताबों के समान दिखती हैं।

समस्या: "परफेक्ट" मैप बहुत कठोर है

वर्तमान में, रोबोट लाइब्रेरियन हर किताब और हर पाठक को मानचित्र पर एक एकल, निश्चित बिंदु (fixed point) के रूप में मानता है।

  • लोकप्रिय किताबें: हैरी पॉटर जैसी बेस्टसेलर किताबों के बारे में सोचें। लाइब्रेरियन ने उन्हें हजारों बार देखा है। मानचित्र पर उनका स्थान बिल्कुल स्पष्ट और सटीक है।
  • नीश (Niche) किताबें: अब एक विशिष्ट प्रकार के मशरूम के बारे में एक गुमनाम, स्व-प्रकाशित उपन्यास के बारे में सोचें। लाइब्रेरियन ने इसे केवल कुछ ही बार देखा है। क्योंकि डेटा बहुत कम (sparse) है, लाइब्रेरियन इस बात को लेकर काफी अनिश्चित है कि यह किताब वास्तव में मानचित्र पर कहाँ होनी चाहिए।

दोष: क्योंकि रोबोट को कठोर होने के लिए प्रोग्राम किया गया है, यह केवल उन किताबों को चुनता है जो आपके स्थान के बिल्कुल करीब होती हैं। यदि वह गुमनाम मशरूम वाली किताब अनिश्चितता के कारण केंद्र से थोड़ी भी हट जाती है, तो उसे हमेशा के लिए अनदेखा कर दिया जाता है। यह एक ऐसी प्रणाली बनाता है जहाँ केवल प्रसिद्ध, लोकप्रिय आइटम ही सिफारिशें प्राप्त करते हैं, जबकि अद्वितीय, नीश या "लॉन्ग-टेल" कंटेंट को ध्यान आकर्षित करने से वंचित कर दिया जाता है।

समाधान: "Dinosaur" से मिलिए

यह पेपर dinosaur नामक एक नई विधि प्रस्तावित करता है (Distributional Approximate Nearest Neighbour Search for Uncertainty-Aware Retrieval)।

एक किताब को मानचित्र पर एक बिंदु के बजाय, dinosaur अनिश्चित किताबों को संभावनाओं के एक बादल (cloud of possibilities) के रूप में देखता है।

रचनात्मक उपमा: "धुंधला बादल" बनाम "नुकीला बिंदु"

  • पुराना तरीका (Point Estimate): कल्पना कीजिए कि लाइब्रेरियन मशरूम वाली किताब के स्थान को एक छोटे, नुकीले पिन से चिह्नित करता है। यदि आपका अनुरोध उस पिन से एक मिलीमीटर भी दूर होता है, तो किताब को खारिज कर दिया जाता है।
  • Dinosaur तरीका (Distributional): कल्पना कीजिए कि लाइब्रेरियन महसूस करता है, "मुझे यकीन नहीं है कि यह मशरूम वाली किताब वास्तव में कहाँ होनी चाहिए।" इसलिए, एक पिन के बजाय, वे उस सामान्य क्षेत्र के आसपास पिन का एक धुंधला बादल गिरा देते हैं।
    • एक लोकप्रिय बेस्टसेलर के लिए, बादल छोटा और सघन होता है (क्योंकि लाइब्रेरियन बहुत आश्वस्त है)।
    • एक नीश किताब के लिए, बादल बड़ा और फैला हुआ होता है (क्योंकि लाइब्रेरियन अनिश्चित है)।

जब आप कोई सिफारिश मांगते हैं, तो रोबोट केवल एक स्थान की जांच नहीं करता है; वह यह जांचता है कि क्या आपका अनुरोध उन धुंधले बादलों में कहीं भी आता है। क्योंकि नीश किताब का बादल बड़ा होता है, इसके "हिट" होने और आपकी सूची में शामिल होने की संभावना बहुत अधिक होती है, भले ही लाइब्रेरियन इस बारे में पूरी तरह से अनिश्चित हो कि वह कहाँ है।

यह व्यवहार में कैसे काम करता है

पेपर बताता है कि इसके लिए कोई नई लाइब्रेरी बनाने या रोबोट के दिमाग को बदलने की आवश्यकता नहीं है। यह एक चतुर तरीका है:

  1. सैंपलिंग (Sampling): आपके आने से पहले, सिस्टम नीश किताब के "धुंधले बादल" को लेता है और उसके कई संस्करण बनाता है जिन्हें मानचित्र पर बिखेरा जाता है।
  2. खोज (Searching): जब आप खोज करते हैं, तो सिस्टम निकटतम प्रतियों की तलाश करता है।
  3. डीडुप्लिकेशन (Deduplication): यदि उसे एक ही मशरूम वाली किताब की तीन प्रतियां मिलती हैं, तो वह उसे केवल एक सिफारिश के रूप में गिनता है।

यह एक व्यापक जाल फेंकने जैसा है। आप दुर्लभ मछलियों (नीश आइटम्स) को पकड़ने में अधिक सफल होंगे बिना आम मछलियों (लोकप्रिय आइटम्स) को खोए।

परिणाम: अधिक विविधता, लगभग शून्य लागत

लेखकों ने एक विशाल मूवी डेटासेट (MovieLens) पर इसका परीक्षण किया।

  • समझौता (Trade-off): आमतौर पर, यदि आप अधिक विविधता दिखाने की कोशिश करते हैं, तो आप गलती से लोगों को ऐसी चीजें दिखा सकते हैं जो उन्हें पसंद नहीं हैं, जिससे आपकी "सटीकता" (accuracy) कम हो सकती है।
  • Dinosaur की खोज: पेपर दिखाता है कि इन धुंधले बादलों का उपयोग करके, वे उपयोगकर्ताओं को दिखाई जाने वाली फिल्मों की विविधता को तीन गुना कर सके (कैटलॉग कवरेज ~23% से बढ़ाकर ~63% करना)।
  • नुकसान: उनकी "सटीकता" (कि उन्होंने कितनी बार वह फिल्म चुनी जिसे उपयोगकर्ता ने वास्तव में पसंद किया) बहुत मामूली, लगभग अदृश्य मात्रा में गिरी (0.5% से भी कम)।

यह क्यों महत्वपूर्ण है

यह पेपर तर्क देता है कि यह एक बाजार चलाने का अधिक निष्पक्ष तरीका है।

  • निर्माताओं के लिए: नीश विक्रेता और निर्माता एक "गणितीय बढ़ावा" पाते हैं। क्योंकि उनके आइटम अनिश्चित हैं, उन्हें एक बड़ा "बादल" मिलता है, जो उन्हें किसी मानव प्रबंधक द्वारा कृत्रिम रूप से बढ़ावा दिए बिना, देखे जाने का एक निष्पक्ष अवसर देता है।
  • उपयोगकर्ताओं के लिए: आप सहज, अद्वितीय सामग्री की खोज कर पाते जिसे एक कठोर प्रणाली ने बाहर कर दिया होता।

सारांश

Dinosaur एक सरल, स्मार्ट तरीका है यह बताने का कि रिकमेंडेशन रोबोट को: "यदि आप अनिश्चित हैं कि यह आइटम कहाँ होना चाहिए, तो इसे अनदेखा न करें। इसे थोड़ा सांस लेने की जगह दें ताकि इसे खोजा जा सके।" यह अनिश्चितता को खोज के अवसर में बदल देता है, जिससे सिस्टम को तोड़े बिना कंटेंट की 'लॉन्ग टेल' को जीवित रहने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →