← नवीनतम पेपर
💻 computer science

Bayesian Rational Search Engine User

यह शोध पत्र खोज इंजन उपयोगकर्ता व्यवहार को एक बेयसियन तर्कसंगत अनुक्रमिक निर्णय प्रक्रिया के रूप में मॉडल करता है, जो यह प्रदर्शित करता है कि इष्टतम स्टॉपिंग पॉलिसी तीन विशिष्ट तंत्रों द्वारा संचालित एक विशिष्ट नियम का अनुसरण करती है और देखे गए निरीक्षण गहराइयों पर आधारित एक नवीन, अवकलनीय लर्निंग-टू-रैंक संभावना फलन (likelihood function) प्रदान करती है।

मूल लेखक: Shichao Ma

प्रकाशित 2026-05-26
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shichao Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने फोन पर खोज परिणामों (search results) या उत्पादों की एक सूची देख रहे हैं। आप एक शीर्षक देखते हैं, शायद थोड़ा सा टेक्स्ट, लेकिन आपको तब तक पता नहीं चलता कि वास्तविक सामग्री कितनी अच्छी है जब तक कि आप उस पर क्लिक न कर दें। क्लिक करने में समय और प्रयास (एक "लागत") लगता है, और आपको निर्णय लेना होता है: क्या मैं इस पर क्लिक करूँ? या मैं स्क्रॉल करना जारी रखूँ?

यह शोध पत्र, "Bayesian Rational Search Engine User," गणित और अर्थशास्त्र का उपयोग करके इसी प्रश्न का उत्तर देने की कोशिश करता है। यह तर्क देता है कि उपयोगकर्ता केवल बेतरतीब ढंग से क्लिक नहीं कर रहे हैं; वे एक तर्कसंगत जासूस (rational detectives) की तरह कार्य कर रहे हैं, जो जैसे-जैसे आगे बढ़ते हैं, पेज की गुणवत्ता के बारे में अपने विश्वास को लगातार अपडेट करते रहते हैं।

यहाँ इस पेपर के दावों का विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों के साथ समझाया गया है।

1. मुख्य विचार: "स्टैंडआउट" (Standout) नियम

यह पेपर सिद्ध करता है कि सबसे स्मार्ट तरीका एक-एक करके (ऊपर से नीचे) सूची में जाना है। आपको इधर-उधर कूदने की आवश्यकता नहीं है।

इष्टतम रणनीति (optimal strategy) को "स्टैंडआउट नियम" कहा जाता है। कल्पना कीजिए कि आपके दिमाग में दो संख्याएँ हैं:

  1. आपका अब तक का सबसे अच्छा खोज (Your Best Find): वह सबसे अच्छी चीज़ जो आपने अब तक देखी है।
  2. आपकी अपेक्षा (Your Expectation): इस पेज पर एक "औसत" आइटम कितना अच्छा होगा, इसके बारे में आपका वर्तमान अनुमान।

आप तब तक स्क्रॉल करते रहते हैं जब तक कि आपकी "सबसे अच्छी खोज" आपकी "अपेक्षा" से काफी बेहतर न हो जाए। आप केवल तभी रुकते हैं जब आपकी सबसे अच्छी खोज आपकी अपेक्षा के ऊपर इतनी अधिक "स्पष्ट रूप से उभरती" (stands out) है कि आगे खोजना प्रयास के लायक न रहे।

रूपक (Metaphor): इसे डेटिंग की तरह समझें। आप कुछ डेट्स पर जाते हैं। यदि पहली डेट ठीक-ठाक है, तो आप देखते रहते हैं क्योंकि आप सोचते हैं, "शायद अगली बेहतर होगी।" लेकिन यदि दूसरी डेट शानदार है—इतनी बेहतर कि वह आपकी औसत अपेक्षा से बहुत ऊपर है कि आप सोचते हैं, "मैं इससे बेहतर की उम्मीद नहीं कर सकता"—तो आप देखना बंद कर देते हैं। आपने अपना "स्टैंडआउट" पा लिया है।

2. लोग क्यों रुकते हैं? तीन छिपे हुए कारण

यह पेपर तीन विशिष्ट कारणों की पहचान करता है कि कोई उपयोगकर्ता केवल एक क्लिक (एक "वन-क्लिक सेशन") के बाद क्यों रुक सकता है। यह महत्वपूर्ण है क्योंकि वास्तविक जीवन में, हम अक्सर देखते हैं कि एक उपयोगकर्ता एक बार क्लिक करता है और चला जाता है, लेकिन हमें पता नहीं होता कि वह क्यों हुआ। मॉडल कहता है कि यह तीन में से एक चीज़ है:

  • विश्वास (Trust): उपयोगकर्ता ने सर्च इंजन पर इतना भरोसा किया कि उन्होंने क्लिक करने से पहले ही तय कर लिया था कि वे पहले परिणाम पर ही रुक जाएंगे। उन्होंने केवल पुष्टि करने के लिए क्लिक किया।
  • प्रतिबद्धता (Commit): पहला परिणाम इतना अच्छा था कि उपयोगकर्ता ने सोचा, "यह एकदम सही है। आगे देखने की कोई ज़रूरत नहीं है।"
  • नुकसान से बचना (Cut-Losses): पहला परिणाम इतना खराब था कि उपयोगकर्ता ने सोचा, "यह पेज बहुत बेकार है। मैं हार मान रहा हूँ और वापस अपने होम स्क्रीन पर जा रहा हूँ।"

समस्या: एक पर्यवेक्षक (जैसे कि वेबसाइट विश्लेषक) के लिए, ये तीनों बिल्कुल एक जैसे दिखते हैं: एक क्लिक, फिर बाहर निकलना। आप केवल क्लिक काउंट देखकर यह नहीं बता सकते कि उपयोगकर्ता खुश था (Commit), उदासीन था (Trust), या निराश था (Cut-Losses)।

3. सर्च इंजन के लिए "विजेता का अभिशाप" (Winner’s Curse)

यहाँ एक विपरीत परिणाम है: आपका सर्च इंजन जितना बेहतर होता है, आपको उसे सुधारने के लिए उतना ही कम डेटा मिलता है।

यदि आपका सर्च इंजन पूर्ण है, तो शीर्ष परिणाम हमेशा सबसे अच्छा होता है। तर्कसंगत उपयोगकर्ता शीर्ष परिणाम पर क्लिक करेंगे, देखेंगे कि यह शानदार है, और रुक जाएंगे। वे दूसरे, तीसरे या चौथे परिणाम को कभी नहीं देखते।

रूपक: कल्पना कीजिए कि एक रेस्टोरेंट क्रिटिक केवल नंबर #1 रैंक वाले रेस्टोरेंट में ही खाना खाने जाता है। यदि वह रेस्टोरेंट हमेशा परफेक्ट है, तो क्रिटिक कभी भी नंबर #2 या #3 रेस्टोरेंटों में नहीं जाएगा। इसलिए, क्रिटिक के पास इस बारे में कोई डेटा नहीं होगा कि नंबर #2 रेस्टोरेंट वास्तव में अच्छा है या बुरा। सिस्टम निचले स्तर के आइटमों के बारे में जानकारी प्राप्त करने के लिए "भूखा" हो जाता है क्योंकि उपयोगकर्ता वहां तक देखते ही नहीं हैं।

इसे "विजेता का अभिशाप" (Winner’s Curse) कहा जाता है। एक सफल सर्च इंजन एक ऐसा फीडबैक लूप बनाता है जहाँ वह सूची के बाकी हिस्सों के बारे में सीखना बंद कर देता है क्योंकि उपयोगकर्ता वहां तक देखते ही नहीं हैं।

4. अल्पकालिक बनाम दीर्घकालिक भ्रम (A/B टेस्टिंग)

कंपनियाँ कुछ उपयोगकर्ताओं को सर्च इंजन का नया संस्करण दिखाकर बदलावों का परीक्षण करती हैं (A/B टेस्टिंग)। पेपर चेतावनी देता है कि अल्पकालिक डेटा झूठ बोल सकता है।

  • अल्पकालिक (Short Run): यदि आप अचानक सर्च परिणामों को बेहतर बना देते हैं, तो हो सकता है कि उपयोगकर्ता अल्पकाल में वास्तव में कम क्लिक करें। क्यों? क्योंकि पहला परिणाम इतना अच्छा है कि वे तुरंत "प्रतिबद्ध" (Commit) हो जाते हैं और रुक जाते हैं। उनके सेशन की लंबाई कम हो जाती है।
  • दीर्घकालिक (Long Run): समय के साथ, उपयोगकर्ता यह सीख जाते हैं कि पेज आम तौर पर उच्च गुणवत्ता वाला है। उनकी अपेक्षाएं बढ़ जाती हैं। वे गहराई से स्क्रॉल करना शुरू कर सकते हैं क्योंकि उन्हें उम्मीद होती है कि सब कुछ अच्छा होगा, या वे शीर्ष पर ही टिके रह सकते हैं यदि वह प्रभावी बना रहता है।

सीख: यदि आप अपने सर्च इंजन में सुधार करते हैं, तो आप शुरुआती कुछ दिनों में क्लिक या स्क्रॉल डेप्थ में गिरावट देख सकते हैं। एक अदूरदर्शी मैनेजर सोच सकता है, "ओह नहीं, नया संस्करण बदतर है!" लेकिन मॉडल कहता है, "नहीं, यह वास्तव वास्तव में बेहतर है; उपयोगकर्ता बस जल्दी संतुष्ट हो गए हैं।"

5. AI को प्रशिक्षित करने का एक नया तरीका (Learning-to-Rank)

अंत में, यह पेपर AI को आइटम रैंक करने का सिखाने का एक नया गणितीय तरीका प्रस्तावित करता है।

वर्तमान में, कंपनियाँ AI को इस तरह प्रशिक्षित करती हैं: "यदि उपयोगकर्ता ने इस पर क्लिक किया, तो यह अच्छा है। यदि उन्होंने नहीं किया, तो यह बुरा है।" यह त्रुटिपूर्ण है क्योंकि उपयोगकर्ता किसी चीज़ पर इसलिए क्लिक नहीं करते क्योंकि वह बुरी है; वे इसलिए क्लिक नहीं करते क्योंकि वे पहले ही देखना बंद कर चुके होते हैं।

पेपर सुझाव देता है कि उपयोगकर्ता के व्यवहार को एक गणितीय पहेली के रूप में माना जाए।

  • यदि एक उपयोगकर्ता 5 आइटमों के आगे स्क्रॉल करता है और छठे पर रुक जाता है, तो हम निश्चित रूप से जानते हैं कि आइटम 1-5 "औसत" (न इतने बुरे कि वे छोड़ दें, न इतने अच्छे कि वे रुक जाएं) थे।
  • यह उन आइटमों के संभावित प्रासंगिकता स्कोर (relevance scores) का एक "पॉलीहेड्रॉन" (एक जटिल ज्यामितिक आकार) बनाता है।

अनुमान लगाने के बजाय, AI यह गणना कर सकता है कि क्या आइटम इस आकार के भीतर फिट बैठते हैं। यह AI को बिना मानवीय लेबल के "नॉन-क्लिक्स" (क्लिक न करने की घटनाओं) से बहुत अधिक सटीक रूप से सीखने की अनुमति देता है।

संक्षेप में

  • उपयोगकर्ता तर्कसंगत जासूस हैं: वे जैसे-जैसे स्क्रॉल करते हैं, अपने विश्वासों को अपडेट करते हैं।
  • रुकें जब वह स्पष्ट रूप से अलग दिखे: आप तब रुकते हैं जब आपकी सबसे अच्छी खोज आपकी औसत अपेक्षा से स्पष्ट रूप से बेहतर होती है।
  • एक क्लिक अस्पष्ट है: यह सफलता, विश्वास या विफलता का संकेत हो सकता है। अंतर बताने के लिए आपको अधिक डेटा (जैसे खरीदारी) की आवश्यकता होती है।
  • सफलता डेटा को छिपा देती है: आपका सर्च इंजन जितना बेहतर होता है, उपयोगकर्ता निचले परिणामों को उतना ही कम देखते हैं, जिससे निचले रैंकों में सुधार करना कठिन हो जाता है।
  • अल्पकालिक मेट्रिक्स गुमराह कर सकते हैं: बेहतर परिणाम अल्पकाल में कम क्लिक के रूप में दिखाई दे सकते हैं।
  • बेहतर AI प्रशिक्षण: हम केवल क्लिक गिनने के बजाय उपयोगकर्ता के स्क्रॉलिंग की ज्यामिति (geometry) का उपयोग करके सर्च इंजन को अधिक सटीक रूप से प्रशिक्षित कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →