HORIZON: A Benchmark for In-the-wild User Behaviour Modeling
यह शोध पत्र HORIZON को प्रस्तुत करता है, जो 54 मिलियन उपयोगकर्ताओं और 35 मिलियन वस्तुओं से निर्मित एक नया बड़े पैमाने का, क्रॉस-डोमेन बेंचमार्क है, जो मौजूदा संकीर्ण बेंचमार्क की सीमाओं को संबोधित करने और वास्तविक दुनिया के परिनियोजन परिदृश्यों को बेहतर ढंग से प्रतिबिंबित करने के लिए नवीन कार्यों और मूल्यांकन मेट्रिक्स के माध्यम से उपयोगकर्ता व्यवहार मॉडलिंग को पुनर्गठित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप भविष्यवाणी करने की कोशिश कर रहे हैं कि कोई व्यक्ति आगे क्या खरीदेगा।
पुराना तरीका (वर्तमान बेंचमार्क):
अनुशंसा प्रणालियों (recommendation systems) के लिए अधिकांश मौजूदा परीक्षण ताश के एक ही डेक का उपयोग करके "अगला कार्ड पहचानने" के खेल की तरह हैं। यदि किसी उपयोगकर्ता ने केवल कुकिंग बुक्स खरीदी हैं, तो परीक्षण AI से पूछता है: "ठीक है, उन्होंने अभी एक कुकबुक खरीदी है, तो वे आगे क्या खरीदेंगे?" AI दूसरी कुकबुक का अनुमान लगाता है। यह एक उच्च स्कोर प्राप्त करता है क्योंकि यह एक बहुत ही संकीर्ण, अल्पकालिक संदर्भ में अगले आइटम का अनुमान लगाने में अच्छा है।
लेकिन असल जिंदगी में, लोग केवल एक-आयामी नहीं होते। एक व्यक्ति कुकबुक खरीद सकता है, फिर एक टेंट, फिर एक गिटार, और फिर एक बेबी स्ट्रॉलर। उनकी रुचियां वर्षों में बदलती हैं, न कि केवल मिनटों में। पुराने परीक्षण पूरे व्यक्ति को देखने में विफल रहते हैं; वे केवल उनके जीवन के पिछले कुछ सेकंड देखते हैं।
नया समाधान: HORIZON
यह पेपर HORIZON पेश करता है, जो एक नया, विशाल "प्रशिक्षण मैदान" है जो खेल के नियम बदल देता है। ताश के एक एकल डेक के बजाय, HORIZON AI को एक ऐसी लाइब्रेरी देता है जिसमें 54 मिलियन लोगों का संपूर्ण खरीदारी इतिहास और 35 मिलियन अलग-अलग उत्पाद (टूथपेस्ट से लेकर टेलीस्कोप तक) शामिल हैं।
HORIZON को एक टाइम मशीन और एक गिरगिट की तरह रंग बदलने वाले सूट (chameleon suit) के संयोजन के रूप में सोचें। यह AI को तीन कठिन चीजें करने के लिए मजबूर करता है जिन्हें पुराने परीक्षणों ने अनदेखा कर दिया था:
- "टाइम ट्रैवल" टेस्ट: तुरंत अगला आइटम गेस करने के बजाय, AI को यह भविष्यवाणी करनी होगी कि उपयोगकर्ता भविष्य में वर्षों बाद क्या खरीदेगा, जो उसने अतीत में खरीदा था। यह एक मौसम विज्ञानी से पिछले गर्मियों के डेटा के आधार पर अगले सर्दियों के हिमपात की भविष्यवाणी करने के लिए कहने जैसा है, जबकि उपयोगकर्ता की आदतें पूरी तरह से बदल चुकी हैं।
- "स्ट्रेंजर" (अजनबी) टेस्ट: AI का परीक्षण उन लोगों पर किया जाता है जिन्हें उसने पहले कभी नहीं देखा। पुराने परीक्षणों में, AI उपयोगकर्ता के इतिहास का अध्ययन करता था और फिर उसकी अगली चाल का अनुमान लगाता था। HORIZEN में, AI एक अजनबी से मिलता है, उसके छोटे से इतिहास को देखता है, और अनुमान लगाता है कि वह आगे क्या खरीदेगा, बिना यह जाने कि प्रशिक्षण के दौरान वह उससे कभी मिला था या नहीं।
- "जिग्सॉ" (पहेली) टेस्ट: AI को विभिन्न दुनियाओं के बीच के बिंदुओं को जोड़ना होगा। यदि कोई उपयोगकर्ता एक कैमरा खरीदता है, फिर हाइकिंग बूट, फिर एक प्रोटीन शेक, तो AI को यह समझने की आवश्यकता है कि यह व्यक्ति एक "आउटडोर फोटोग्राफर" है, न कि केवल एक "कैमरा खरीदार"।
उन्होंने इसका परीक्षण कैसे किया
शोधकर्ताओं ने केवल यह नहीं देखा कि AI ने अगले आइटम का कितनी अच्छी तरह अनुमान लगाया। उन्होंने यह देखने के लिए चार अलग-अलग "परीक्षा कक्ष" बनाए कि AI तनाव को कैसे संभालता है:
- कमरा 1 (कंफर्ट ज़ोन): ज्ञात उपयोगकर्ता के लिए अगला आइटम प्रेडिक्ट करना, प्रशिक्षण डेटा के ठीक बाद। (ईजी मोड)।
- कमरा 2 (टाइम जंप): ज्ञात उपयोगकर्ता के लिए प्रेडिक्ट करना, लेकिन वर्षों भविष्य में। (हार्ड मोड: क्या उनकी पसंद बदल गई?)
- कमरा 3 (स्ट्रेंजर): एक नए उपयोगकर्ता के लिए प्रेडिक्ट करना, लेकिन उसी समय अवधि में। (हार्ड मोड: क्या यह सामान्यीकरण कर सकता है?)
- कमरा 4 (अल्टीमेट बॉस): एक नए उपयोगकर्ता के लिए, वर्षों भविष्य में प्रेडिक्ट करना। (इम्पॉसिबल मोड: क्या यह नए लोगों और नए समय दोनों को संभाल सकता है?)
उन्हें क्या मिला
परिणाम तकनीकी जगत के लिए एक वेक-अप कॉल की तरह थे:
- "स्मार्ट" AI वास्तव में स्मार्ट नहीं है: सबसे उन्नत AI मॉडल (जैसे BERT4Rec) कमरा 1 (कंफर्ट ज़ोन) में बहुत अच्छे थे। लेकिन जैसे ही वे कमरा 4 (अल्टीमेट बॉस) में पहुंचे, उनका प्रदर्शन गिर गया। वे उस छात्र की तरह थे जिसने पाठ्यपुस्तक रट ली थी लेकिन जब वास्तविक दुनिया की समस्या हल करने के लिए कहा गया जिसे उसने पहले नहीं देखा था, तो वह फेल हो गया।
- LLMs (लार्ज लैंग्वेज मॉडल्स) ठीक हैं, लेकिन जादुई नहीं हैं: शोधकर्ताओं ने इन उपयोगकर्ताओं के लिए "मनोवैज्ञानिक" के रूप में कार्य करने के लिए विशाल AI चैटबॉट्स (जैसे Llama या Qwen) का उपयोग किया। उन्होंने AI से पूछा कि उपयोगकर्ता आगे क्या खोज सकता है। हालांकि ये चैटबॉट्स उपयोगकर्ता के "वाइब" (vibe) को समझने में अच्छे थे, लेकिन वे वास्तव में 35 मिलियन वस्तुओं के कैटलॉग से सही उत्पाद चुनने में बहुत अच्छे नहीं थे। वे "क्यों" के लिए अच्छे थे, लेकिन "क्या" के लिए खराब थे।
- "लॉन्ग टेल" की समस्या: वास्तविक दुनिया में अधिकांश वस्तुएं दुर्लभ होती हैं। AI विशिष्ट प्रकार के टेलीस्कोप जैसे दुर्लभ वस्तुओं की भविष्यवाणी करने में संघर्ष करता है क्योंकि उसने उन्हें पहले कभी नहीं देखा था। वह लोकप्रिय वस्तुओं पर बहुत अधिक निर्भर था।
मुख्य निष्कर्ष
यह पेपर तर्क देता है कि हम वर्तमान में ऐसा AI बना रहे हैं जो बहुत अधिक विशिष्ट और बहुत कम दूरदर्शी है। यह एक कुत्ते को लिविंग रूम में गेंद लाने के लिए प्रशिक्षित करने जैसा है, और फिर उससे जंगल में हिरण का शिकार करने की उम्मीद करने जैसा है।
HORIZON वह जंगल है। यह एक नया मानक है जो शोधकर्ताओं को ऐसा AI बनाने के लिए मजबूर करता है जो:
- एक व्यक्ति की जीवन कहानी को समझ सके, न कि केवल उसकी अंतिम खरीदारी को।
- नए लोगों और नए समय के अनुकूल बन सके।
- वास्तविक दुनिया की अव्यवस्थ और परिवर्तनशील वास्तविकता को संभाल सके।
संक्षेप में, HORIZON कह रहा है: "खिलौने वाले डेटासेट के साथ खेलना बंद करें। यदि आप एक ऐसी अनुशंसा प्रणाली बनाना चाहते हैं जो वास्तविक दुनिया में काम करे, तो आपको इसे वास्तविक दुनिया में टेस्ट करना होगा।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।