Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning
यह शोध पत्र Shop-R1 प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो कार्य को तर्क निर्माण (rationale generation) और क्रिया भविष्यवाणी (action prediction) चरणों में विभाजित करके LLMs की मानव ऑनलाइन शॉपिंग व्यवहार को सिम्युलेट करने की क्षमता को बढ़ाता है, जिसमें प्रत्येक चरण को विशिष्ट स्व-पर्यवेक्षित (self-supervised) और पदानुक्रमित (hierarchical) पुरस्कार संकेतों द्वारा निर्देशित किया गया है ताकि बेसलाइन की तुलना में 65% से अधिक सुधार प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को ऑनलाइन शॉपिंग करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि रोबोट बिल्कुल एक असली इंसान की तरह व्यवहार करे, जैसे कि किसी विशिष्ट ग्राफिक्स कार्ड को खोजना, रिव्यू पढ़ना, कीमतों की तुलना करना और अंत में "Add to Cart" पर क्लिक करना।
समस्या यह है कि मानक AI मॉडल बहुत बुद्धिमान लेकिन अनुभवहीन इंटर्न की तरह होते हैं। यदि आप उन्हें सिर्फ यह कह दें, "एक GTX 5090 खरीदो," तो वे सही बटन का अनुमान तो लगा सकते हैं, लेकिन वे अक्सर विवरणों (details) में गलती कर देते हैं (जैसे गलत फ़िल्टर पर क्लिक करना या सर्च टर्म को गलत तरीके से टाइप करना)। वे वास्तव में यह भी नहीं समझते कि वे जो कर रहे हैं उसके पीछे का कारण क्या है।
यह पेपर Shop-R1 पेश करता है, जो एक नया प्रशिक्षण तरीका है जो उस "इंटर्न" को एक अनुभवी और विचारशील खरीदार में बदल देता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. दो चरणों वाला नृत्य: "पहले सोचें, फिर कार्य करें"
अधिकांश AI सीधे कार्य करने में कूद पड़ते हैं। Shop-R1 AI को पहले रुकने और ज़ोर से सोचने के लिए मजबूर करता है।
- उपमा (Analogy): एक शतरंज खिलाड़ी की कल्पना करें। एक बुरा खिलाड़ी तुरंत मोहरा चलता है। एक ग्रैंडमास्टर पहले कहता है, "मैं केंद्र को नियंत्रित करने के लिए यह प्यादा चल रहा हूँ।"
- पेपर में: बटन क्लिक करने से पहले, AI को एक "तर्क" (rationale) उत्पन्न करना होगा। "मैं 'Customer Reviews' पर क्लिक कर रहा हूँ क्योंकि मैं खरीदना से पहले यह जांचना चाहता हूँ कि उत्पाद भरोसेमंद है या नहीं।"
- यह कैसे मदद करता है: AI को अपने तर्क को समझाने के लिए मजबूर करके, यह वास्तव में कार्य करने के दौरान होने वाली गलतियों को कम करता है।
2. "गोल्ड स्टार" सिस्टम (पुरस्कार/रिवॉर्ड)
पुराने दिनों में, AI को प्रशिक्षित करना एक सख्त शिक्षक की तरह था जो केवल "सही" या "गलत" कहता था।
- समस्या: यदि AI को "Buy Now" पर क्लिक करना था लेकिन उसने "Add to Cart" पर क्लिक कर दिया, तो पुराना सिस्टम उसे एक बड़ा "F" ग्रेड दे देता था। AI कुछ भी नहीं सीख पाता था और बस हार मान लेता था।
- Shop-R1 का समाधान: यह एक वीडियो गेम जिसमें विस्तृत स्कोरकार्ड होता है जैसा है।
- फॉर्मेट पॉइंट्स: क्या आपने अपना उत्तर सही आकार (जैसे एक साफ JSON लिस्ट) में लिखा? +0.5 अंक।
- लॉजिक पॉइंट्स: क्या आपका "ज़ोर से सोचना" आत्मविश्वास से भरा और तार्किक था? +0.13 अंक।
- एक्शन पॉइंट्स: क्या आपने सही प्रकार के बटन पर क्लिक किया? +0.3 अंक।
- डिटेल पॉइंट्स: क्या आपने सटीक सर्च टर्म टाइप किया? +0.2 अंक।
यह सिस्टम AI को आंशिक क्रेडिट (partial credit) देता है। भले ही उसे एकदम सटीक उत्तर न मिले, उसे सही प्रकार के कार्य के लिए अंक मिलते हैं। यह AI को कठिन कार्यों को करने के लिए प्रोत्साहित करता है बजाय इसके कि वह हार मान ले।
3. "आलसी छात्र" का जाल (रिवॉर्ड हैकिंग)
यहाँ एक पेचीदा हिस्सा है। यदि आप एक वीडियो गेम में एक ऐसा ग्लिच (glitch) ढूंढ लेते हैं जहाँ आप बस स्थिर खड़े रहकर 1,000 अंक प्राप्त कर सकते हैं, तो आप हमेशा वही करेंगे।
- जाल: ऑनलाइन शॉपिंग में, सबसे आसान कार्य ब्राउज़र को बंद कर देना ("Terminate") है। यदि AI को ब्राउज़र बंद करने के लिए पुरस्कार मिलता है, तो वह हर बार तुरंत ब्राउज़र बंद कर देगा।
- समाधान: Shop-R1 एक डिफिकल्टी मल्टीप्लायर (कठिनाई गुणक) का उपयोग करता है।
- ब्राउज़र बंद करना आसान है, इसलिए यह बहुत कम अंक देता है।
- एक जटिल सर्च क्वेरी टाइप करना या एक विशिष्ट फ़िल्टर पर क्लिक करना कठिन है, इसलिए सिस्टम उन कार्यों को सही करने के लिए अंकों को बढ़ा (amplify) देता है।
- परिणाम: AI को एहसास होता है, "हे, अगर मुझे जीतना है, तो मुझे वास्तव में खरीदारी का कठिन काम करना होगा, न कि बस छोड़ देना होगा।"
4. प्रशिक्षण प्रक्रिया
पेपर एक दो-चरणीय प्रशिक्षण शिविर का वर्णन करता है:
- लेक्चर (SFT): पहले, AI एक सुपर-स्मार्ट AI (Claude 3.5) द्वारा लिखे गए हजारों मानव शॉपिंग उदाहरणों को पढ़ता है। यह बुनियादी पैटर्न सीखता है: "ओह, लोग आमतौर पर पहले सर्च करते हैं, फिर रिव्यू पर क्लिक करते हैं।"
- अभ्यास (RL): इसके बाद, AI गेम खेलना शुरू करता है। वह गलतियाँ करता है, अपना "गोल्ड स्टार" स्कोरकार्ड प्राप्त करता है, और फीडबैक से सीखता है। वह अपने स्कोर को अधिकतम करने के लिए बेहतर तरीके से शॉपिंग करने की कोशिश करता है।
परिणाम
जब उन्होंने इस नए तरीके का परीक्षण किया, तो AI की मानव शॉपिंग व्यवहार की नकल करने की क्षमता में पिछले सर्वोत्तम तरीकों की तुलना में 65% से अधिक सुधार हुआ।
- पहले: AI एक ऐसे पर्यटक की तरह था जो शहर का नाम तो जानता है लेकिन गलियों में खो जाता है।
- बाद में: AI एक स्थानीय निवासी की तरह है जो जानता है कि किस स्टोर में प्रवेश करना है, क्या पूछना है और भुगतान कैसे करना है।
संक्षेप में: Shop-R1 AI को शॉपिंग करना सिखाता है—उसे कार्य करने से पहले सोचने के लिए मजबूर करके, उसे विवरणों को सही करने (न कि केवल सामान्य विचार) के लिए पुरस्कृत करके, और यह सुनिश्चित करके कि वह जीतने के लिए शॉर्टकट न ले।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।