RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments
यह शोध पत्र RetailBench को प्रस्तुत करता है, जो वास्तविक, दीर्घ-अवधि वाले रिटेल प्रबंधन परिदृश्यों में LLM एजेंटों के मूल्यांकन के लिए एक डेटा-आधारित सिमुलेशन बेंचमार्क है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल आशाजनक दिखते हैं, वे अपूर्ण साक्ष्य प्राप्ति और असंगत दीर्घकालिक रणनीतियों जैसी समस्याओं के कारण निरंतर सुसंगत निर्णय लेने में संघर्ष करते हैं और एक ओरकल पॉलिसी की तुलना में काफी कम प्रदर्शन करते हैं।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक छोटे से सुपरमार्केट को चलाने के लिए एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट को काम पर रखा है। आपने उसे एक लैपटॉप, कीमतें और स्टॉक चेक करने के लिए उपकरणों की एक सूची, और $30,000 का बजट दिया है। आपका लक्ष्य यह है कि यह रोबट छह महीने (180 दिन) तक स्टोर को दिवालिया हुए बिना चलाए, शेल्फ में सामान भरा रहे और मुनाफा कमाए।
यह शोध पत्र, RetailBench, इस विशिष्ट कार्य में सात अलग-अलग "स्मार्ट रोबोट दिमागों" (लार्ज लैंग्वेज मॉडल्स या LLMs) के प्रदर्शन का एक रिपोर्ट कार्ड है।
यहाँ इसका विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:
1. परीक्षण: किराने की दुकान में एक कभी न खत्म होने वाला दिन
आजकल के अधिकांश AI परीक्षण छोटे क्विज़ की तरह होते हैं: "एक कविता लिखें," "इस गणित की समस्या को हल करें," या "एक फ्लाइट बुक करें।" ये स्पष्ट शुरुआत और अंत वाले छोटे कार्य हैं।
RetailBench इससे अलग है। यह AI को एक दौड़ (sprint) नहीं, बल्कि एक मैराथन में डालने जैसा है।
- वातावरण: एक सिम्युलेटेड सिंगल-स्टोर सुपरमार्केट।
- चुनौती: AI को एक साथ कई चीजें संभालनी होंगी: कीमतें तय करना, दूध खत्म होने से पहले और अधिक मंगवाना, सबसे अच्छे सप्लायर को चुनना, नाराज ग्राहकों की समीक्षाओं को संभालना, किराए के बिलों का निपटारा करना, और समाचार घटनाओं (जैसे कि कोई तूफान जो बिक्री को प्रभावित कर सकता है) पर प्रतिक्रिया देना।
- पेंच: AI सब कुछ नहीं देख सकता। यह एक स्टोर मैनेजर की तरह है जिसे अंदाजा लगाना पड़ता है कि बैक रूम में क्या हो रहा है या अगले हफ्ते ग्राहकों को क्या चाहिए होगा। उसे निर्णय लेने से पहले जानकारी (उपकरणों का उपयोग करके) मांगनी पड़ती है।
2. परिणाम: रोबोट रास्ता भटक गए
शोधकर्ताओं ने इन AI एजेंटों को 180 दिनों तक स्टोर चलाने दिया। यहाँ हुआ:
- अधिकांश ने जल्दी हार मान ली: कई AI एजेंटों के पास पैसे खत्म हो गए या उन्होंने इतनी गलतियाँ कीं कि स्टोर कुछ ही हफ्तों में बंद हो गया (कुछ तो केवल 58 दिनों में)।
- जीवित रहने वाले भी परफेक्ट नहीं थे: दो सबसे स्मार्ट AI एजेंटों ने पूरे 180 दिनों तक स्टोर चलाने में सफलता प्राप्त की। हालांकि, भले ही उन्होंने स्टोर चालू रखा, लेकिन वे वास्तव में इसे चलाने में बहुत खराब थे।
- "ओरेकल" (एक आदर्श मैनेजर): शोधकर्ताओं ने एक "चीट शीट" मैनेजर (जिसे Oracle policy कहा गया) भी बनाया। इस मैनेजर को भविष्य का पता था, वह सभी छिपे हुए आंकड़ों को देख सकता था, और सटीक नियमों का पालन करता था।
- अंतर: सबसे अच्छे AI एजेंट ने लगभग 131,000 कमाए। AI केवल जीवित रहने की कोशिश कर रहा था, लेकिन एक आदर्श रणनीति की तुलना में वह बहुत पीछे था।
3. रोबोट क्यों विफल हुए?
शोध पत्र ने रोबोटों की "सोचने की प्रक्रिया" का विश्लेषण किया और पाया कि वे तीन मुख्य कारणों से संघर्ष कर रहे थे:
A. उन्होंने पूरा मेनू नहीं पढ़ा (अधूरी जानकारी)
सोडा के 100 केस ऑर्डर करने से पहले, एक अच्छा मैनेजर इन्वेंट्री की जांच करता है, पिछली बिक्री देखता है, मौसम देखता है और ग्राहकों की समीक्षाएं पढ़ता है।
- AI की गलती: रोबतों ने अक्सर बड़ी घोषणाएं (जैसे स्टॉक ऑर्डर करना या कीमतें बदलना) आवश्यक तथ्यों की पूरी जांच किए बिना कीं। उन्होंने "अंतर्ज्ञान" या अधूरी जानकारी के आधार पर काम किया, जिससे गलत निर्णय हुए।
B. वे केवल प्राइस टैग देखते थे (सतही निर्णय लेना)
कल्पना कीजिए कि आप सेब खरीद रहे हैं। एक सप्लायर उन्हें 1.50 में बेचता है लेकिन वे एकदम बढ़िया हैं।
- AI की गलती: रोबोट सस्ते दाम के प्रति जुनूनी थे। वे बार-बार सस्ते सप्लायर को ही चुनते रहे। उन्हें यह समझ नहीं आया कि सस्ते सेबों से नाराज ग्राहक, रिटर्न और खराब समीक्षाएं होती हैं, जो अंततः स्टोर की प्रतिष्ठा और मुनाफे को खत्म कर देती हैं। उन्होंने कीमत देखी लेकिन गुणवत्ता को मिस कर दिया।
C. उनका ध्यान बहुत कम समय के लिए रहता था (दीर्घकालिक नीति का अभाव)
स्टोर चलाना निरंतरता के बारे में है। यदि आप आज बहुत अधिक दूध मंगवाते हैं, तो यह एक सप्ताह में खराब हो सकता है। यदि आप पर्याप्त नहीं मंगवाते हैं, तो आप बिक्री खो देते हैं।
- AI की गलती: रोबोट आज के लिए निर्णय लेने में अच्छे थे, लेकिन वे कल के बारे में भूल गए। वे एक सुसंगत योजना नहीं बना सके। वे आज एक समस्या को ठीक करते थे, फिर उसे तीन दिन बाद भूल जाते थे जब उसके परिणाम सामने आते थे। वे दिन 1 पर की गई कार्रवाई और दिन 10 पर होने वाली समस्या के बीच संबंध नहीं जोड़ सके।
4. निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हालांकि AI छोटे, विशिष्ट कार्यों में बहुत अच्छा हो रहा है, लेकिन यह अभी भी अपने आप एक जटिल, दीर्घकालिक व्यवसाय चलाने के लिए तैयार नहीं है।
- वर्तमान स्थिति: AI कुछ समय के लिए एक स्टोर को "जीवित" रख सकता है, लेकिन यह उसे "फलने-फूलने" में मदद नहीं कर सकता।
- समस्या: AI में सही सुराग जुटाने, एक सस्ते सौदे के दीर्घकालिक परिणामों पर गहराई से सोचने और महीनों तक एक सुसंगत योजना पर टिके रहने की क्षमता की कमी है।
संक्षेप में: यदि आप आज किसी स्टोर को AI को सौंप देते हैं, तो यह तुरंत दिवालिया तो नहीं होगा, लेकिन एक इंसान (या एक आदर्श कंप्यूटर प्रोग्राम) की तुलना में, जो लंबे समय के खेल को समझता है, यह एक अव्यवस्थित और घाटे वाला काम बन जाएगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।