Benchmarking In-context Experiential Learning Through Repeated Product Recommendations
यह शोध पत्र BELA को प्रस्तुत करता है, जो वास्तविक उत्पादों और कृत्रिम ग्राहक व्यक्तित्वों का उपयोग करके बार-बार होने वाले उत्पाद अनुशंसा परिदृश्यों में अनुभवात्मक शिक्षण के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि जबकि वर्तमान LLM-आधारित एजेंट व्यक्तिगत बातचीत के भीतर अनुकूलित हो सकते हैं, वे साझा गुप्त संरचनाओं का अनुमान लगाकर कई प्रकरणों (एपिसोड्स) में अपनी रणनीतियों में सुधार करने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने वाले जासूस हैं, लेकिन सुराग बातचीत के भीतर छिपे हुए हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक एकल पहेली को सुलझाने और समय के साथ पहेलियाँ सुलझाने में बेहतर बनने के बीच एक बड़ा अंतर है। आज के अधिकांश AI परीक्षण एक छात्र को एक गणित की समस्या देने की तरह हैं जिसमें सभी संख्याएँ पहले से ही लिखी हुई हैं; लक्ष्य बस अभी सही उत्तर प्राप्त करना है। लेकिन वास्तविक जीवन अधिक जटिल है। यह एक ऐसे जासूस की तरह है जो एक गवाह से बात करता है, कुछ सवाल पूछता है, एक जवाब पाता है, और फिर उसे उस अनुभव का उपयोग अगले गवाह का अधिक प्रभावी ढंग से साक्षात्कार करने के लिए करना होता है। यह शोध पत्र "अनुभवात्मक शिक्षण" (experiential learning) नामक AI अनुसंधान के एक विशिष्ट कोने में गहराई से उतरता है। यह एक सरल लेकिन कठिन प्रश्न पूछता है: क्या एक AI लोगों से बार-बार बात करके यह समझने में स्मार्ट हो सकता है कि लोग क्या चाहते हैं? शोधकर्ता यह परीक्षण कर रहे हैं कि क्या ये डिजिटल एजेंट भविष्य में बेहतर जासूस बनने के लिए अपनी पिछली बातचीत से सीख सकते हैं, न कि केवल एक अलग मामले को हल करने में अच्छे होने के लिए।
इस शोध पत्र के लेखकों ने, जो कोलंबिया बिजनेस स्कूल और सन यत-सेन यूनिवर्सिटी की एक टीम है, इस विचार का परीक्षण करने के लिए एक ऐसे परिदृश्य का उपयोग करने का निर्णय लिया जिसे हम सभी जानते हैं: उत्पादों की खरीदारी। उन्होंने एक विशाल, आभासी खेल का मैदान बनाया जिसे BELA (बीईएलए - अनुभवजन्य शिक्षण और सक्रिय अन्वेषण के लिए बेंचमार्क) कहा जाता है। BELA को एक विशाल, अनंत मॉल के रूप में समझें जहाँ AI एक सेल्सपर्सन की भूमिका निभाता है। इस मॉल में, AI को यह पता लगाने के लिए हजारों अलग-अलग "ग्राहकों" (जो वास्तव में विशिष्ट रुचियों वाले लोगों के कंप्यूटर सिमुलेशन हैं) से बात करनी होती है कि उन्हें कौन सा उत्पाद खरीदना चाहिए। मोड़ यह है कि AI को केवल एक मौका नहीं मिलता। वह एक ग्राहक से बात करता है, एक सिफारिश करता है, फीडबैक प्राप्त करता है, और फिर एक नए ग्राहक की ओर बढ़ जाता है। बड़ा परीक्षण यह है कि क्या AI पहले ग्राहक से सीखी गई बातों को याद रखता है और उस ज्ञान का उपयोग दूसरे, तीसरे और दसवें ग्राहक से बेहतर सवाल पूछने के लिए करता है।
इस परीक्षण को निष्पक्ष और विशाल बनाने के लिए, शोधकर्ताओं ने केवल कुछ नकली लोग नहीं बनाए। उन्होंने Amazon से 71,000 वास्तविक उत्पादों और 2,000 अलग-अलग उत्पाद समूहों (जैसे हेयर जेल का एक समूह या चावल के व्यंजनों का एक समूह) के साथ एक प्रणाली बनाई। फिर उन्होंने इन्हें 1 मिलियन विभिन्न ग्राहक व्यक्तित्वों (जो अन्य AI द्वारा सिम्युलेट किए गए हैं) के साथ जोड़ा, जिनके पास बहुत विशिष्ट और सुसंगत पसंद और नापसंद है। यह "ग्राहक + उत्पाद समूह" के 2 बिलियन संभावित संयोजनों का एक दिमाग चकरा देने वाला निर्माण करता है। यह हर संभव खरीदारी यात्रा के पुस्तकालय की तरह है, जिससे शोधकर्ताओं को यह देखने की अनुमति मिलती है कि क्या AI भीड़ के बीच पैटर्न पहचान सकता है।
शोधकर्ताओं ने अपने प्रयोगों को आज के सबसे स्मार्ट AI मॉडल के साथ चलाया, जिसमें GPT-5.4, Gemini-3.1 और Claude-Opus जैसे दिग्गज शामिल हैं। उन्होंने इन मॉडलों को 10 खरीदारी यात्राओं (जिन्हें एपिसोड कहा जाता है) की एक श्रृंखला के दौरान परीक्षण किया। वे दो चीजें देखना चाहते थे: पहला, क्या AI एक एकल बातचीत के दौरान सीख सकता है (सही फॉलो-अप सवाल पूछना)? दूसरा, क्या AI बातचीत के माध्यम से सीख सकता है (अनुभव प्राप्त करने के साथ काम में बेहतर होना)?
यहाँ आश्चर्यजनक परिणाम है: AI मॉडल पहले भाग में काफी अच्छे थे। एक एकल ग्राहक से बात करते समय, वे बातचीत से सीख सकते हैं और जैसे-जैसे चैट आगे बढ़ती है, बेहतर सवाल पूछ सकते हैं। हालाँकि, वे दूसरे भाग में पूरी तरह से विफल रहे। नौ अलग-अलग ग्राहकों से बात करने के बाद भी, AI दसवें ग्राहक की पसंद का अनुमान लगाने में उतना ही सक्षम था जितना वह पहले वाले के साथ था। यह एक ऐसे सेल्सपर्सन की तरह था जो यह समझने में तो माहिर है कि एक व्यक्ति को क्या पसंद है, लेकिन हर बार जब कोई नया व्यक्ति आता है, तो वह शून्य से शुरुआत करता है, पिछले नौ लोगों से सीखा हुआ सब कुछ भूल जाता है।
यह शोध पत्र सुझाव देता है कि इन वर्तमान "फ्रंटियर" मॉडलों में एक महत्वपूर्ण कौशल की कमी है: वे अपने पिछले अनुभवों को देखकर यह नहीं कह सकते कि, "ओह, मैं यहाँ एक पैटर्न देख रहा हूँ; मुझे अगली बार इस प्रकार का सवाल पूछना चाहिए।" इसके बजाय, वे हर नए ग्राहक को एक पूरी तरह से नया रहस्य मानते हैं, भले ही वे अभी पाँच मिनट पहले किसी बहुत समान पसंद वाले व्यक्ति से मिले हों। शोधकर्ताओं ने यह भी पाया कि AI इस बात का अनुमान लगाने में बेहतर नहीं हुआ कि उसे कितना आत्मविश्वासी होना चाहिए; वह लगातार सवालों की समान संख्या पूछता रहा, भले ही उसे कम सवाल पूछना सीखना चाहिए था।
यह साबित करने के लिए कि कार्य केवल बहुत कठिन नहीं था, शोधकर्ताओं ने एक "आदर्श पथ" बनाया। उन्होंने मैन्युअल रूप से AI को सर्वोत्तम संभावित प्रश्नों के माध्यम से निर्देशित किया और दिखाया कि यदि AI अपने पिछले अनुभवों का सही ढंग से उपयोग करता, तो वह अपनी सिफारिशों में काफी सुधार कर सकता था और कम सवाल पूछ सकता था। यह साबित करता है कि जानकारी वहां मौजूद थी जिसे सीखा जाना था, लेकिन वर्तमान मॉडल बस उसे पकड़ नहीं पा रहे थे।
संक्षेप में, यह शोध पत्र सुझाव देता है कि जबकि हमारा वर्तमान AI एक एकल, स्मार्ट बातचीत करने में बहुत अच्छा हो रहा है, इसने अभी तक यह नहीं सीखा है कि कैसे पूरे करियर के दौरान अनुभव से सीखने वाली एक "लर्निंग मशीन" बना जाए। यह एक ऐसे छात्र की तरह है जो परीक्षा से एक रात पहले पढ़ाई करके परीक्षा में अव्वल आ सकता है, लेकिन जैसे ही घंटी बजती है वह सब कुछ भूल जाता है, और सोमवार को जो सीखा था उसका उपयोग मंगलवार को मदद के लिए करने में असमर्थ होता है। लेखक निष्कर्ष निकालते हैं कि AI के लिए वास्तव में जटिल, परिवर्तनशील वास्तविक दुनिया को संभालने के लिए, इसे कई एपिसोड के माध्यम से अनुभव से सीखने की क्षमता विकसित करने की आवश्यकता है, एक ऐसा कौशल जिसे आज के सबसे उन्नत मॉडल भी मास्टर करने में संघर्ष कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।