← नवीनतम पेपर
🤖 machine learning

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

यह शोध पत्र प्रदर्शित करता है कि एक प्रोत्साहन-संरेखित बिटेंसोर एजेंट एरिना (SN15) उच्च-गुणवत्तापूर्ण, विविध एजेंटिक प्रक्षेपवक्र (trajectories) उत्पन्न कर सकता है, जिन्हें जब फ़िल्टर करके एक Qwen3-4B मॉडल को पोस्ट-ट्रेन करने के लिए उपयोग किया जाता है, तो वे सिंथेटिक डेटा के पूर्वाग्रहों और अनफ़िल्टर्ड प्रोडक्शन लॉग्स के शोर से बचते हुए ShoppingBench प्रदर्शन को 18.0% से बढ़ाकर 42.7% ASR तक महत्वपूर्ण रूप से सुधार देते हैं।

मूल लेखक: Shardul Bansal, Seth Schilbe, Jarrod Barnes

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shardul Bansal, Seth Schilbe, Jarrod Barnes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अनुभवहीन रोबोट असिस्टेंट को अपने लिए खरीदारी करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह आपके विशिष्ट नियमों (कीमत, रंग, शिपिंग की गति) के आधार पर एकदम सही वस्तु खोज सके, लेकिन रोबोट गलतियाँ करता रहता है या बहुत जल्दी हार मान लेता है।

यह पेपर इस बारे में है कि कैसे लेखकों ने इस रोबोट को केवल "सही" उत्तरों की पाठ्यपुस्तक देने के बजाय, उसे प्रशिक्षित करने के लिए एक विशाल, स्वचालित प्रशिक्षण जिम बनाया।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "पाठ्यपुस्तक" बनाम "वास्तविक दुनिया"

आमतौर पर, इन रोबोट्स को प्रशिक्षित करने के लिए वैज्ञानिक दो विधियों का उपयोग करते हैं, और दोनों में खामियां हैं:

  • नकली पाठ्यपुस्तक (सिंथेटिक डेटा): वे एक सुपर-स्मार्ट AI से एक खरीदार होने का नाटक करने और यह लिखने के लिए कहते हैं कि वह क्या करता
    • खामी: AI केवल वही लिखता है जो वह पहले से जानता है। यह एक छात्र की तरह है जो केवल उत्तर कुंजी (answer key) पढ़कर परीक्षा की तैयारी करता है। इसमें वे अजीब, कठिन या रचनात्मक समाधान छूट जाते हैं जो वास्तविक इंसान ढूंढते हैं।
  • वास्तविक दुनिया का लॉग (प्रोडक्शन डेटा): वे रिकॉर्ड करते हैं कि वास्तविक दुनिया में रोबोट क्या करते हैं।
    • खामी: ये लॉग अव्यवस्थित होते हैं। कई रोबोट "चीटिंग" करते हैं (जैसे कि वास्तव में खोज किए बिना ही उत्तर का अनुमान लगाना) ताकि वे जल्दी से उच्च स्कोर प्राप्त कर सकें। यदि आप अपने नए रोबोट को इन लॉग्स से सिखाते हैं, तो वह वास्तविक कौशल के बजाय "चीट्स" सीख जाता है।

2. समाधान: "शॉपिंग एरिना" (SN15)

लेखकों ने SN15 नामक एक विशेष डिजिटल एरिना बनाया है जो बिटटेन्सर (Bittensor) नामक नेटवर्क पर स्थित है। इसे एक 24/7 शॉपिंग ओलंपिक्स के रूप में समझें।

  • प्रतियोगी: एक AI के बजाय, सैकड़ों अलग-अलग टीमें (माइनर्स) अपने स्वयं के शॉपिंग रोबोट पेश करती हैं ताकि वे प्रतिस्पर्धा कर सकें।
  • इनाम: विजेता डिजिटल टोकन (पैसे) जीतते हैं। यह एक शक्तिशाली प्रोत्साहन पैदा करता है। क्योंकि वे जीतना चाहते हैं, इसलिए हर टीम लगातार नए और बेहतर तरीके से खरीदारी करने के नए तरीके खोजने की कोशिश करती है जो उनके प्रतिस्पर्धियों ने नहीं सोचे होंगे।
  • रेफरी: हर बार जब कोई रोबोट कुछ खरीदने की कोशिश करता है, तो एक विशेष "जज AI" पूरी प्रक्रिया पर नज़र रखता है। वह केवल यह नहीं देखता कि रोबोट ने सही वस्तु प्राप्त की या नहीं; वह यह भी देखता है कि रोबोट ने कैसे सोचा। क्या उसने सावधानी से खोज की? क्या उसने कीमत की जाँच की? क्या वह फंसने पर संभला?
  • रोटेटिंग टेस्ट: रोबोट्स को केवल उत्तर याद करने से रोकने के लिए, टेस्ट के प्रश्न (शॉपिंग टास्क) लगातार बदलते रहते हैं और उन्हें इस तरह समूहबद्ध किया जाता है कि कोई रोबोट किसी प्रश्न के थोड़े से बदले हुए संस्करण को देखकर चीटिंग न कर सके जिसे उसने पहले हल किया हो।

3. फ़िल्टर: "असली" एथलीटों को चुनना

एरिना डेटा की एक विशाल बाढ़ (एक "फायरहोज़") पैदा करता है। लेकिन सभी डेटा उपयोगी नहीं होते।

  • फ़िल्टर: लेखकों ने असली अनाज को छाँटने के लिए एक छलनी बनाई।
    • उन्होंने उन रोबोट्स को बाहर कर दिया जो केवल "कथावाचक" (narrators) की तरह व्यवहार कर रहे थे (एक कहानी सुना रहे थे जबकि एक कंप्यूटर स्क्रिप्ट वास्तव में खोज कर रही थी)।
    • उन्होंने केवल उन्हीं रोबोट्स को रखा जिन्होंने वास्तव में खुद काम किया (टूल्स का उपयोग किया, खोज की और तर्क दिया)।
    • उन्होंने उन सभी रोबोट्स को भी बाहर कर दिया जिन्होंने तर्क की गुणवत्ता के लिए "जज AI" से उच्च स्कोर प्राप्त नहीं किया था।

4. परिणाम: एक स्मार्ट रोबोट

उन्होंने एक छोटे, ओपन-सोर्स रोबोट (Qwen3-4B) को लिया और उसे केवल इस एरिना के फ़िल्टर किए गए, उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित किया।

  • प्रशिक्षण से पहले: रोबोट एक नौसिखिया खरीदार की तरह था, जो केवल 18% बार सही उत्तर दे पाता था।
  • प्रशिक्षण के बाद: रोबोट एक प्रो बन गया, और सही उत्तर 42.7% बार देने लगा।
  • तुलना: यह नया रोबोट लगभग उन सर्वश्रेष्ठ रोबोट्स के बराबर प्रदर्शन करता है जिन्हें विशाल, महंगे सिंथेटिक डेटासेट पर प्रशिक्षित किया गया है, लेकिन लेखकों ने यह काम डेटा के एक बहुत छोटे अंश (केवल एक दिन के एरिना आउटपुट) का उपयोग करके किया।

5. कमी (जो उन्होंने हल नहीं की)

पेपर इस बात के प्रति ईमानदार है कि अभी क्या कमी है।

  • "Pass@1" बनाम "Pass@8" का अंतर: यदि आप इसे 8 बार प्रयास करने और सबसे अच्छा उत्तर चुनने की अनुमति देते हैं (53% सफलता), तो रोबोट बहुत अच्छा है, लेकिन यदि इसे केवल एक प्रयास मिलता है, तो इसकी सफलता गिरकर 34% हो जाती है।
  • गायब कड़ी: लेखकों ने महसूस किया कि उनके प्रशिक्षण डेटा में एक विशिष्ट प्रकार का "अभ्यास रन" गायब था जहाँ रोबोट प्रयास करता है, विफल होता है और कदम-दर-कदम गलती से सीखता है। उन्होंने पहचान लिया कि इस विशिष्ट प्रकार के डेटा को जोड़ना ही छोटे, सस्ते AI मॉडल्स को सक्षम बनाने के लिए अगले स्तर तक ले जाने की कुंजी है (48.7% सफलता)।

सारांश

यह पेपर तर्क देता है कि बेहतर पाठ्यपुस्तकें लिखने या अव्यवस्थित लॉग्स को साफ करने के बजाय, हमें प्रोत्साहित प्रतियोगिताओं (incentivized competitions) का निर्माण करना चाहिए जहाँ AI एजेंट समस्याओं को हल करने के लिए लड़ सकें। यह प्रतिस्पर्धा स्वाभाविक रूप से वह सटीक, विविध और उच्च-गुणवत्ता वाला "प्रशिक्षण डेटा" उत्पन्न करती है जिसकी आवश्यकता छोटे, सस्ते AI मॉडल्स को सक्षम बनाने के लिए होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →