← नवीनतम पेपर
💻 computer science

Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems

यह शोध पत्र MOSAIC का प्रस्ताव करता है, जो एक स्केलिंग-अवेयर डेटा चयन फ्रेमवर्क है जो डेटासेट्स को डोमेन में विभाजित करके और इवैल्यूएशन मेट्रिक्स पर न्यूरल स्केलिंग लॉज को फिट करके ट्रेनिंग डेटा मिश्रण को अनुकूलित करता है, यह प्रदर्शित करते हुए कि यह मौजूदा बेसलाइन्स की तुलना में 80% तक कम डेटा के साथ एंड-टू-एंड ऑटोनॉमस ड्राइविंग में बेहतर प्रदर्शन प्राप्त करता है।

मूल लेखक: Tolga Dimlioglu, Nadine Chang, Maying Shen, Rafid Mahmood, Jose M. Alvarez

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tolga Dimlioglu, Nadine Chang, Maying Shen, Rafid Mahmood, Jose M. Alvarez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आपके पास वीडियो क्लिप्स का एक विशाल पुस्तकालय है जिसमें हर तरह की ड्राइविंग स्थिति दिखाई गई है—धूप वाले हाईवे, बारिश वाली शहर की सड़कें, भीड़भाड़ वाले चौराहे और शांत ग्रामीण सड़कें।

समस्या क्या है? आप रोबोट को उन सभी क्लिप्स के साथ नहीं सिखा सकते। इसमें बहुत अधिक समय लगेगा, बहुत पैसा खर्च होगा, और बहुत अधिक जानकारी से रोबोट भ्रमित हो सकता है। आपको सबसे अच्छी क्लिप्स चुननी होंगी।

लेकिन यह पेचीदा हिस्सा है: अलग-अलग क्लिप्स अलग-अलग सबक सिखाती हैं। एक व्यस्त शहर के चौराहे का क्लिप रोबोट को पैदल यात्रियों से बचने के लिए सिखाने के लिए बेहतरीन है, लेकिन यह उसे हाईवे पर मर्ज होने के लिए सिखाने के लिए बहुत खराब है। यदि आप केवल रैंडम तरीके से क्लिप चुनते हैं, तो आप एक ऐसा रोबोट बना सकते हैं जो शहर में गाड़ी चलाने में तो माहिर है, लेकिन हाईवे पर टकरा जाता है।

यह पेपर एक स्मार्ट नई विधि पेश करता है जिसे MOSIC (Mixture Optimization via Scaling-Aware Iterative Collection) कहा जाता है। इसे अपने रोबोट ड्राइवर के लिए एक सुपर-स्मार्ट करिकुलम डिज़ाइनर के रूप में समझें।

यह कैसे काम करता है, इसे तीन सरल चरणों में विभाजित किया गया है:

1. लाइब्रेरी को व्यवस्थित करना (Clustering)

कल्पना कीजिए कि आपका वीडियो लाइब्रेरी एक विशाल, बिखरा हुआ अटारी (attic) है। MOSIC इस अटारी को साफ-सुथरे, लेबल वाले बक्सों में व्यवस्थित करके शुरुआत करता है।

  • बॉक्स A: "घुमावदार पहाड़ी रास्ते"
  • बॉक्स B: "घनी शहर की ट्रैफिक"
  • बॉक्स C: "बारिश वाले हाईवे"

हर वीडियो को व्यक्तिगत रूप से देखने के बजाय, MOSIC उन्हें इस आधार पर समूहों में बांटता है कि वे कहाँ फिल्माए गए थे या उनमें क्या हो रहा है। यह सिस्टम को यह समझने में मदद करता है कि "सिटी ट्रैफिक" वीडियो, "पहाड़ी सड़क" वीडियो के प्रकार से अलग प्रकार का सबक है।

2. "ग्रोथ चार्ट" (Scaling Laws)

यही असली जादू है। अतीत में, लोग बस अंदाज़ा लगाते थे कि किस बॉक्स में सबसे उपयोगी वीडियो हैं। MOSIC अधिक स्मार्ट है; यह एक ग्रोथ चार्ट को देखता है।

कल्पना कीजिए कि आप एक पौधे को पानी दे रहे हैं। आप जानते हैं कि यदि आप थोड़ा पानी डालते हैं, तो वह थोड़ा बढ़ता है। यदि आप बहुत अधिक पानी डालते हैं, तो वह बहुत बढ़ता है। लेकिन अंततः, अधिक पानी डालने से कोई मदद नहीं मिलती; पौधा पहले ही भर चुका है, और आप उसे डुबो भी सकते हैं।

MOSIC प्रत्येक "बॉक्स" (शहर, पहाड़, बारिश) से कुछ छोटे नमूने टेस्ट करता है ताकि यह देखा जा सके कि रोबोट के ड्राइविंग कौशल में कितनी सुधार होती है।

  • यह पा सकता है कि सिटी वीडियो शुरू में भारी उछाल देते हैं, लेकिन 100 क्लिप के बाद, रोबोट ने उस बॉक्स से वह सब सीख लिया है जो उसे सीखना था, और उससे अधिक जोड़ने से कोई मदद नहीं मिलती।
  • यह पा सकता है कि पहाड़ी वीडियो धीरे शुरू होते हैं, लेकिन 1,000 क्लिप के बाद भी रोबोट के कौशल में सुधार करते रहते हैं।

यह प्रत्येक बॉक्स के लिए एक "स्केलिंग लॉ" बनाता है: एक कर्व जो दिखाता है कि उस विशिष्ट समूह से अधिक डेटा जोड़ने पर आपको कितना लाभ मिलता है।

3. स्मार्ट शॉपिंग लिस्ट (Iterative Collection)

अब, MOSIC एक शेफ की तरह कार्य करता है जिसके पास सामग्री के लिए एक सीमित बजट है। लक्ष्य एक बेहतरीन भोजन (सबसे अच्छा ड्राइविंग मॉडल) बनाना है बिना पैसा बर्बाद किए।

रैंडम चयन (जैसे 500 टमाटर और 500 आलू खरीदना) के बजाय, MOSIC ग्रोथ चार्ट को देखता है:

  • "अभी, एक और सिटी क्लिप जोड़ने से हमें कौशल में एक बड़ा उछाल मिलेगा।" -> एक सिटी क्लिप जोड़ें।
  • "ठीक है, रोबोट अब सिटी ड्राइविंग में अच्छा हो रहा है। एक और सिटी क्लिप जोड़ने से अब ज्यादा मदद नहीं मिलेगी। लेकिन अभी एक पहाड़ी क्लिप जोड़ने से एक बड़ा उछाल आएगा।" -> एक पहाड़ी क्लिप पर स्विच करें।

यह एक बार में एक क्लिप करके ऐसा करता है, लगातार चेक करता रहता है: "इस सटीक क्षण में कौन सा प्रकार का वीडियो हमें सबसे बड़ा सुधार देगा?" यह बजट भरने तक बक्सों के बीच स्विच करता रहता है।

परिणाम: कम डेटा के साथ एक स्मार्ट ड्राइवर

पेपर ने वास्तविक स्वायत्त ड्राइविंग डेटा पर इसका परीक्षण किया। परिणाम प्रभावशाली थे:

  • दक्षता (Efficiency): MOSIC एक ऐसा ड्राइवर बना सका जो सभी डेटा पर प्रशिक्षित ड्राइवर जितना ही अच्छा था, लेकिन इसे केवल 42% डेटा की आवश्यकता थी।
  • गति (Speed): कुछ मामलों में, इसने रैंडम चयन की तुलना में 80% कम डेटा के साथ समान प्रदर्शन हासिल किया।
  • संतुलन (Balance): इसने रोबोट को केवल एक चीज़ में अच्छा नहीं बनाया; इसने रोबोट के कौशल को संतुलित किया ताकि वह शहर और हाईवे दोनों में सुरक्षित हो।

संक्षेप में उपमा (Analogy)

  • पुराना तरीका: एक छात्र को बहुत सारी रैंडम फ्लैशकार्ड्स फेंक देना और उम्मीद करना कि वह सब कुछ सीख जाएगा।
  • MOSIC: एक ट्यूटर जो छात्र की प्रोग्रेस रिपोर्ट देखता है, यह महसूस करता है कि वह गणित में अच्छा है लेकिन इतिहास में कमजोर है, और कहता है, "ठीक है, गणित के सवाल करने के लिए एक पल के लिए रुकते हैं और पूरी तरह से इतिहास पर ध्यान केंद्रित करते हैं जब तक कि आप बराबरी न कर लें, फिर हम वापस स्विच करेंगे।"

यह क्यों मायने रखता है?
सेल्फ-ड्राइविंग कारों को प्रशिक्षित करना महंगा और धीमा है। MOSIC साबित करता है कि बेहतर परिणाम पाने के लिए आपको अधिक डेटा की आवश्यकता नहीं है; आपको बस स्मार्टर डेटा चयन की आवश्यकता है। यह एक बुफे में जहाँ आप रैंडмली सब कुछ उठाते हैं, और एक शेफ जो एक मास्टरपीस बनाने के लिए सही सामग्री का सावधानीपूर्वक चयन करता है, के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →