← नवीनतम पेपर
💻 computer science

ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation

यह शोध पत्र ATHENA का प्रस्ताव करता है, जो एक स्केलेबल इन्फ्लुएंस फंक्शन फ्रेमवर्क है जो क्रोनेकर संरचनाओं (Kronecker structures) और रैंक-r सन्निकटन (rank-r approximations) का लाभ उठाकर बिलियन-पैरामीटर मल्टीटास्क विजन-लैंग्वेज-एक्शन मॉडल्स के लिए डेटा क्यूरेशन को त्वरित करता है, जिससे काफी कम प्रदर्शनों (demonstrations) के साथ पूर्ण-डेटा प्रदर्शन से मेल खाते हुए महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Tao Xu, Jiaxin Wang, Runhao Zhang, Jiayi Guan, Xianchao Zeng, Weixi Song, Xinyu Zhou, Zhetao Chen, Guang Chen, Yong-Lu Li

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tao Xu, Jiaxin Wang, Runhao Zhang, Jiayi Guan, Xianchao Zeng, Weixi Song, Xinyu Zhou, Zhetao Chen, Guang Chen, Yong-Lu Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-इंटेलिजेंट रोबोट को सौ अलग-अलग काम करना सिखाने की कोशिश कर रहे हैं, जैसे कटोरे सजाना, फल उठाना, या लिफाफे पर स्टैम्प लगाना। आपके पास मानव प्रदर्शनों के वीडियो का एक विशाल पुस्तकालय है।

समस्या क्या है? पुस्तकालय बहुत बड़ा है, और हर वीडियो मददगार नहीं है। कुछ वीडियो बेहतरीन मूव्स दिखाते हैं, जबकि कुछ में गलतियाँ या अप्रासंगिक क्रियाएं होती हैं। यदि आप केवल रोबोट को सभी वीडियो खिला देते हैं, तो वह भ्रमित हो जाएगा, समय बर्बाद करेगा, और शायद बुरी आदतें भी सीख लेगा। लेकिन यदि आप सभी वीडियो को खुद देखकर सबसे "अच्छे" वीडियो चुनने की कोशिश करते हैं, तो इसमें बहुत समय लगेगा।

यहीं ATHENA काम आता है। ATHENA को एक सुपर-स्मार्ट, अल्ट्रा-फास्ट लाइब्रेरियन के रूप में सोचें जो आपके रोबोट के लिए एक आदर्श प्रशिक्षण पुस्तकालय तैयार करने में आपकी मदद करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: बहुत अधिक डेटा, बहुत धीमा

अतीत में, यह पता लगाने की कोशिश करना कि कौन सा विशिष्ट वीडियो रोबोट को सबसे अधिक सीखने में मदद करता था, समुद्र तट पर रेत के हर कण को गिनने जैसा था ताकि सबसे अच्छा रेत का महल बनाया जा सके।

  • पैमाना (The Scale): आधुनिक रोबोट मस्तिष्क (जिन्हें VLA मॉडल कहा जाता है) विशाल होते हैं, जिनमें अरबों "न्यूरॉन्स" (पैरामीटर्स) होते हैं।
  • रुकावट (The Bottleneck): पारंपरिक तरीकों में रोबोट के दिमाग को बार-बार फिर से प्रशिक्षित करना पड़ता था, जिसमें एक बार में एक वीडियो हटाकर यह देखना होता था कि रोबोट बेहतर हुआ या बदतर। अरबों पैरामीटर्स के साथ, यह गणनात्मक रूप से असंभव है—इसमें हजारों साल लग सकते हैं।
  • मल्टीटास्क का उलझाव (The Multitask Mess): यदि आपके पास 50 अलग-अलग कार्य हैं, तो एक साधारण "सबसे अच्छा वीडियो चुनें" वाला दृष्टिकोण उन वीडियो को चुन सकता है जो एक कार्य (जैसे कटोरे सजाना) के लिए तो बेहतरीन हैं, लेकिन अन्य कार्यों के लिए बेकार या हानिकारक भी हो सकते हैं। यह एक ऐसे शेफ को काम पर रखने जैसा है जो सुशी बनाने में तो माहिर है लेकिन ब्रेड बनाने में बहुत बुरा है, और फिर आप उसे दोनों चीजें एक साथ सिखाने की कोशिश कर रहे हैं।

2. समाधान: ATHENA की दो सुपरपावर्स

ATHENA इन समस्याओं को दो तरकीबों से हल करता है:

तरकीब A: "शॉर्टकट" (त्वरित गणना)

अरबों पैरामीटर वाले पूरे मस्तिष्क पर भारी गणित करने के बजाय, ATHENA एक चतुर गणितीय शॉर्टकट का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक विशाल जहाज का वजन मापने की कोशिश कर रहे हैं। एक सामान्य तरीका होगा जिसमें आपको लकड़ी के हर एक तख्ते को व्यक्तिगत रूप से तौलना होगा। ATHENA, हालांकि, यह समझ जाता है कि जहाज एक विशिष्ट, दोहराव वाले पैटर्न (जैसे समान ईंटों का ढेर) में बना है। कुछ प्रतिनिधि ईंटों को तौलकर, यह एक फॉर्मूले का उपयोग करके तुरंत कुल वजन जान लेता है।
  • परिणाम: यह शॉर्टकट गणना को 313 गुना तेज़ बनाता है। जिस काम में कंप्यूटर के हफ्तों का समय लगता था, वह अब कुछ घंटों में हो जाता है।

तरकीब B: "संतुलित जज" (मल्टीटास्क इंटरेक्शन)

एक बार जब ATHENA तेजी से स्कोर की गणना कर सकता है, तो उसे यह तय करना होता है कि किन वीडियो को रखना है।

  • उपमा: कल्पना कीजिए कि 50 अलग-अलग श्रेणियों (गायन, नृत्य, करतब दिखाना आदि) के साथ एक टैलेंट शो चल रहा है। एक बुरा जज केवल बेहतरीन गायकों को चुन सकता है क्योंकि उनकी आवाज तेज है, जिससे करतब दिखाने वाले पीछे छूट जाते हैं। ATHENA एक निष्पक्ष निर्माता की तरह काम करता है। वह प्रत्येक वीडियो के लिए दो प्रश्न पूछता है:
    1. "यह वीडियो उस विशिष्ट कार्य के लिए कितना मददगार है जिससे यह संबंधित है?" (लोकल इन्फ्लुएंस)
    2. "यह वीडियो अन्य 49 कार्यों के लिए कितना मददगार है?" (ग्लोबल इन्फ्लुएंस)
  • परिणाम: यह एक संतुलित पुस्तकालय बनाता है जहाँ रोबोट थोड़ा-थोड़ा सब कुछ सीखता है, यह सुनिश्चित करता है कि वह किसी एक चीज़ में मास्टर और बाकी सब में असफल न बन जाए।

3. परिणाम: कम डेटा, बेहतर प्रदर्शन

शोधकर्ताओं ने ATHENA का परीक्षण दो तरीकों से किया:

  • सिमुलेशन में (वीडियो गेम): उन्होंने एक रोबोट सिम्युलेटर का उपयोग किया जिसमें 50 अलग-अलग कार्य और 2,500 घंटों का वीडियो डेटा था।

    • दावा: ATHENA केवल 50% डेटा (आधे वीडियो) का उपयोग करके भी वही (या बेहतर) परिणाम प्राप्त करने में सक्षम था, जो 100% डेटा के साथ प्रशिक्षण से मिलते।
    • रूपक: यह उस छात्र की तरह है जिसने केवल आधी पाठ्यपुस्तक पढ़ी लेकिन पूरी किताब पढ़ने वाले छात्र से बेहतर ग्रेड प्राप्त किया, क्योंकि उसने सही पन्ने पढ़े थे।
  • असली रोबोट पर (वास्तविक दुनिया): उन्होंने वास्तविक रोबोट भुजाओं का उपयोग करके छह वास्तविक दुनिया के कार्यों (जैसे फल उठाना या बोर्ड पोंछना) पर परीक्षण किया।

    • दावा: केवल 66.7% डेटा का उपयोग करके, ATHENA ने वास्तविक रोबोट्स को उस स्थिति से अधिक बार सफल होने में मदद की, जब वे या तो पूरे डेटा का उपयोग करते या प्रत्येक कार्य को अलग से प्रशिक्षित करने की कोशिश करते।
    • रूपक: यह एक कोच की तरह है जो ट्रेनिंग कैंप से उबाऊ और दोहराव वाले अभ्यास को हटा देता है, जिससे केवल उच्च-प्रभाव वाले व्यायाम बचते हैं, जिसके परिणामस्वरूप टीम वास्तविक खेल में बेहतर प्रदर्शन करती है।

सारांश

ATHENA एक ऐसा टूल है जो रोबोट डेवलपर्स को खराब डेटा पर समय और पैसा बर्बाद करने से रोकने में मदद करता है। गणितीय शॉर्टकट का उपयोग करके प्रक्रिया को तेज करने और विभिन्न कार्यों को संतुलित करने के लिए एक "निष्पक्ष जज" प्रणाली का उपयोग करके, यह रोबोट को प्रदर्शनों के एक छोटे, उच्च-गुणवत्ता वाले सेट का उपयोग करके तेजी से और बेहतर तरीके से सीखने की अनुमति देता है।

मुख्य बात: रोबोट को स्मार्ट बनाने के लिए आपको अधिक डेटा की आवश्यकता नहीं है; आपको बेहतर डेटा की आवश्यकता है, और ATHENA वह टूल है जो इसे ढूंढता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →