← नवीनतम पेपर
🤖 machine learning

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

यह शोध पत्र "टास्क टोकन्स" (Task Tokens) को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) आधारित विधि है जो विशिष्ट कार्यों के लिए अवलोकनों (observations) को टोकन में मैप करने हेतु कार्य-विशिष्ट एनकोडर्स सीखकर, फ्रोजन बिहेवियर फाउंडेशन मॉडल्स को विशिष्ट कार्यों के अनुकूल बनाती है, जिससे मॉडल्स की सामान्यीकरण क्षमताओं और लचीलेपन को बनाए रखते हुए प्रदर्शन में सुधार होता है।

मूल लेखक: Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler

प्रकाशित 2026-03-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विश्व-स्तरीय, बहुमुखी अभिनेता है (आइए हम उसे "द फाउंडेशन मॉडल" कहें)। इस अभिनेता ने मानव गति के लाखों घंटों के वीडियो देखने में अपने कई साल बिताए हैं। वह स्वाभाविक मानवीय गरिमा के साथ चलना, दौड़ना, नाचना और कूदना जानता है। यदि आप उससे "आगे बढ़ो" कहते हैं, तो वह इसे खूबसूरती से करता है। यदि आप उसे "गेंद को किक मारो" कहते हैं, तो वह इसे स्वाभाविक रूप से करता है।

हालाँकि, आपको एक बहुत ही विशिष्ट, पेचीदा दृश्य फिल्माना है: "पीछे की ओर एक विशिष्ट स्थान तक चलो, घूम जाओ, और कैमरे की ओर देखते हुए अपने पैर से एक लक्ष्य को किक मारो।"

यदि आप बस उसे यह कह देते हैं, "जाओ यह करो," तो वह भ्रमित हो सकता है। वह आगे चलने के बजाय पीछे चल सकता है, या वह पैर के बजाय हाथ से किक मार सकता है। यही वर्तमान AI रोबोट्स के साथ समस्या है: वे सामान्य गति में बेहतरीन हैं लेकिन बिना गलत हुए विशिष्ट, जटिल निर्देशों का पालन करने में संघर्ष करते हैं।

पारंपरिक रूप से, इसे ठीक करने के लिए, आपको अभिनेता को केवल इसी एक दृश्य को सीखने के लिए महीनों तक वापस एक्टिंग स्कूल भेजना होगा। इसे फाइन-ट्यूनिंग (Fine-Tuning) कहा जाता है। समस्या यह है कि यह महंगा और धीमा है, और जब तक वह लक्ष्य को किक मारना सीख जाता है, तब तक वह स्वाभाविक रूप से चलना भूल सकता है।

"टास्क टोकन्स" (जादुई स्क्रिप्ट नोट्स) से मिलिए

यह पेपर "टास्क टोकन्स" (Task Tokens) नामक एक चतुर नई विधि पेश करता है। अभिनेता को वापस स्कूल भेजने के बजाय, आप उसे एक विशेष, चिपकी हुई पर्ची (टास्क टोकन) देते हैं जिसे वह दृश्य शुरू होने से ठीक पहले पढ़ सकता है।

यह सरल शब्दों में इस प्रकार काम करता है:

1. अभिनेता वही रहता है (द फ्रोजन ब्रेन)

अभिनेता का मस्तिष्क (एक विशाल AI मॉडल) अछूता रहता है। उसने स्वाभाविक रूप से हिलने-डुलने के लिए अपने प्रशिक्षण के सभी वर्षों को बरकरार रखा है। हम जो काम कर रहा है उसे तोड़ना नहीं चाहते।

2. जादुई चिपकी हुई पर्ची (द टास्क टोकन)

हम एक छोटे, अत्यंत बुद्धिमान सहायक (टास्क एनकोडर) को प्रशिक्षित करते हैं जिसका एकमात्र काम अभिनेता के लिए एक "चिपकी हुई पर्ची" लिखना है।

  • लक्ष्य: सहायक विशिष्ट कार्य को देखता है (जैसे, "उस लक्ष्य को हिट करो")।
  • पर्ची: वह एक गुप्त कोड (एक "टोकन") लिखता है जो कहता है, "हे, याद रखो कि कैमरे की ओर चेहरा करना है और पैर से किक मारनी है, लेकिन अपनी चलने की शैली को स्वाभाविक बनाए रखना।"
  • परिणाम: अभिनेता इस नोट को पढ़ता है, इसे अपनी स्वाभाविक प्रवृत्तियों के साथ जोड़ता है, और सटीक चाल का प्रदर्शन करता है।

3. करके सीखना (रीइन्फोर्समेंट लर्निंग)

सहायक सही नोट लिखना कैसे सीखता है?

  • अभिनेता चाल का प्रयास करता है।
  • यदि वह लक्ष्य को हिट करता है, तो सहायक को एक "हाई फाइव" (पुरस्कार/रिवॉर्ड) मिलता है।
  • यदि वह चूक जाता है, तो उसे "फिर से कोशिश करें" (दंड/पेनल्टी) मिलता है।
  • सहायक हाई फाइव पाने के लिए चिपकी हुई पर्ची को बदलने के तरीके जल्दी से सीख जाता है।

यह एक बड़ी बात क्यों है?

1. यह बहुत तेज़ और सस्ता है (दक्षता)
कल्पना कीजिए कि आपको अभिनेता को 100 अलग-अलग दृश्य सिखाने हैं।

  • पुराना तरीका (फाइन-ट्यूनिंग): आपको पूरे अभिनेता के मस्तिष्क को 100 बार फिर से प्रशिक्षित करना होगा। इसमें बहुत समय लगता है और बहुत पैसा खर्च होता है।
  • टास्क टोकन्स वाला तरीका: आप केवल छोटे सहायक को 100 अलग-अलग चिपकी हुई पर्चियाँ लिखना सिखाते हैं। यह एक पूरी विश्वकोश को फिर से लिखने के बजाय 100 छोटे ईमेल लिखने जैसा है। यह पेपर कहता है कि यह 125 गुना अधिक कुशल और 6 गुना तेज़ है।

2. यह "मानवीय" अहसास को बनाए रखता है (मजबूती)
क्योंकि अभिनेता का मस्तिष्क नहीं बदला गया है, वह स्वाभाविक रूप से चलना कभी नहीं भूलता। भले ही फर्श फिसलन भरा हो (कम घर्षण) या गुरुत्वाकर्षण अजीब हो (उच्च गुरुत्वाकर्षण), वह फिर भी एक इंसान की तरह चलता है।

  • उपमा: यदि आप पूरे अभिनेता को फाइन-ट्यून करते हैं, तो वह बर्फ पर पूरी तरह से फिसलना सीख सकता है लेकिन सूखी जमीन पर चलना भूल सकता है। टास्क टोकन्स के साथ, वह किसी भी स्थिति में अपना प्राकृतिक संतुलन बनाए रखता है।

3. यह आपकी बात सुनता है (हाइब्रिड कंट्रोल)
कभी-कभी आप अभिनेता को एक विशिष्ट निर्देश देना चाहते हैं, जैसे "पीछे मत चलो।"

  • टास्क टोकन्स के साथ, आप अपने मानव निर्देश (एक टेक्स्ट प्रॉम्प्ट या जॉइंट पोजीशन) को सहायक की चिपकी हुई पर्ची के साथ मिला सकते हैं।
  • यह ऐसा है जैसे कहना: "यहाँ दृश्य का लक्ष्य है (नोट), और यहाँ एक नियम है: 'सामने की ओर देखो' (प्रॉम्प्ट)।" अभिनेता दोनों का पूरी तरह से पालन करता है।

वास्तविक दुनिया का परीक्षण

शोधकर्ताओं ने इसका परीक्षण एक वीडियो गेम में एक डिजिटल रोबोट पर किया। उन्होंने उससे निम्नलिखित करने को कहा:

  • किसी वस्तु तक पहुँचना।
  • एक विशिष्ट दिशा में चलना।
  • एक लक्ष्य को मारना।
  • एक लंबी छलांग लगाना।

परिणाम:

  • सफलता: रोबोट ने लगभग हर बार लक्ष्यों को हिट किया (90%+ सफलता दर)।
  • गति: इसने अन्य तरीकों की तुलना में बहुत कम समय में कार्यों को सीखा।
  • मानव अध्ययन: जब वास्तविक मनुष्यों ने रोबोट के वीडियो देखे, तो वे अंतर नहीं कर सके कि वह एक रोबोट था। यह पुराने, भारी तरीकों से प्रशिक्षित रोबोटों की तुलना में अधिक स्वाभाविक लग रहा था।

निचोड़

टास्क टोकन्स एक प्रतिभाशाली अभिनेता को हर नए दृश्य के लिए अनुकूलित चीट शीट्स (cheat sheets) देने के समान हैं, बजाय इसके कि उन्हें सब कुछ फिर से सीखने के लिए मजबूर किया जाए।

यह हमें दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त करने की अनुमति देता है:

  1. द जनरलिस्ट: एक रोबोट जो स्वाभाविक रूप से चलता है और अजीब वातावरण को संभाल सकता है (फ्रीज किए गए फाउंडेशन मॉडल की मदद से)।
  2. द स्पेशलिस्ट: एक रोबोट जो बहुत विशिष्ट, कठिन कार्य पूरी तरह से कर सकता है (छोटे, प्रशिक्षित टास्क टोकन की मदद से)।

यह रोबोटों को हमारे अस्त-व्यस्त, वास्तविक घरों और कार्यस्थलों में काम करने के योग्य बनाने की दिशा में एक बड़ा कदम है, बिना हर छोटी नौकरी के लिए उन्हें पुन: प्रोग्राम किए जाने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →