← नवीनतम पेपर
💬 NLP

Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight

यह शोध पत्र इन-कॉन्टेक्स्ट लर्निंग के लिए एक्सट्रैक्टेड टास्क वेक्टर्स के एक बेहतर, सीधे प्रशिक्षित विकल्प के रूप में लर्नड टास्क वेक्टर्स (LTVs) को प्रस्तुत करता है, जबकि यह इस बात की यांत्रिक अंतर्दृष्टि भी प्रदान करता है कि ये वेक्टर्स ट्रांसफॉर्मर मॉडल्स के भीतर विशिष्ट अटेंशन सर्किट्स और लीनियर प्रोपेगेशन पैटर्न के माध्यम से भविष्यवाणियों को कैसे निर्देशित करते हैं।

मूल लेखक: Haolin Yang, Hakaze Cho, Kaize Ding, Naoya Inoue

प्रकाशित 2026-04-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haolin Yang, Hakaze Cho, Kaize Ding, Naoya Inoue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो बहुत सारे तथ्यों को जानता है, लेकिन उसे कोई विशिष्ट नया काम करना नहीं आता, जैसे कि कविता लिखना या गणित की समस्या हल करना।

आमतौर पर, इसे सिखाने के लिए, आपको पूरे रोबोट को फिर से प्रशिक्षित (retrain) करना होगा, जो धीमा और महंगा है। लेकिन इस रोबोट के पास एक जादुई ट्रिक है जिसे इन-कॉन्टेक्स्ट लर्निंग (ICL) कहते हैं। यदि आप उसे सवाल पूछने से ठीक पहले कुछ उदाहरण दिखाते हैं (जैसे कि आपको "खुश" बनाम "दुखी" मूवी रिव्यूज के तीन उदाहरण दिखाना), तो वह अचानक कार्य को समझ जाता है और उसे सही ढंग से करता है।

बड़ा सवाल: यह रोबोट यह कैसे करता है? इसने अभी-अभी जो सबक सीखा है, वह इसे कहाँ "स्टोर" करता है?

पुराना तरीका: मशीन के अंदर "भूत" को खोजना

पिछले शोधकर्ताओं ने सोचा कि रोबोट उन उदाहरणों को उसके मस्तिष्क के भीतर छिपे एक छोटे, अदृश्य "निर्देश मैनुअल" में संकुचित (compress) कर रहा है। उन्होंने इसे एक टास्क वेक्टर (TV) कहा।

हालाँकि, इस मैनुअल को खोजना एक भूत को पकड़ने जैसा था। उन्हें रोबोट के अव्यवस्थित आंतरिक डेटा में खुदाई करनी पड़ती थी, शोर को फ़िल्टर करने के लिए जटिल गणित का उपयोग करना पड़ता था, और यह उम्मीद करनी पड़ती थी कि उन्हें सही "निर्देश" मिल जाएगा। यह धीमा, अविश्वसनीय था, और वास्तव में कोई नहीं समझता था कि एक बार मिल जाने के बाद वह निर्देश कैसे काम करता है।

नया तरीका: "लर्नड" टास्क वेक्टर्स (LTVs)

यह पेपर एक बेहतर दृष्टिकोण पेश करता है: लर्नड टास्क वेक्टर्स (LTVs)

रोबोट के बिखरे हुए दिमाग से निर्देश निकालने की कोशिश करने के बजाय, लेखक कहते हैं: "चलिए इस निर्देश को शुरू से ही लिखते हैं।"

वे टास्क वेक्टर को एक छोटे, कस्टम-मेड चाबी की तरह मानते हैं। वे इस चाबी को सीधे "ट्रेन" करने के लिए एक कंप्यूटर का उपयोग करते हैं, लाखों संस्करणों का परीक्षण करते हैं जब तक कि उन्हें वह सटीक चाबी न मिल जाए जो रोब-ोट की कार्य करने की क्षमता को अनलॉक कर सके।

  • उपमा: कल्पना कीजिए कि पुराना तरीका अंतिम व्यंजन का स्वाद लेकर और उसमें मौजूद सामग्रियों का अनुमान लगाकर गुप्त रेसिपी को कॉपी करने जैसा था। नया तरीका बस उस रेसिपी को कागज पर पूरी तरह से लिखना और शेफ को थमा देना है।
  • परिणाम: ये "लर्नड" चाबियाँ बेहतर, तेज़ काम करती हैं, और उन्हें रोबोट के मस्तिष्क के विभिन्न हिस्सों में उपयोग किया जा सकता है, न कि केवल एक विशिष्ट स्थान पर।

"चाबी" वास्तव में कैसे काम करती है? (तंत्र)

लेखकों ने केवल एक बेहतर चाबी ही नहीं बनाई; उन्होंने यह देखने के लिए रोबोट को खोलकर देखा कि चाबी गियर को कैसे घुमाती है। उन्होंने दो दिलचस्प चीजें पाईं:

1. "विशेषज्ञ गियर" (लो-लेवल इनसाइट)

रोबोट का मस्तिष्क अरबों छोटे गियर्स (जिन्हें अटेंशन हेड्स कहा जाता है) से बना है। लेखकों ने पाया कि टास्क वेक्टर सभी गियर्स से बात नहीं करता है। यह केवल "की गियर्स" (Key Gears) के एक बहुत छोटे, विशिष्ट समूह से बात करता है।

  • उपमा: एक विशाल ऑर्केस्ट्रा की कल्पना करें। जब कंडक्टर (टास्क वेक्टर) चाहता है कि गाना बदले, तो वह हर संगीतकार पर चिल्लाता नहीं है। वह केवल कुछ विशिष्ट वायलिन वादकों और ड्रम वादकों को संकेत देता है। वे कुछ संगीतकार फिर पूरे ऑर्केस्ट्रा की ध्वनि बदल देते हैं।
  • खोज: यदि आप इन "की गियर्स" को हटा देते हैं, तो टास्क वेक्टर काम करना बंद कर देता है। यदि आप रैंडम गियर्स को हटाते हैं, तो कुछ नहीं होता।

2. "रोटेटिंग और स्ट्रेचिंग" का नृत्य (हाई-लेवल इनसाइट)

जैसे-जैसे टास्क वेक्टर रोबोट की परतों (मस्तिष्क के सामने से पीछे तक) के माध्यम से आगे बढ़ता है, यह अपना आकार बदलता है। लेखकों ने पाया कि यह प्रक्रिया आश्चर्यजनक रूप से सरल और रैखिक (linear) है।

  • प्रारंभिक परतें (द रोटेशन): जब वेक्टर रोबोट में शुरुआत में प्रवेश करता है, तो मस्तिष्क इसे रोटेट (घुमाता) करता है।
    • उपमा: कल्पना कीजिए कि आपके पास एक दिशा सूचक यंत्र (compass) है जिसकी सुई उत्तर की ओर इशारा कर रही है। रोबोट इसे घुमाकर पूर्व की ओर कर देता है। यह निर्देश को विशिष्ट कार्य के लिए सही दिशा में उन्मुख (re-orient) कर रहा है।
  • अंतिम परतें (द स्ट्रेचिंग): जब तक वेक्टर मस्तिष्क के अंत तक पहुँचता है, यह घूमना बंद कर देता है। इसके बजाय, मस्तिष्क इसे केवल स्ट्रेच (खींचता) है (इसे बड़ा या छोटा करता है)।
    • उपमा: अब जब कंपास पूर्व की ओर इशारा कर रहा है, तो रोबोट उस दिशा की आवाज़ को तेज कर देता है। यह अंतिम निर्णय को स्पष्ट करने के लिए सिग्नल को एम्प्लीफाई (बढ़ावा) देता है।

यह क्यों महत्वपूर्ण है

यह पेपर दो कारणों से बहुत बड़ी बात है:

  1. व्यावहारिक शक्ति: अब हमारे पास "सुपर-इंस्ट्रक्शंस" बनाने का एक तरीका है जो पूरे मॉडल को फिर से प्रशिक्षित किए बिना AI मॉडल को स्मार्ट और लचीला बनाते हैं। यह एक सामान्य उद्देश्य वाले रोबोट को आपकी ज़रूरत के किसी भी काम के लिए एक विशिष्ट, उच्च-गुणवत्ता वाला मैनुअल देने जैसा है।
  2. "ब्लैक बॉक्स" की समझ: वर्षों से, AI एक "ब्लैक बॉक्स" रहा है—हम जानते हैं कि यह काम करता है, लेकिन हमें नहीं पता कि क्यों। यह पेपर पर्दे को हटा देता है। यह हमें दिखाता है कि रोबोट की "लर्निंग" वास्तव में विचारों को सही दिशा में रोटेट (घुमाने) और अंत में उन्हें एम्प्लीफाई (बढ़ाने) का एक बहुत ही संरचित नृत्य है।

संक्षेप में: लेखकों ने यह अनुमान लगाने की कोशिश करना छोड़ दिया कि रोबोट कैसे सीखता है। इसके बजाय, उन्होंने स्वयं नोट्स लिखे, उन्हें एकदम सटीक बनाया, और पाया कि रोबोट का मस्तिष्क एक सरल, सुरुचिपूर्ण मशीन की तरह काम करता है जिसे बस सही गियर्स को घुमाने के लिए सही चाबी की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →