← नवीनतम पेपर
🤖 machine learning

Borrowed Geometry: Computational Reuse of Frozen Text-Pretrained Transformer Weights Across Modalities

यह शोध पत्र यह प्रदर्शित करता है कि फ्रोजन, टेक्स्ट-ओनली प्रीट्रेन गेम्मा 4 31B वेट्स को केवल एक पतले ट्रेन करने योग्य इंटरफेस का उपयोग करके रोबोटिक मैनिपुलेशन, निर्णय लेने और एसोसिएटिव रिकॉल कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए प्रभावी रूप से विभिन्न मोडैलिटीज में स्थानांतरित किया जा सकता है, जो यह सिद्ध करता है कि मॉडल की प्रीट्रेनिंग लोड-बेयरिंग क्षमता उसके विशिष्ट मोडैलिटी या प्रशिक्षण डेटा के बजाय उसके वेट्स में अंतर्निहित है।

मूल लेखक: Abay Bektursun

प्रकाशित 2026-05-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abay Bektursun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक मास्टर शेफ है जिसने अपना पूरा जीवन टेक्स्ट (पाठ) की कला को निखारने में बिताया है। वह शब्दों को काट सकता है, वाक्यों को मिला सकता है, और पैराग्राफ को किसी भी बेहतर तरीके से पका सकता है। यह शेफ एक विशाल, जमे हुए (frozen) कंप्यूटर मस्तिष्क (एक "फ्रोजन" एआई मॉडल जिसे Gemma 4 कहा जाता है) है, जिसने कभी कोई रोबोट, वीडियो गेम या भौतिक वस्तु नहीं देखी है। इसने केवल भाषा को ही प्रोसेस किया है।

अब, कल्पना कीजिए कि आप एक रोबोट को चलना सिखाना चाहते हैं या एक कंप्यूटर को गेम खेलना सिखाना चाहते हैं, लेकिन आप एक नया शेफ शून्य से प्रशिक्षित नहीं करना चाहते। इसके बजाय, आप पूछते हैं: "क्या हम इस टेक्स्ट शेफ के दिमाग को गैर-टेक्स्ट समस्याओं को हल करने के लिए उधार ले सकते हैं?"

यह पेपर कहता है हाँ, लेकिन एक बहुत ही विशिष्ट मोड़ के साथ।

मुख्य विचार: ज्यामिति (Geometry) को उधार लेना

लेखक इस फ्रोजन टेक्स्ट-शेफ के दिमाग को लिखने के उपकरण के रूप में नहीं, बल्कि एक पहले से बने, हाई-टेक किचन के रूप में देखते हैं। वे शेफ के दिमाग को बदलते नहीं हैं (इसके 'वेट्स' "फ्रोजन" हैं)। इसके बजाय, वे एक छोटा, सस्ता "एडॉप्टर" (एक सरल इंटरफ़ेस) बनाते हैं ताकि रोबोट की गतिविधियों या गेम की स्थितियों को उस भाषा में अनुवादित किया जा सके जिसे शेफ समझता है, और फिर शेफ के आउटपुट को वापस क्रियाओं (actions) में अनुवादित किया जा सके।

इसे इस तरह सोचें: शेफ जानता है कि सामग्रियों को पूरी तरह से कैसे व्यवस्थित किया जाए। आपको उन्हें कार बनाना सिखाने की आवश्यकता नहीं है; आपको बस उन्हें कार के पुर्जे ऐसे प्रारूप में देने की आवश्यकता है जिसे वे पहचान सकें, और वे स्वाभाविक रूप से उन्हें असेंबल करना जान जाएंगे क्योंकि उनका मस्तिष्क पहले से ही जटिल संगठन के लिए तैयार है।

बड़ी जीत (उन्होंने वास्तव में क्या किया)

1. वह रोबोट जिसने नाचना सीखा (OGBench)

  • परीक्षण: उन्होंने एक सिम्युलेटेड रोबोट आर्म को ऐसी वस्तु उठाने और हिलाने का प्रयास किया (एक ऐसा कार्य जो उसने पहले कभी नहीं देखा था)।
  • परिणाम: फ्रोजन टेक्स्ट ब्रेन का उपयोग करके, रोबोट ने वर्तमान सर्वश्रेष्ठ विशिष्ट रोबोट सॉफ्टवेयर से बेहतर प्रदर्शन किया।
  • कैच (Catch): यह हर कार्य में पूर्ण नहीं था। एक विशिष्ट "क्यूब" स्टैकिंग कार्य पर, टेक्स्ट-ब्रेन वाला रोबोट वास्तव में विशिष्ट सॉफ्टवेयर से खराब था। हालाँकि, जब उन्होंने टेक्स्ट-ब्रेन रोबोट की तुलना एक रैंडमली इनिशियलाइज्ड ब्रेन (एक ऐसा मस्तिष्क जिसका आकार वही है लेकिन कोई प्रशिक्षण नहीं है) से की, तो टेक्स्ट-ब्रेन 59 अंक बेहतर था।
  • सबक: "फ्रोजन" टेक्स्ट ट्रेनिंग ने एक बड़ी बढ़त प्रदान की। मस्तिष्क केवल एक रैंडम आकार नहीं था; इसने अनुक्रमों (sequences) को व्यवस्थित करने के लिए उपयोगी "मसल मेमोरी" सीखी थी, भले ही इसने यह सब केवल किताबें पढ़कर सीखा हो।

2. चलने वाला रोबोट (D4RL Walker2d)

  • परीक्षण: क्या टेक्स्ट ब्रेन एक रोबोट को चलना सीखने में मदद कर सकता है?
  • परिणाम: हाँ। टेक्स्ट-ब्रेन वाला रोबोट वर्तमान अत्याधुनिक "डिसीजन ट्रांसफॉर्मर" (एक मॉडल जो विशेष रूप से चलने के लिए बनाया गया है) के समान ही अच्छा चला।
  • बोनस: टेक्स्ट-ब्रेन समाधान ने विशिष्ट वॉकर मॉडल की तुलना में आधे से भी कम ट्रेन करने योग्य पैरामीटर्स का उपयोग किया। यह समान परिणाम प्राप्त करने का एक अधिक कुशल तरीका था।

3. "जादुई" मेमोरी टेस्ट (एसोसिएटिव रिकॉल)

  • परीक्षण: एक सरल मेमोरी गेम जहाँ कंप्यूटर को एक पैटर्न याद रखना होता है और बाद में उसे दोहराना होता है।
  • परिणाम: फ्रोजन टेक्स्ट ब्रेन ने, एक छोटे से एडॉप्टर के साथ, इसे पूरी तरह से हल कर लिया। ठीक उसी आकार का एक नया मॉडल, जिसे इस विशिष्ट गेम पर शून्य से प्रशिक्षित किया गया था, पूरी तरह से विफल रहा
  • सबक: टेक्स्ट ब्रेन ने केवल "शब्दों" को नहीं सीखा; इसने पैटर्न और मेमोरी को संभालने का एक मौलिक तरीका सीखा जो गैर-भाषा कार्यों पर भी लागू होता है।

"क्यों": विचार के विशिष्ट "परमाणुओं" को खोजना

सबसे दिलचस्प हिस्सा यह है कि लेखकों ने यह देखने के लिए कि अंदर क्या हो रहा है, दिमाग के भीतर झाँका। उन्होंने केवल यह नहीं कहा कि "यह काम करता है"; उन्होंने उन विशिष्ट गियर्स को खोज निकाला जो घूम रहे थे।

  • प्रयोग: उन्होंने 192 छोटे "अटेंशन हेड्स" (सोचिए कि ये मस्तिष्क के भीतर व्यक्तिगत न्यूरॉन्स या विशेषज्ञ कार्यकर्ता हैं) का अध्ययन किया।
  • खोज: उन्होंने चार विशिष्ट कार्यकर्ताओं (हेड्स) को पाया जो दोहरी भूमिका निभा रहे थे।
    • टेक्स्ट की दुनिया में, ये कार्यकर्ता शब्दों को कॉपी करने या पैटर्न मिलाने (जैसे, यह नोटिस करना कि एक वाक्य में "cat" दो बार आया है) में विशेषज्ञ थे।
    • गैर-टेक्स्ट की दुनिया में (जैसे रोबोट कार्य या मेमोरी गेम), वे वही सटीक चार कार्यकर्ता समस्या को हल करने के लिए सबसे महत्वपूर्ण थे।
  • उपमा: कल्पना कीजिए कि एक कर्मचारी को लाल और नीले मार्बल्स को छाँटने के लिए काम पर रखा गया है। फिर आप उन्हें लाल और नीले कार छाँटने के लिए कहते हैं। वे कारों के मामले में विफल हो जाते हैं, लेकिन आप पाते हैं कि वही विशिष्ट कार्यकर्ता जो मार्बल्स को छाँटने में सबसे अच्छा था, वही स्वाभाविक रूप से कारों को छाँटने का भी ज्ञान रखता है। मस्तिष्क को फिर से प्रशिक्षित करने की आवश्यकता नहीं थी; इसे बस सही "अनुवादक" की आवश्यकता थी जो इसे कारों को दिखा सके।

सीमाएँ (जहाँ यह विफल होता है)

यह पेपर इस बारे में बहुत ईमानदार है कि यह "उधार लेना" कहाँ विफल होता है। टेक्स्ट ब्रेन अनुक्रमों (A से B से C तक) और पैटर्न मिलान के लिए बहुत अच्छा है, लेकिन यह उन चीजों के लिए संघर्ष करता है जिनमें आवश्यकता होती है:

  • 2D स्थानिक सोच (Spatial Thinking): जैसे "गेम ऑफ लाइफ" (एक ग्रिड-आधारित सिमुलेशन) खेलना या भूलभुलैया (maze) में नेविगेट करना। मस्तिष्क एक टेक्स्ट की रेखा के लिए बना है, न कि 2D मैप के लिए।
  • निरंतर सटीकता (Continuous Precision): जैसे रोबोट आर्म को अत्यधिक सहजता से नियंत्रित करना या दशमलव के साथ जटिल गणित करना। यह डिस्क्रीट स्टेप्स के लिए अच्छा है, तरल गति (fluid motion) के लिए नहीं।
  • स्टैकिंग लॉजिक: जैसे जटिल कोड संरचना (Dyck-2) में ब्रैकेट को संतुलित करना। टेक्स्ट ब्रेन वास्तव में इस कार्य में एक साधारण, अनट्रेन्ड मॉडल से भी खराब रहा, जिससे पता चलता है कि अंग्रेजी पढ़ने के सीखने ने अनजाने में मस्तिष्क को इस विशिष्ट प्रकार के तर्क के लिए "ब्लॉक" कर दिया होगा।

सारांश

यह पेपर साबित करता है कि विशेष रूप से टेक्स्ट पर प्रशिक्षित मस्तिष्क में जानकारी को व्यवस्थित करने के लिए एक छिपा हुआ, पुन: प्रयोज्य "ऑपरेटिंग सिस्टम" होता है। आप इस फ्रोजन ब्रेन को ले सकते हैं, इसे एक रोबोट या गेम में प्लग कर सकते हैं, और यह अक्सर शून्य से बनाए गए मॉडलों से बेहतर प्रदर्शन करेगा, क्योंकि इसने पहले से ही चीजों के आपस में जुड़ने के गहरे, संरचनात्मक नियमों को सीख लिया है।

यह जादू नहीं है; यह कंप्यूटेशनल एक्सैप्टेशन (computational exaptation) है। जिस तरह पंख गर्मी के लिए विकसित हुए थे लेकिन बाद में उड़ान के लिए "उधार" लिए गए थे, टेक्स्ट पैटर्न को कॉपी करने और मिलाने की मस्तिष्क की क्षमता को उन रोबोट और मेमोरी समस्याओं को हल करने के लिए "उधार" लिया गया था जिन्हें देखने के लिए इसे कभी डिज़ाइन नहीं किया गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →