← नवीनतम पेपर
🤖 machine learning

On the Power of Foundation Models

यह योगदान श्रेणी सिद्धांत (category theory) का उपयोग करके यह दर्शाता है कि जहाँ प्रॉम्प्ट-आधारित शिक्षण (prompt-based learning) केवल प्रतिनिधित्व योग्य कार्यों तक ही सख्ती से सीमित है, वहीं फाइन-ट्यूनिंग के साथ एक पर्याप्त शक्तिशाली फाउंडेशन मॉडल सैद्धांतिक रूप से अपने प्रीट्रेनिंग कार्य द्वारा परिभाषित श्रेणी के भीतर किसी भी डाउनस्ट्रीम कार्य को हल कर सकता है और संरचनात्मक मानचित्रण (structural mapping) के माध्यम से अनदेखी वस्तुओं तक सामान्यीकरण कर सकता है।

मूल लेखक: Yang Yuan

प्रकाशित 2026-04-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "On the Power of Foundation Models" शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ हिंदी अनुवाद दिया गया है।

बड़ा सवाल: क्या एक 'सुपर-ब्रेन' सब कुछ कर सकता है?

कल्पना कीजिए कि एक छात्र है जिसने ब्रह्मांड की हर किताब पढ़ ली है, जिसके पास सीखने के लिए अनंत समय है, और जो अभ्यास परीक्षणों (practice tests) में कभी कोई गलती नहीं करता। लेखक एक सरल प्रश्न पूछते हैं: यदि यह छात्र अपने अभ्यास परीक्षणों में पूर्ण (perfect) है, तो क्या वह स्वचालित रूप से आपके द्वारा प्रस्तुत की गई हर नई समस्या को हल कर सकता है?

AI की दुनिया में, यह "छात्र" एक फाउंडेशन मॉडल (Foundation Model) है (जैसे ChatGPT या इमेज जनरेटर के पीछे काम करने वाले मॉडल)। "अभ्यास परीक्षणों" को प्रि-टेक्स्ट टास्क (Pretext Tasks) कहा जाता है (जैसे वाक्य में अगला शब्द अनुमान लगाना या यह अंदाजा लगाना कि एक छवि को कैसे घुमाया गया था)।

यह शोध पत्र तर्क देता है कि मौजूदा सिद्धांत (डेटा की मात्रा या कंप्यूटर के आकार के संबंध में) इसका उत्तर नहीं दे सकते। इसके बजाय, लेखक कैटेगरी थ्योरी (Category Theory) का उपयोग करते हैं (जिसे आप "संरचनाओं का व्याकरण" मान सकते हैं) यह निर्धारित करने के लिए कि ये मॉडल क्या कर सकते हैं और क्या नहीं।

उन्होंने इन मॉडलों के नया सीखने के दो मुख्य नियम खोजे हैं:


नियम #1: "प्रॉम्ट" की सीमा (लाइब्रेरी कार्ड की उपमा)

परिदृश्य: आप चाहते हैं कि मॉडल एक नया कार्य करे (जैसे, तस्वीरों में बिल्लियों की पहचान करना), लेकिन आप इसे फिर से प्रशिक्षित (retrain) नहीं करना चाहते। आप बस इसे एक विशिष्ट निर्देश या "प्रॉम्ट" देते हैं (जैसे एक लाइब्रेरी कार्ड जिस पर लिखा हो: "बिल्लियाँ ढूँढो")।

अंतर्दृष्टि: मॉडल केवल तभी नए कार्य को हल कर सकता है जब वह कार्य उसके मूल प्रशिक्षण (original training) की संरचना के भीतर पहले से ही "छिपा" हुआ हो।

उपमा: कल्पना कीजिए कि मॉडल एक लाइब्रेरी (पुस्तकालय) है।

  • प्रि-टेक्स्ट टास्क (प्रशिक्षण) वह तरीका है जिससे लाइब्रेरी ने अपनी किताबों को व्यवस्थित किया है। यदि लाइब्रेरी ने किताबों को केवल "रंग" के आधार पर व्यवस्थित किया है, तो किताबें लाल, नीली और हरी श्रेणियों में बंटी होंगी।
  • प्रॉम्ट ट्यूनिंग (Prompt Tuning) एक लाइब्रेरियन से पूछने जैसा है: "क्या आप मुझे इतिहास की एक किताब ढूंढ कर दे सकते हैं?"
  • परिणाम: यदि लाइब्रेरी को केवल रंग के आधार पर व्यवस्थित किया गया था, तो लाइब्रेरियन इतिहास की किताब नहीं ढूंढ पाएगा, भले ही उसकी याददाश्त कितनी भी अच्छी क्यों न हो। "इतिहास" की श्रेणी लाइब्रेरी की संरचना में मौजूद ही नहीं है।
  • शोध पत्र का प्रमाण: लेखक सिद्ध करते हैं कि यदि प्रशिक्षण कार्य (जैसे छवियों को घुमाना) केवल मॉडल को "घुमाने" के बारे में सिखाता है, तो मॉडल को "सेगमेंटेशन" (चीजों को अलग करने/काटने) जैसे जटिल कार्यों को करने के लिए प्रॉम्ट के माध्यम से तैयार नहीं किया जा सकता, क्योंकि "काटने" की अवधारणा लाइब्रेरी की संरचना में निर्मित नहीं थी।

निष्कर्ष: यदि आप मॉडल को केवल शतरंज खेलना सिखाते हैं, तो आप केवल एक "प्रॉम्ट" के माध्यम से उसे फुटबॉल खेलने के लिए नहीं बना सकते। नया कार्य मॉडल की पुरानी संरचना के माध्यम से दर्शाने योग्य (representable) होना चाहिए।


नियम #2: "फाइन-ट्यूनिंग" की शक्ति (मास्टर की (Master Key) की उपमा)

परिदृश्य: आप मॉडल को नए कार्य के लिए एक छोटा डेटासेट देकर थोड़ा नया प्रशिक्षण (फाइन-ट्यूनिंग) देने के लिए तैयार हैं।

अंतर्दृष्टि: यह बहुत अधिक शक्तिशाली है। यदि मॉडल ने अपने मूल प्रशिक्षण के दौरान दुनिया की "संरचना" को अच्छी तरह से सीख लिया है, तो वह किसी भी नए कार्य को हल कर सकता है, बशर्ते आप उसे पर्याप्त संसाधन (डेटा और कंप्यूटिंग पावर) प्रदान करें ताकि वह कड़ियों को जोड़ सके।

उपमा: कल्पना कीजिए कि मॉडल एक मास्टर की (Master Key) है जिसे एक विशिष्ट इमारत के तालों में फिट होने के लिए तराशा गया है (Pretext Task)।

  • फाइन-ट्यूनिंग (Fine-Tuning) इस मास्टर की को थोड़ा सा फिर से तराशने जैसा है ताकि यह एक अलग इमारत के एक नए दरवाजे में फिट हो सके।
  • परिणाम: जब तक मास्टर की ने पहली इमारत के तालों के सार (essence) को पकड़ लिया है, आप इसे दुनिया के लगभग किसी भी दरवाजे को खोलने के लिए नया आकार दे सकते हैं।
  • शोध पत्र का प्रमाण: लेखक दिखाते हैं कि यदि मॉडल "आदर्श" (ideal) है (जिसने प्रशिक्षण संरचना को पूरी तरह से सीख लिया है), तो इसमें किसी भी डाउनस्ट्रीम कार्य को हल करने के लिए आवश्यक सभी जानकारी शामिल है। नए कार्य के लिए प्रशिक्षण डेटा केवल एक मार्गदर्शक के रूप में कार्य करता है जो मॉडल को यह दिखाता है कि इस जानकारी को कैसे नया आकार देना है।

निष्कर्ष: फाइन-ट्यूनिंग "प्रॉम्ट की प्रतिनिधित्व क्षमता" (representability) से सीमित नहीं है। यदि आधार मजबूत है, तो मॉडल को लगभग किसी भी चीज़ के अनुकूल बनाया जा सकता है।


नियम #3: "जादुई पुल" (अनुवादक की उपमा)

परिदृश्य: क्या होता है जब हम विभिन्न प्रकार के मॉडलों को मिलाते हैं, जैसे कि एक जो टेक्स्ट समझता है और एक जो इमेज समझता है (मल्टीमॉडल लर्निंग)?

अंतर्दृष्टि: शोध पत्र एक "सामान्यीकरण प्रमेय" (Generalization Theorem) प्रस्तुत करता है। यह कहता है कि यदि आप दो अलग-अलग दुनियाओं (जैसे टेक्स्ट और इमेज) के बीच एक आदर्श पुल (गणितीय मैपिंग) बनाते हैं, तो एक दुनिया की संरचना दूसरी दुनिया में सुरक्षित रहती है।

उपमा: कल्पना कीजिए कि एक डिक्शनरी (शब्दकोश) जो "टेक्स्ट" को "इमेज" में पूरी तरह से अनुवाद करती है।

  • टेक्स्ट की दुनिया में, आपके पास एक "एवोकाडो चेयर" (एवोकाडो के आकार की कुर्सी) की अवधारणा है। यह वस्तु वास्तविक दुनिया में मौजूद नहीं हो सकती है, और आपके प्रशिक्षण डेटा में इसकी कोई फोटो मौजूद नहीं है।
  • हालाँकि, चूंकि टेक्स्ट की दुनिया में एक तार्किक संरचना है जहाँ "एवोकाडो" और "चेयर" को जोड़ा जा सकता है, और आपका डिक्शनरी (मॉडल) टेक्स्ट से इमेज में अनुवाद करते समय इस संरचना को पूरी तरह से संरक्षित करता है...
  • परिणाम: मॉडल एक "एवोकाडो चेयर" की एकदम सटीक छवि बना सकता है, भले ही उसने इसे पहले कभी न देखा हो। इसने छवि को रटा नहीं है; इसने शब्दों के बीच के संबंध को समझा और उस संरचना को इमेज की दुनिया पर लागू किया।

शोध पत्र का प्रमाण: यह समझाता है कि DALL-E 2 या CLIP जैसे मॉडल उन चीजों की छवियां क्यों बना सकते हैं जो उनके प्रशिक्षण सेट में मौजूद नहीं थीं। वे केवल नकल नहीं करते; वे नई छवियां बनाने के लिए भाषा की संरचनात्मक तर्क (structural logic) का उपयोग करते हैं।


शोध पत्र के दावों का सारांश

  1. प्रॉम्टिंग सीमित है: आप मॉडल को केवल उन्हीं चीजों के लिए प्रॉम्ट कर सकते हैं जो उसके प्रशिक्षण के तरीके में पहले से ही "निर्मित" हैं। यदि प्रशिक्षण ने उसे नए कार्य की संरचना नहीं सिखाई है, तो एक साधारण प्रॉम्ट काम नहीं करेगा।
  2. फाइन-ट्यूनिंग शक्तिशाली है: यदि आप थोड़ा अतिरिक्त प्रशिक्षण देने के लिए तैयार हैं, तो एक मॉडल जिसने एक अच्छी संरचना सीखी है, उसे किसी भी कार्य को हल करने के लिए अनुकूलित किया जा सकता है।
  3. संरचना नए का निर्माण करती है: एक डोमेन (जैसे टेक्स्ट) की संरचना को दूसरे डोमेन (जैसे इमेज) पर पूरी तरह से मैप करके, मॉडल ऐसी चीजें बना सकते हैं जो पहले कभी अस्तित्व में नहीं थीं (जैसे एक एवोकाडो चेयर), क्योंकि वे केवल छवियों को याद करने के बजाय संरचना के तार्किक नियमों का पालन करते हैं।

लेखक इस बात पर जोर देते हैं कि वे विशिष्ट नेटवर्क आकार या डेटा मात्रा के बारे में बात नहीं कर रहे हैं, बल्कि स्वयं कार्यों की तार्किक संरचना (logical structure) के बारे में बात कर रहे हैं। वे गणित का उपयोग यह सिद्ध करने के लिए करते हैं कि प्रशिक्षण कार्य का "आकार" ही यह निर्धारित करता है कि मॉडल अंततः क्या कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →