← नवीनतम पेपर
🤖 machine learning

Distillation of Foundation Models for Time-dependent PDEs

यह शोध पत्र TREX का प्रस्ताव करता है, जो एक नॉलेज डिस्टिलेशन फ्रेमवर्क है जो टाइम-डिपेंडेंट PDEs के लिए कॉम्पैक्ट और कुशल स्टूडेंट नेटवर्क्स को प्रशिक्षित करने के लिए फाइन-ट्यून्ड फाउंडेशन मॉडल्स से सिंथेटिक लॉन्ग-होरिज़न ट्रेजेक्टरीज जनरेट करता है, जिससे मूल मॉडल की सटीकता को बनाए रखते हुए या उससे बेहतर प्रदर्शन करते हुए पैरामीटर्स और इन्फरेंस लेटेंसी में महत्वपूर्ण कमी आती है।

मूल लेखक: Daniel Musekamp, Boshra Ariguib, Andrei Manolache, Mathias Niepert

प्रकाशित 2026-08-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel Musekamp, Boshra Ariguib, Andrei Manolache, Mathias Niepert

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अराजक प्रणाली (chaotic system) के भविष्य की भविष्यवाणी करने की कोशिश कर रहे हैं, जैसे कि एक घूमता हुआ तूफान, बहती हुई नदी, या एक धातु की प्लेट के माध्यम से फैलती गर्मी। भौतिक विज्ञान की दुनिया में, इन्हें आंशिक अवकल समीकरणों (Partial Differential Equations - PDEs) नामक समीकरणों द्वारा वर्णित किया जाता है। इन समीकरणों को हल करना एक ऐसी भूलभुलैया में रास्ता खोजने जैसा है जहाँ दीवारें लगातार हिल रही हों; यह अविश्वसनीय रूप से कठिन है और आमतौर पर इसके लिए संख्याओं को चरण-दर-चरण प्रोसेस करने के लिए सुपरकंप्यूटरों की आवश्यकता होती है। हाल ही में, वैज्ञानिकों ने "फाउंडेशन मॉडल्स" (Foundation Models) बनाए हैं—विशाल, सर्वज्ञ AI मस्तिष्क जिन्हें हजारों विभिन्न भौतिक समस्याओं पर प्रशिक्षित किया गया है। ये दिग्गज नए कार्यों को तेजी से सीख सकते हैं, लेकिन वे इतने विशाल और धीमे हैं कि उनका उपयोग रोबोटिक हाथ को नियंत्रित करने या अगले सेकंड के मौसम की भविष्यवाणी करने जैसे वास्तविक समय (real-time) के कार्यों के लिए नहीं किया जा सकता है। वे एक अत्यंत बुद्धिमान लेकिन सुस्त लाइब्रेरियन की तरह हैं जिसे एक भी प्रश्न का उत्तर देने से पहले पुस्तकालय की हर किताब पढ़नी पड़ती है।

बड़ा सवाल यह है: क्या हम एक नन्हे, तेज़ और फुर्तीले छात्र AI को ठीक उसी तरह सोचने के लिए सिखा सकते हैं जैसे वह विशाल लाइब्रेरियन सोचता है, बिना उस विशालकाय मॉडल को हर बार सारा काम करने की आवश्यकता के? यह "नॉलेज डिस्टिलेशन" (knowledge distillation) की चुनौती है। आमतौर पर, एक छात्र को सिखाने के लिए आपको बहुत सारे उदाहरणों की आवश्यकता होती है। लेकिन वास्तविक दुनिया में, हमारे पास अक्सर केवल कुछ स्नैपशॉट्स होते हैं (जैसे सेंसर से वीडियो के कुछ सेकंड) और हमें अन्य परिदृश्यों के लिए शुरुआती स्थितियों (starting conditions) का कोई अंदाजा नहीं होता। जिस शोध पत्र को आप पढ़ने जा रहे हैं, वह ठीक इसी समस्या को संबोधित करता है: कैसे एक धीमे, शक्तिशाली AI शिक्षक के ज्ञान को एक तेज़, छोटे छात्र में संकुचित किया जाए, भले ही हमारे पास छात्र को शुरू से प्रशिक्षित करने के लिए पर्याप्त डेटा न हो।


TREX की कहानी: एक विशालकाय की तरह सोचने के लिए एक नन्हे रोबोट को सिखाना

मिलिए TREX (टीचर रोलआउट एक्सटेंशन) से। यह डैनियल म्यूज़कैम्प और उनकी टीम द्वारा "धीमे दिग्गज" वाली समस्या को हल करने के लिए बनाया गया एक चतुर नया तरीका है। कल्पना कीजिए कि आपके पास एक मास्टर शेफ (फाउंडेशन मॉडल) है जिसने लाखों व्यंजन पकाए हैं और जानता है कि समय के साथ स्वाद कैसे बदलता है। आप एक युवा प्रशिक्षु (स्टूडेंट मॉडल) को उसी तरह खाना बनाना सिखाना चाहते हैं, लेकिन आपके पास केवल तीन रेसिपी हैं और सीखने के लिए बहुत कम समय है। यदि आप केवल उन तीन रेसिपी पर प्रशिक्षु को अभ्यास करने देते हैं, तो सामग्री में थोड़ा सा बदलाव होने पर वे अटक सकते हैं या गलतियाँ कर सकते हैं।

समस्या यह है कि मास्टर शेफ प्रशिक्षु के देखने के लिए हर बार नए व्यंजन बनाने के लिए बहुत धीमा है। और आप शेफ से नई सामग्रियों की "कल्पना" करने के लिए भी नहीं कह सकते क्योंकि आपको पता नहीं है कि वास्तविक दुनिया में प्रशिक्षु को वास्तव में किन सामग्रियों को संभालने की आवश्यकता होगी।

यहाँ TREX रचनात्मक होता है। मास्टर शेफ को हर बार नए व्यंजन शून्य से बनाने के लिए प्रतीक्षा करने के बजाय, TREX उसे आपके पास मौजूद कुछ रेसिपी को भविष्य में "रोल आउट" (roll out) करने की अनुमति देता है। इसे इस प्रकार समझें: मास्टर शेफ आपके केक की एक रेसिपी लेता है और कहता है, "ठीक है, आइए इसे पकाते हैं, फिर इसे फिर से पकाते हैं, और फिर से, और फिर से, सौ चरणों तक।" यह एक लंबी, काल्पनिक समयरेखा बनाता है कि वह केक कैसे विकसित होता है।

लेकिन यहाँ एक मोड़ है: कभी-कभी वास्तविक दुनिया अस्त-व्यस्त हो जाती है। हवा का एक झोंका आता है, एक चम्मच गिर जाता है, या तापमान बढ़ जाता है। प्रशिक्षु को इसके लिए तैयार करने के लिए, TREX कभी-कभी मास्टर शेफ द्वारा रोल आउट करते समय केक पर थोड़ा सा "शोर" (noise) (जैसे कि एक हल्का झटका या यादृच्छिक मसाले का छिड़काव) डाल देता है। मास्टर शेफ को फिर उस बिखरी हुई स्थिति से केक को ठीक करने और खाना पकाने को जारी रखने का तरीका खोजना पड़ता है। यह प्रशिक्षु को न केवल एक आदर्श केक बनाना सिखाता है, बल्कि यह भी सिखाता है कि चीजें गलत होने पर कैसे सुधार किया जाए।

जादुगर जैसा परिणाम:
इस पद्धति का उपयोग करके, शोधकर्ताओं ने पाया कि वे एक बहुत ही छोटा छात्र मॉडल प्रशिक्षित कर सकते जो विशाल शिक्षक से 3,604 गुना छोटा है। फिर भी, यह छोटा छात्र भौतिक प्रणाली के भविष्य की उतनी ही सटीकता से भविष्यवाणी कर सकता है जितना कि विशाल मॉडल। वास्तव में, कुछ परीक्षणों में, छात्र दीर्घकालिक भविष्यवाणियों में और भी अधिक सटीक था क्योंकि इसने अधिक स्थिरता सीखी और यह विशाल मॉडल की तरह छोटी त्रुटियों से भ्रमित नहीं हुआ।

यह क्यों मायने रखता है?
विशाल मॉडल एक ऐसी फेरारी की तरह हैं जो प्रति गैलन केवल 2 मील चलती है—यह सीधी रेखा में तेज़ है लेकिन रोज़मर्रा के कार्यों के लिए बहुत महंगी है। TREX द्वारा प्रशिक्षित छात्र मॉडल एक ईंधन-कुशल इलेक्ट्रिक स्कूटर की तरह हैं। वे हैं:

  • तेज़: वे विशाल मॉडल की तुलना में 10 गुना अधिक तेज़ भविष्यवाणियां कर सकते हैं।
  • हल्के: वे कंप्यूटर मेमोरी का एक छोटा हिस्सा (लगभग 3.2 गुना कम) उपयोग करते हैं।
  • स्मार्ट: उन्हें उनके दिमाग में विशेष "भौतिक नियमों" (जैसे कि यह जानना कि यदि आप एक तरल पदार्थ को घुमाते हैं, तो भौतिकी को भी घूमना चाहिए) के साथ बनाया जा सकता है, जिसका विशाल मॉडल सख्ती से पालन नहीं करता था।

शोधकर्ताओं ने क्या खारिज किया?
टीम ने यह सुनिश्चित करने के लिए परीक्षण किया कि क्या उन्हें यह काम करने के लिए "प्रारंभिक स्थितियों" (ब्रह्मांड की सटीक शुरुआती अवस्था) को जानने की वास्तव में आवश्यकता है। उन्होंने पाया कि आपको शुरुआती अवस्थाओं के पूर्ण वितरण को जानने की आवश्यकता नहीं है। आप बस अपने पास मौजूद कुछ डेटा बिंदुओं से शुरू कर सकते हैं और बाकी के लिए शिक्षक को "रोल आउट" करने दें। उन्होंने यह भी दिखाया कि केवल शिक्षक के उत्तरों की नकल करना पर्याप्त नहीं है; "नॉइज़ी रोलआउट्स" (अस्त-व्यस्त, झटकेदार अभ्यास रन) यह सीखने के लिए महत्वपूर्ण हैं कि वास्तविक दुनिया की अराजकता को कैसे संभाला जाए।

वे कितने आश्वस्त हैं?
शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने तरल गतिशीलता (जैसे पानी का बहना) और संपीड़ित गैस (जैसे जेट इंजन में हवा) सहित कई अलग-अलग भौतिक समस्याओं पर नंबर चलाए। उन्होंने इसे दो अलग-अलग विशाल AI शिक्षकों (जिन्हें पोसिडॉन और वालरस कहा जाता है) पर टेस्ट किया और पाया कि TREX विधि ने लगातार ऐसे छात्र बनाए जो शिक्षकों की सटीकता के बराबर या उससे बेहतर थे। उन्होंने यह भी परीक्षण किया कि क्या होता है यदि आप "शोर" (noise) या "ग्राउंड ट्रुथ" (ground truth) डेटा को हटा देते हैं, और विधि अभी भी टिकी रही, हालांकि यह दोनों के साथ सबसे अच्छा काम करती है।

संक्षेप में, TREX एक विशाल AI की सुपर-इंटेलिजेंस को एक छोटे, सुपर-फास्ट टूल में बदलने का एक तरीका है जिसे सामान्य कंप्यूटरों पर चलाया जा सकता है, जिससे मौसम के पूर्वानुमान, इंजीनियरिंग डिजाइन या रोबोट को नियंत्रित करने जैसी चीजों के लिए वास्तविक समय के भौतिक सिमुलेशन संभव हो जाते हैं। यह एक जीनियस की लाइब्रेरी को एक एकल, अत्यंत स्मार्ट पॉकेट गाइड में सिकोड़ने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →