← नवीनतम पेपर
💻 computer science

Tensor Network Structure Search with Program Synthesis

यह शोध पत्र टेंसर नेटवर्क संरचना खोज के लिए एक प्रोग्राम सिंथेसिस-आधारित दृष्टिकोण प्रस्तुत करता है जो कुशल शीर्षologies (topologies) की पहचान करने के लिए बाधा समाधान (constraint solving) और आउटपुट-निर्देशित विभाजनों (output-directed splits) का उपयोग करता है, जिससे महंगी अपघटन प्रक्रियाओं के बिना, अत्याधुनिक विधियों की तुलना में काफी तेज़ खोज गति और बेहतर संपीड़न अनुपात प्राप्त होता है।

मूल लेखक: Zheng Guo, Aditya Deshpande, Brian Kiedrowski, Xinyu Wang, Alex Gorodetsky

प्रकाशित 2026-03-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Guo, Aditya Deshpande, Brian Kiedrowski, Xinyu Wang, Alex Gorodetsky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास डेटा का एक विशाल, बहु-आयामी (multi-dimensional) पुस्तकालय है। यह केवल एक किताब नहीं है; यह जानकारी का एक विशाल, जटिल 3D (या यहाँ तक कि 10D!) घन (cube) है। इसे वैज्ञानिक टेंसर (Tensor) कहते हैं।

समस्या यह है कि यह "डेटा क्यूब" बहुत भारी है, बहुत बड़ा है, और इसे प्रोसेस करना बहुत धीमा है। आपको इसे बिना इसके महत्वपूर्ण किस्सों को खोए, छोटा करने की आवश्यकता है। इसे कंप्रेशन (compression) कहा जाता है।

वर्षों से, वैज्ञानिक इन क्यूब्स को विशिष्ट आकारों में पुनर्व्यवस्थित करके सिकोड़ने की कोशिश कर रहे हैं, जैसे किताबों को एक लंबी ट्रेन की तरह एक के ऊपर एक रखना (टेंसर ट्रेन्स) या उन्हें एक फैमिली ट्री की तरह व्यवस्थित करना (हायरार्किकल टकर)। लेकिन समस्या यह है कि: हर डेटा के लिए कोई एक "सर्वश्रेष्ठ" आकार नहीं होता। जो आकार इतिहास की किताब के लिए बहुत अच्छा काम करता है, वह भौतिक विज्ञान की पाठ्यपुस्तक के लिए बहुत खराब हो सकता है।

अपने विशिष्ट डेटा के लिए सही आकार खोजना एक अजनबी के लिए सही पोशाक खोजने जैसा है। आपको अनुमान लगाना पड़ता है, उसे पहनकर देखना पड़ता है, देखना पड़ता है कि वह फिट बैठता है या नहीं, और यदि नहीं, तो दूसरा प्रयास करना पड़ता है। विशाल डेटा क्यूब्स के लिए यह करना अविश्वसनीय रूप से धीमा और महंगा है।

यह शोध पत्र इस समस्या को हल करने का एक चतुर तरीका पेश करता है, जिसमें सबसे अच्छे आकार की खोज को एक कंप्यूटर प्रोग्राम लिखने की तरह माना गया है।

पुराना तरीका: "ब्लाइंड टेस्ट-टेस्ट" (अंधा स्वाद परीक्षण)

कल्पना कीजिए कि आप एक शेफ हैं जो सूप की एकदम सही रेसिपी खोजने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप 10,000 अलग-अलग रेसिपी लिखते हैं। आप उनमें से हर एक को पकाते हैं, उनका स्वाद लेते हैं, उनके स्वाद को मापते हैं, और फिर सबसे अच्छी को रखने के लिए 9,999 को फेंक देते हैं।
  • समस्या: 10,000 सूप पकाने में बहुत समय लगता है और आपकी सारी सामग्री खत्म हो जाती है। डेटा की दुनिया में, "पकाना" मतलब पूरे डेटासेट पर भारी गणित (टेंसर डिकंपोजिशन) करना है। यह धीमा और महंगा है।

नया तरीका: "प्रोग्राम सिंथेसिस" शेफ

इस पेपर के लेखक कहते हैं, "आइए यह जानने से पहले कि सूप अच्छा है या नहीं, हर सूप बनाना बंद करें।" इसके बजाय, वे प्रोग्राम सिंथेसिस (Program Synthesis) का उपयोग करते हैं।

एक प्रोग्राम को डेटा को काटने और पुनर्व्यवस्थित करने के निर्देशों के एक सेट के रूप में सोचें।

  • द स्केच (खाका): सूप पकाने के बजाय, आप केवल रेसिपी का विचार लिखते हैं। "नमक डालें, फिर गाजर काटें, फिर धीमी आंच पर पकाएं।" आपने अभी तक इसे पकाया नहीं है; आपने केवल योजना बनाई है।
  • जादुई ट्रिक (कन्स्ट्रेंट सॉल्विंग): चूल्हा जलाने से पहले ही, आप एक स्मार्ट कैलकुलेटर (गणितीय बाधाओं/constraints) का उपयोग करते हैं जो आपकी सामग्रियों (डेटा के गणितीय गुणों) को देखता है और भविष्यवाणी करता है: "यदि मैं इस योजना का पालन करता हूँ, तो सूप बहुत नमकीन होगा," या "यह योजना एक स्वादिष्ट, संक्षिप्त सूप बनाएगी।"
  • परिणाम: आप केवल उन शीर्ष 5 रेसिपी को पकाते हैं जिन्हें कैलकुलेटर सबसे अच्छी बताता है। आप 99% समय और सामग्री बचा लेते हैं।

गुप्त हथियार: "आउटपुट-डायरेक्टेड स्प्लिट्स"

इसे और भी तेज़ बनाने के लिए, लेखकों ने आउटपुट-डायरेक्टेड स्प्लिट्स (Output-Directed Splits) नामक एक नया उपकरण बनाया है।

कल्पना कीजिए कि आप ओरिगामी (origami) के एक विशाल, बिखरे हुए कागज को मोड़ रहे हैं।

  • पुराना तरीका: आप कहीं से भी मोड़ना शुरू कर देते हैं। आप शायद ऊपर बाएं कोने को मोड़ते हैं, फिर नीचे दाएं को, फिर बीच को। अंत में आपके पास एक ऐसा आकार हो सकता है जो दिखने में तो अच्छा है लेकिन वास्तव में बहुत भारी (bulky) है। आप उन मोड़ों पर समय बर्बाद करते हैं जो मदद नहीं करते।
  • नया तरीका (आउटपुट-डायरेक्टेड): आप उस अंतिम आकार को देखते हैं जो आप चाहते हैं (आउटपुट) और पीछे की ओर काम करते हैं। आप कहते हैं, "मुझे अंतिम आकार में बाईं ओर एक नुकीला कान चाहिए।" इसलिए, आप तुरंत जानते हैं कि आपको बाईं ओर को ऊपर मोड़ना ही होगा। आप उन सभी मोड़ों को अनदेखा कर देते हैं जो कान को नीचे की ओर ले जाएंगे।
  • यह कैसे मदद करता है: यह आपको शुरुआत से ही "बुरे विचारों" (सबऑप्टिमल स्ट्रक्चर) पर समय बर्बाद करने से रोकता है। यह सर्च स्पेस को कम (prune) करता है, जिसका अर्थ है कि आप खराब रेसिपी पर विचार भी नहीं करते।

चार-चरणीय पाइपलाइन

पेपर एक चार-चरणीय प्रक्रिया का वर्णन करता है जो एक फैक्ट्री असेंबली लाइन की तरह लगती है:

  1. प्री-कंप्यूटेशन (मैप/नक्शा): कुछ भी करने से पहले, वे डेटा के "कंकाल" (सिंगुलर वैल्यूज) की एक त्वरित तस्वीर लेते हैं। यह हाइकिंग शुरू करने से पहले इलाके के नक्शे को देखने जैसा है। इसमें थोड़ा समय लगता है लेकिन बाद में बहुत बचत होती है।
  2. स्केचिंग (ब्लूप्रिंट/खाका): वे डेटा को काटने के हजारों "ब्लूप्रिंट" तैयार करते हैं। लेकिन वे उन्हें अभी बनाते नहीं हैं। वे केवल योजनाएँ लिखते हैं।
  3. स्कोरिंग (भविष्यवाणी): स्टेप 1 के मैप और एक स्मार्ट मैथ सॉल्वर का उपयोग करके, वे भविष्यवाणी करते हैं कि कौन से ब्लूप्रिंट सबसे छोटे और सबसे कुशल डेटा स्ट्रक्चर का परिणाम देंगे। वे स्ट्रक्चर नहीं बनाते; वे केवल ब्लूप्रिंट को ग्रेड देते हैं।
  4. फाइनल बिल्ड (निर्माण): वे शीर्ष कुछ ब्लूप्रिंट चुनते हैं, वास्तव में उन्हें बनाते हैं (भारी गणित करते हैं), और विजेता चुनते हैं।

यह क्यों मायने रखता है

  • गति (Speed): उन्होंने पाया कि यह तरीका पिछले तरीकों की तुलना में 10 गुना तेज़ है।
  • गुणवत्ता (Quality): संकुचित डेटा अन्य तरीकों की तुलना में 1.5 से 3 गुना छोटा (बेहतर कंप्रेशन) है।
  • स्केलेबिलिटी (Scalability): यह इतने विशाल डेटा को संभाल सकता है कि अन्य तरीके विफल हो जाते हैं।
  • पुन: प्रयोज्यता (Reusability): एक बार जब वे किसी प्रकार के डेटा (जैसे मौसम के पैटर्न) के लिए एकदम सही "आकार" पा लेते हैं, तो वे बिना दोबारा खोज किए उसी आकार का उपयोग नए मौसम डेटा के लिए कर सकते हैं। यह एक बार कपड़ों का एक आदर्श पैटर्न खोजने और फिर उस पैटर्न से अलग-अलग लोगों के लिए नए कपड़े बनाने जैसा है।

संक्षेप में

एक विशाल डेटा क्यूब को सिकोड़ने के हर संभव तरीके को आज़माने के बजाय (जो कि एक डिपार्टमेंट स्टोर में हर पोशाक को आज़माने जैसा है), यह पेपर हमें पहले एक स्मार्ट ब्लूप्रिंट डिजाइन करना सिखाता है। गणित का उपयोग करके यह भविष्यवाणी करने के माध्यम से कि कौन से ब्लूप्रिंट सबसे अच्छा काम करेंगे, और केवल उन डिजाइनों पर ध्यान केंद्रित करके जो वांछित परिणाम की ओर ले जाते हैं, वे बहुत कम समय में बेहतर परिणामों के साथ सबसे सटीक डेटा-सिकुड़ने वाला आकार पा सकते हैं।

यह अंधे होकर अनुमान लगाने और रणनीतिक रूप से योजना बनाने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →