← नवीनतम पेपर
💻 computer science

HTAM: Hierarchical Transition-Attended Memory for Operator Optimization

यह शोधपत्र HTAM प्रस्तुत करता है, जो एक पदानुक्रमित ढांचा (hierarchical framework) है जो LLM-आधारित GPU ऑपरेटर जनरेशन को निर्देशित करने के लिए अनुकूलन अनुभव (optimization experience) को एक मोटे-से-सूक्ष्म संक्रमण ग्राफ (coarse-to-fine transition graph) में व्यवस्थित करता है, जिससे ग्रैनुलैरिटी मिसमैच (granularity mismatches) का समाधान होता है और कर्नेल की शुद्धता एवं प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yining Zhang, Mingyang Yi, Chen Wang, Xuwen Xiang, Tianhe Jia, Zedong Dan, Chengqing Zong, Yue Wang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yining Zhang, Mingyang Yi, Chen Wang, Xuwen Xiang, Tianhe Jia, Zedong Dan, Chengqing Zong, Yue Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (apprentice) को दुनिया की सबसे तेज़ रेस कार का इंजन बनाना सिखाने की कोशिश कर रहे हैं। आपके पास ब्लूप्रिंट्स की एक लाइब्रेरी है, लेकिन प्रशिक्षु अक्सर विवरणों में खो जाता है या ऐसे बदलावों का सुझाव देता है जो सुनने में तो अच्छे लगते हैं लेकिन इंजन को खराब कर देते हैं।

यह पेपर HTAM (Hierarchical Transition-Attended Memory) पेश करता है, जो एक नया "स्मार्ट मेंटर" सिस्टम है जिसे ग्राफिक्स कार्ड (GPUs) के लिए उच्च-प्रदर्शन वाला कंप्यूटर कोड लिखने में लार्ज लैंग्वेज मॉडेल्स (LLMs) की मदद करने के लिए डिज़ाइन किया गया है।

HTAM कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

समस्या: "बहुत व्यापक बनाम बहुत सूक्ष्म" का जाल

वर्तमान में, जब AI कंप्यूटर कोड को ठीक करने की कोशिश करता है, तो उसे एक दुविधा का सामना करना पड़ता है:

  • "अस्पष्ट संकेत" वाला दृष्टिकोण: AI को एक व्यापक सुझाव मिलता है जैसे, "मेमोरी एक्सेस को तेज़ करें।" इसे याद रखना आसान है, लेकिन यह बहुत अमूर्त (abstract) है। AI को यह नहीं पता कि वास्तव में कोड को बदलने के लिए क्या करना है ताकि वह तेज़ हो सके।
  • "अत्यधिक विस्तृत" दृष्टिकोण: AI को किए गए हर एक छोटे से कोड परिवर्तन की एक विशाल सूची मिलती है। यह बहुत अधिक जानकारी है। यह लाखों स्क्रू से भरे गोदाम में एक विशिष्ट स्क्रू खोजने की कोशिश करने जैसा है; AI अभिभूत (overwhelmed) हो जाता है और सही कदम नहीं उठा पाता।

समाधान: "मास्टर शेफ की रेसिपी बुक"

HTAM इसे एक मास्टर शेफ की रेसिपी बुक की तरह व्यवस्थित करके हल करता है, जो तीन परतों में संरचित है:

  1. मेनू (ग्लोबल निर्देश): पहले, सिस्टम पूछता है, "मुख्य लक्ष्य क्या है?" क्या समस्या यह है कि कार में ईंधन कम पड़ रहा है (मेमोरी एक्सेस)? क्या समस्या यह है कि इंजन ओवरहीट हो रहा है (डेटा पुन: उपयोग/Data Reuse)? क्या समस्या यह है कि पहिए बहुत तेज़ी से घूम रहे हैं (पैरेललिज्म)?

    • उपमा: यह तय करने जैसा है कि, "आज, हम ब्रेक ठीक कर रहे हैं," बजाय इसके कि पूरे कार को एक साथ ठीक करने की कोशिश की जाए।
  2. विशिष्ट रेसिपी (लोकल रणनीतियाँ): एक बार लक्ष्य सेट हो जाने के बाद (जैसे, "ब्रेक ठीक करें"), सिस्टम उस लक्ष्य के लिए विशिष्ट, सिद्ध तकनीकों को खोजता है।

    • उपमा: केवल "ब्रेक ठीक करें" कहने के बजाय, यह एक विशिष्ट रेसिपी निकालता है: "ब्रेक पैड को बदलकर सिरेमिक वाले लगाएं" या "हाइड्रोलिक दबाव को समायोजित करें।" ये ठोस, कार्रवाई योग्य कदम हैं जिन्हें AI वास्तव में कोड में लिख सकता है।
  3. "अगला कदम" मानचित्र (ट्रांजिशन अनुभव): यही असली सीक्रेट सॉस है। HTAM न केवल यह याद रखता है कि क्या करना है, बल्कि यह भी कि आगे क्या करना है।

    • उपमा: एक मास्टर शेफ जानता है कि "मीट को सीयर (sear) करने" के बाद, अगला तार्किक कदम "पैन को डीग्लेज (deglaze) करना" है। यदि आप सीयर करने से पहले "डीग्लेज" करने की कोशिश करते हैं, तो यह काम नहीं करेगा। HTAM इन अनुक्रमों (sequences) को सीखता है। वह जानता है कि यदि उसने अभी "मेमोरी एक्सेस" को ठीक किया है, तो अगला सबसे अच्छा कदम "डेटा पुन: उपयोग" हो सकता है, न कि "बाउंड्री हैंडलिंग"।

यह व्यवहार में कैसे काम करता है

सिस्टम एक लूप में चलता है, जो एक कोच की तरह प्रशिक्षु का मार्गदर्शन करता है:

  1. स्कोरबोर्ड चेक करें: AI वर्तमान कोड को देखता है और देखता है कि वह कहाँ धीमा या टूटा हुआ है।
  2. एक लक्ष्य चुनें: अपने "मेनू" (ग्लोबल मेमोरी) का उपयोग करके, यह एक उच्च-स्तरीय दिशा चुनता है (जैसे, "आइए डेटा के आवागमन को अनुकूलित करें")।
  3. एक कदम चुनें: अपनी "रेसिपी" (लोकल मेमोरी) का उपयोग करके, यह एक विशिष्ट कोड परिवर्तन चुनता है (जैसे, "डेटा लोड करने के लिए एक तेज़ तरीके का उपयोग करें")।
  4. इतिहास देखें: कदम उठाने से पहले, यह अपने "अगला कदम मानचित्र" (ट्रांजिशन मेमोरी) की जाँच करता है। यह पूछता है, "हमने अभी X किया; क्या इतिहास बताता है कि इसके बाद Y करना एक अच्छा विचार है?"
  5. लिखें और टेस्ट करें: AI नया कोड लिखता है, उसका परीक्षण करता है, और यदि यह काम करता है, तो यह अपनी रेसिपी बुक में इस नई सफलता को अपडेट करता है। यदि यह विफल हो जाता है, तो यह बुक में अपडेट करता है कि क्या नहीं करना है।

परिणाम: एक तेज़, स्मार्ट प्रशिक्षु

लेखकों ने इस सिस्टम का परीक्षण KernelBench पर किया, जो GPU कोड प्रदर्शन का एक मानक टेस्ट सूट है।

  • सटीकता (Accuracy): सिस्टम ने 98.4% बार कोड को सही ढंग से लिखा (मानक AI की तुलना में बहुत कम दर के मुकाबले)।
  • गति (Speed): इसने 84% बार सबसे तेज़ समाधान खोजा।
  • प्रदर्शन (Performance): इसके द्वारा लिखा गया कोड, औसतन, मानक AI विधियों द्वारा लिखे गए कोड की तुलना में लगभग 2 गुना तेज़ था।

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि इस तरह से मेमोरी को व्यवस्थित करके—"बड़ी तस्वीर" को "सूक्ष्म विवरणों" से अलग करके और संचालन के क्रम को याद रखकर—HTAM एक अराजक खोज को एक संरचित, कुशल यात्रा में बदल देता है। यह केवल अनुमान नहीं लगाता; यह विशेषज्ञ निर्णयों के सीखे हुए पथ का अनुसरण करता है, जिससे यह आधुनिक AI और ग्राफिक्स अनुप्रयोगों के लिए आवश्यक जटिल, उच्च-गति वाला कोड लिखने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →