← नवीनतम पेपर
🤖 AI

A Benchmark Dataset for Graph Regression with Homogeneous and Multi-Relational Variants

यह योगदान RelSC को प्रस्तुत करता है, जो ग्राफ रिग्रेशन के लिए एक नवीन बेंचमार्क डेटासेट है, जिसे रनटाइम लेबल वाले प्रोग्राम ग्राफ से प्राप्त किया गया है और यह होमोजेनियस एवं मल्टी-रिलेशनल दोनों वेरिएंट्स में उपलब्ध है ताकि यह मूल्यांकन किया जा सके कि संरचनात्मक प्रतिनिधित्व के निर्णय मॉडल के प्रदर्शन को कैसे प्रभावित करते हैं।

मूल लेखक: Peter Samoaa, Marcus Vukojevic, Morteza Haghir Chehreghani, Antonio Longa

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peter Samoaa, Marcus Vukojevic, Morteza Haghir Chehreghani, Antonio Longa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि किसी सॉफ़्टवेयर प्रोग्राम को चलने में कितना समय लगता है। ऐसा करने के लिए, आपको रोबोट को कोड की एक छवि दिखानी होगी। लेकिन सिर्फ कोई साधारण छवि नहीं—एक विशेष मानचित्र जो यह दर्शाता है कि कोड के विभिन्न हिस्से एक-दूसरे के साथ कैसे संवाद करते हैं।

यह लेख एक नए, विशाल "प्रशिक्षण हॉल" (डेटासेट) RelSC का परिचय देता है, ताकि शोधकर्ता इस विशिष्ट कार्य के लिए बेहतर रोबों (AI मॉडल्स) को विकसित करने में मदद कर सकें। यहाँ उन्होंने जो किया है, उसका विवरण सरल उपमाओं (analogies) का उपयोग करके दिया गया है।

समस्या: रोबोट का आहार बहुत उबाऊ है

वर्तमान में, अधिकांश AI मॉडल जो ग्राफ (संबंधों के मानचित्र) का विश्लेषण करते हैं, उन्हें बहुत सीमित आहार दिया जाता है। वे मुख्य रूप से अणुओं (जैसे दवाइयाँ बनाने के लिए उपयोग किए जाने वाले रासायनिक यौगिक) या उद्धरण नेटवर्क (जैसे कि वैज्ञानिक शोध पत्रों में किसने किसे उद्धृत किया, इसका एक मानचित्र) को खाते हैं।

लेखक तर्क देते हैं कि यह एक ऐसे शेफ की तरह है जो केवल सेब के साथ खाना बनाना जानता है। वे AI को सब कुछ बनाना सिखाना चाहते हैं, जिसमें सॉफ़्टवेयर कोड भी शामिल है। फिर भी, सॉफ़्टवेयर प्रदर्शन के लिए कोई अच्छा "कुकबुक" (डेटासेट) उपलब्ध नहीं था।

समाधान: एक नया "कोड प्रशिक्षण हॉल" (RelSC)

लेखकों ने RelSC बनाया, जो जावा प्रोग्रामों का एक विशाल संग्रह है जो उनके वास्तविक "एक्ज़ीक्यूशन टाइम" (उन्हें चलने में कितना समय लगा) के साथ जुड़े हुए हैं। कल्पना कीजिए कि यह एक ऐसा पुस्तकालय है जहाँ हर किताब (कोड) के साथ एक स्टॉपवॉच आती है।

उन्होंने AI को यह सिखाने के लिए कि वह कैसे सीखता है, इस लाइब्रेरी को दो अलग-अलग "फ्लेवर" में बनाया है:

  1. RelSC-H (होमोजेनियस वर्ज़न):

    • उपमा: एक शहर के मानचित्र की कल्पना करें जहाँ हर सड़क केवल एक "सड़क" है। आप सड़कों को देख सकते हैं, लेकिन आप यह नहीं जानते कि वह सड़क हाईवे है, कच्चा रास्ता है, या साइकिल लेन है। यह सब बस एक "कनेक्शन" है।
    • लेख में: यह वर्ज़न कोड को एक ऐसे ग्राफ में बदल देता है जहाँ सभी संबंध एक जैसे दिखते हैं, लेकिन "इमारतें" (नोड्स) इस बारे में समृद्ध विवरण रखती हैं कि वे क्या हैं (जैसे, "यह एक गणितीय ऑपरेशन है," "यह एक वेरिएबल है")।
  2. RelSC-M (मल्टी-रिलेशनल वर्ज़न):

    • उपमा: अब उसी शहर के मानचित्र की कल्पना करें, लेकिन सड़कें रंगीन और लेबल वाली हैं। आपके पास हाईवे हैं (एक वेरिएबल से दूसरे वेरिएबल तक बहता हुआ डेटा), ट्रैफिक लाइटें हैं (if/else निर्णय), और एकतरफा सड़कें हैं (लूप्स)।
    • लेख में: यह वर्ज़न कनेक्शन के विशिष्ट "प्रकारों" को सुरक्षित रखता है। यह AI को बताता है: "यह लाइन एक वेरिएबल को एक गणितीय ऑपरेशन से जोड़ती है" या "यह लाइन एक कंडीशन को एक लूप से जोड़ती है।" यह एक बहुत अधिक विस्तृत, जटिल मानचित्र है।

उन्होंने मानचित्र कैसे बनाए

कोड को इन मानचित्रों में बदलने के लिए, उन्होंने केक की परतों की तरह तीन मानक कंप्यूटर विज्ञान उपकरणों का उपयोग किया:

  • AST (कंकाल): कोड की बुनियादी संरचना (जैसे घर का ढांचा)।
  • CFG (ट्रैफिक फ्लो): प्रोग्राम कैसे आगे बढ़ता है (जैसे ट्रैफिक लाइट और टर्न सिग्नल)।
  • DFG (पानी के पाइप): डेटा कैसे चलता है और बदलता है (जैसे पाइपों के माध्यम से बहता पानी)।

उन्होंने इन तीनों को कोड व्यवहार के एक सुपर-विस्तृत मानचित्र में मिला दिया।

प्रयोग: किसने सबसे अच्छा सीखा?

लेखकों ने विभिन्न AI मॉडल्स (ग्राफ न्यूरल नेटवर्क्स) को इस प्रशिक्षण हॉल में रखा ताकि यह देखा जा सके कि वे एक्ज़ीक्यूशन टाइम का कितनी अच्छी तरह से अनुमान लगा सकते हैं।

  • परिणाम:
    • वे AI मॉडल जिन्होंने ग्राफ मानचित्रों (RelSC) का उपयोग किया, वे उन मॉडल्स की तुलना में समय का अनुमान लगाने में बेहतर थे जो केवल कोड को टेक्स्ट या सरल पेड़ों के रूप में पढ़ते थे।
    • चौंकाने वाली अंतर्दृष्टि: हालांकि RelSC-M (विस्तृत, मल्टी-लेन हाईवे मैप) में अधिक जानकारी थी, लेकिन मॉडल कभी-कभी RelSC-H (सरल, सिंगल-लेन मैप) के साथ बेहतर प्रदर्शन करते थे।
    • मुख्य बात: यह सुझाव देता है कि बहुत अधिक विवरण, या गलत प्रकार के विवरण, कभी-कभी AI को भ्रमित कर सकते हैं। यह एक ड्राइवर को एक ऐसे मानचित्र देने जैसा है जहाँ हर गड्ढे को चिह्नित किया गया है; कभी-कभी एक सरल मानचित्र नेविगेट करने में आसान होता है।

यह क्यों महत्वपूर्ण है

लेख का दावा है कि यह डेटासेट एक "चुनौतीपूर्ण और बहुमुखी बेंचमार्क" है। यह AI शोधकर्ताओं को केवल अणुओं पर परीक्षण करना बंद करने और वास्तविक सॉफ़्टवेयर संरचनाओं पर परीक्षण करने के लिए मजबूर करता है।

संक्षेप में: लेखकों ने AI के लिए यह सीखने हेतु एक नया, विविध प्रशिक्षण मैदान बनाया है कि सॉफ़्टवेयर की गति का अनुमान कैसे लगाया जाए। उन्होंने दिखाया है कि हालांकि कोड के विस्तृत मानचित्र शक्तिशाली होते हैं, लेकिन इन मानचित्रों को बनाने का तरीका उतना ही महत्वपूर्ण है जितना कि उनके भीतर की जानकारी। अब वे इस "प्रशिक्षण हॉल" को सभी के लिए उपलब्ध करा रहे हैं ताकि अन्य लोग बेहतर रोबोट बनाने की कोशिश कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →