← नवीनतम पेपर
💻 computer science

GraphInstruct: A Progressive Benchmark for Diagnosing Capability Gaps in LLM Graph Generation

यह शोध पत्र GraphInstruct प्रस्तुत करता है, जो एक प्रगतिशील बेंचमार्क है जिसमें छह जटिलता स्तर और पांच मूल्यांकन आयाम शामिल हैं ताकि LLM ग्राफ जनरेशन में क्षमता अंतराल का निदान किया जा सके, जो यह प्रकट करता है कि बहु-प्रतिबंध संरचना (multi-constraint composition) प्राथमिक बाधा है और यह प्रदर्शित करता है कि सत्यापन-निर्देशित पुनरावृत्ति ढांचा (verification-guided iterative framework), जो प्रतिबंध-जागरूक अनुकूल प्रॉम्प्टिंग (constraint-aware adaptive prompting) के साथ है, मानक प्रॉम्प्टिंग रणनीतियों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Zihe Wei, Sheng Xiang, Ying Zhang, Changjun Jiang

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihe Wei, Sheng Xiang, Ying Zhang, Changjun Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को केक बनाना सिखाने की कोशिश कर रहे हैं। आपके पास निर्देशों की एक सूची है: "एक केक बनाओ," "एक चॉकलेट केक बनाओ," "3 परतों वाला और बिना नट्स वाला एक चॉकलेट केक बनाओ," और "3 परतों वाला, बिना नट्स वाला, और एक विशिष्ट आकार का चॉकलेट केक बनाओ।"

लंबे समय तक, शोधकर्ताओं ने इन रोबोटों का परीक्षण करने के लिए उनसे केक बनाने को कहा और उन्हें एक एकल स्कोर दिया, जैसे "85% अच्छा।" लेकिन यह ऐसा ही है जैसे यह कहना कि "रोबोट केक बनाने में 85% अच्छा है," बिना आपको यह बताए कि वह कहाँ विफल रहा। क्या वह चॉकलेट भूल गया? क्या उसने परतों को जला दिया? क्या उसने आकार को अनदेखा कर दिया?

GraphInstruct इन रोबोट शेफों (जो वास्तव में लार्ज लैंग्वेज मॉडल्स या LLMs हैं) को टेस्ट करने का एक नया, बहुत स्मार्ट तरीका है जब उन्हें ग्राफ (जुड़े हुए बिंदुओं और रेखाओं के नेटवर्क, जैसे सोशल नेटवर्क या आणविक संरचनाएं) बनाने के लिए कहा जाता है।

यहाँ इस पेपर द्वारा की गई खोजों का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. समस्या: "औसत" स्कोर एक झूठ है

पिछले परीक्षण एक छात्र को गणित के एक एकल टेस्ट पर ग्रेड देने जैसा था जिसमें आसान जोड़ के साथ कठिन कैलकुलस मिला हुआ था। यदि छात्र ने जोड़ सही किया लेकिन कैलकुलस में फेल हो गया, तो उन्हें अभी भी "B" ग्रेड मिल सकता है। आप नहीं जान पाएंगे कि उन्हें बुनियादी गणित पर अधिक अभ्यास की आवश्यकता है या उन्नत सिद्धांत पर।

लेखकों ने महसूस किया कि ग्राफ जनरेशन के लिए मौजूदा परीक्षण जटिलताओं को "औसत" (average) कर रहे थे। वे हमें ठीक से नहीं बता रहे थे कि रोबोट कहाँ टूट जाता है।

2. समाधान: एक "प्रोग्रेसिव जिम" (Progressive Gym)

लेखकों ने GraphInstruct बनाया है, जो एक बड़े बाधा दौड़ के बजाय छह अलग-अलग कठिनाई स्तरों वाले एक जिम की तरह है।

  • स्तर 0 (वार्म-अप): बस कोई भी वैध ग्राफ बनाएं। (क्या रोबोट बुनियादी सिंटैक्स का पालन कर सकता है?)
  • स्तर 1 (एक नियम): एक ट्री (एक विशिष्ट आकार) बनाएं। (क्या वह एक नियम का पालन कर सकता है?)
  • स्तर 2 (द ट्रैप/जाल): एक ग्राफ बनाएं जो जुड़ा हुआ हो, जिसमें 15 नोड्स, 22 किनारे (edges) हों, और न्यूनतम डिग्री 2 हो। (क्या वह एक साथ चार नियमों का पालन कर सकता है?)
  • स्तर 3 (गणित का टेस्ट): एक ग्राफ बनाएं जिसमें विशिष्ट संख्याएं हों, जैसे "घनत्व (density) 0.21 होना चाहिए।"
  • स्तर 4 (विशेषज्ञ): एक ग्राफ बनाएं जो वास्तविक दुनिया के सोशल नेटवर्क या अणु (molecule) जैसा दिखता हो।
  • स्तर 5 (संपादक): एक मौजूदा ग्राफ लें और उसमें थोड़ा बदलाव करें।

3. बड़ी खोजें (जिम ने क्या उजागर किया)

जब उन्होंने 12 अलग-अलग रोबोट शेफ (LLMs) का इस प्रोग्रेसिव जिम पर परीक्षण किया, तो उन्हें कुछ आश्चर्यजनक बातें मिलीं जो "औसत" स्कोर छिपा देता:

  • "जगलिंग" की बाधा (F1 खोजना): रोबोट इसलिए विफल नहीं हुए क्योंकि कार्य "गहन सोच" के मामले में कठिन थे। वे इसलिए विफल हुए क्योंकि वे एक साथ कई नियमों को संभाल (juggle) नहीं सके। स्मार्ट और कम स्मार्ट रोबोटों के बीच सबसे बड़ा अंतर स्तर 2 (4 नियमों को संभालना) पर हुआ, न कि सबसे जटिल स्तरों पर। यह ऐसा है जैसे एक रोबोट एक गेंद या तीन गेंदों के साथ तालमेल बिठा सकता है, लेकिन जैसे ही आप उसे चार के लिए कहते हैं, वे सब कुछ गिरा देते हैं।
  • कोई "जादुई प्रॉम्प्ट" नहीं (F3 खोजना): लोगों को लगा कि रोबोट से बात करने का एक आदर्श तरीका है (जैसे "कदम-दर-कदम सोचें")। पेपर ने पाया कि कोई भी एक ट्रिक हर चीज़ के लिए काम नहीं करती। एक ट्रिक जो रोबोट को सोशल नेटवर्क बनाने में मदद करती है, वह उसे अणु बनाने में और खराब कर सकती है। यह एक ऐसे रिंच (wrench) की तरह है जो बोल्ट को पूरी तरह से कसता है लेकिन पेंच को छील देता है; आपको विशिष्ट काम के लिए सही उपकरण की आवश्यकता होती है।
  • "परिवार" का पूर्वाग्रह (F4 खोजना): कुछ रोबोट परिवार (जैसे GPT परिवार) भ्रमित हो जाते हैं यदि आप उनसे कुछ कार्यों पर "कदम-दर-कदम सोचने" के लिए कहते हैं, जबकि अन्य परिवार (जैसे Qwen) वास्तव में बेहतर होते हैं। यह इस बारे में नहीं है कि रोबोट कुल मिलाकर कितना "स्मार्ट" है; यह इस बारे में है कि उसे कैसे प्रशिक्षित किया गया है। एक परिवार की "सोच" दूसरे परिवार के लिए "भ्रम" हो सकती है।
  • बड़ा होना हमेशा बेहतर नहीं होता (F5 खोजना): आप सोच सकते हैं कि एक बड़ा रोबोट (अधिक पैरामीटर्स वाला) हर चीज़ में बेहतर होता है। लेकिन पेपर ने पाया कि एक छोटा रोबलेट कभी-कभी विशिष्ट कार्यों, जैसे संख्याओं पर गणित करने में बड़े रोबोट को हरा देता है। बड़ा रोबोट बस अति-आत्मविश्वासी हो जाता है और अधिक गलतियाँ करता है।

4. "मैजिक मिरर" फिक्स

लेखकों ने केवल समस्याओं को खोजने पर ही नहीं रोका; उन्होंने उन्हें ठीक करने के लिए एक उपकरण बनाया। उन्होंने VGIG (वेरिफिकेशन-गाइडेड इटरेटिव जनरेशन) नामक एक प्रणाली बनाई।

इसे रोबोट शेफ के लिए एक जादुई दर्पण के रूप में सोचें।

  • केवल रोबोट से एक बार केक बनाने के लिए कहने के बजाय, रोबोट केक बनाता है।
  • दर्पण (एक कंप्यूटर प्रोग्राम, न कि दूसरा रोबोट) नियमों के विरुद्ध केक की जाँच करता है।
  • यदि केक में नट्स गायब हैं, तो दर्पण कहता है, "आप नट्स भूल गए।"
  • रोबोट फिर से प्रयास करता है, उस विशिष्ट गलती को ठीक करता है।
  • वे इसे कुछ बार दोहराते हैं।

परिणाम: यह "चेक-एंड-फिक्स" लूप केवल बेहतर प्रॉम्प्ट लिखने की तुलना में बहुत बेहतर काम करता है। इसने साबित कर दिया कि वेरिफिकेशन (काम की जाँच करना) प्रॉम्प्टिंग (अच्छे से पूछना) से अधिक महत्वपूर्ण है।

5. पूर्णता की लागत

अंत में, पेपर ने "मूल्य टैग" को देखा। उन्होंने पाया कि अधिकांश रोबोटों के लिए, अच्छा परिणाम प्राप्त करने का सबसे सस्ता तरीका एक बार पूछना (Zero-Shot) है। रोबोट को अधिक गहराई से सोचने या कई बार प्रयास करने के लिए कहकर एक "परफेक्ट" परिणाम प्राप्त करने की कोशिश करने में अक्सर 3x या 4x अधिक पैसा (कंप्यूटिंग पावर) खर्च होता है, और सुधार बहुत मामूली होता है।

हालाँकि, उन्होंने एक "फ्लोर" (न्यूनतम सीमा) भी पाया: कुछ कमजोर रोबोट चाहे आप उन्हें कितना भी भुगतान करें या कितनी भी बार प्रयास करने के लिए कहें, वे एक निश्चित गुणवत्ता स्तर तक नहीं पहुँच सकते। वे एक ऐसी दीवार से टकरा जाते हैं जिसे केवल बेहतर वेरिफिकेशन टूल्स ही पार करने में मदद कर सकते हैं।

सारांश

GraphInstruct एक नैदानिक (diagnostic) उपकरण है जो हमें यह अनुमान लगाने से रोकता है कि AI नेटवर्क बनाने में क्यों विफल होता है। यह हमें दिखाता है कि विफलता आमतौर पर "बुद्धिमत्ता की कमी" नहीं है, बल्कि एक साथ कई बाधाओं को संभालने की विशिष्ट अक्षमता है। पेपर साबित करता है कि इसे ठीक करने का सबसे अच्छा तरीका बेहतर प्रॉम्प्ट लिखना नहीं है, बल्कि ऐसे सिस्टम बनाना है जो काम की जाँच करें और विशिष्ट त्रुटियों को सुधारें, ठीक वैसे ही जैसे एक मानव संपादक ड्राफ्ट की समीक्षा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →