← नवीनतम पेपर
💬 NLP

Node-as-Agent: Graph Agentic Network

यह शोध पत्र ReaGAN का प्रस्ताव करता है, जो एक रिट्रीवल-ऑगमेंटेड ग्राफ एजेंटिक नेटवर्क है जो पारंपरिक ग्राफ न्यूरल नेटवर्क में फिक्स्ड एग्रीगेशन मैकेनिज्म की सीमाओं को दूर करने के लिए नोड्स को स्वायत्त निर्णय लेने की क्षमता और ग्लोबल सिमेंटिक रिट्रीवल से सशक्त बनाता है, जिससे बिना फाइन-ट्यूनिंग के प्रतिस्पर्धी फ्यू-शॉट प्रदर्शन प्राप्त होता है।

मूल लेखक: Minghao Guo, Xi Zhu, Qingyue Jiao, Xiujin Liu, Haochen Xue, Chong Zhang, Shuhang Lin, Jingyuan Huang, Ziyi Ye, Yongfeng Zhang

प्रकाशित 2026-07-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minghao Guo, Xi Zhu, Qingyue Jiao, Xiujin Liu, Haochen Xue, Chong Zhang, Shuhang Lin, Jingyuan Huang, Ziyi Ye, Yongfeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसे शहर की कल्पना करें जहाँ हर इमारत एक व्यक्ति है, और उन्हें जोड़ने वाली सड़कें उनकी मित्रता हैं। वर्षों तक, इस शहर को समझने की कोशिश कर रहे वैज्ञानिकों ने एक कठोर नियम पुस्तिका का उपयोग किया है: "प्रत्येक इमारत को अपने निकटतम पड़ोसियों से बात करनी चाहिए, और उन सभी को ठीक एक ही समय पर बिल्कुल एक जैसी बात कहनी चाहिए।" इस तरह पारंपरिक ग्राफ न्यूरल नेटवर्क (GNNs) काम करते हैं। वे एक विशाल, समन्वित कोरस (choir) की तरह हैं जहाँ हर कोई एक ही स्वर में गाता है, चाहे वह एक बुद्धिमान पुरानी लाइब्रेरी हो या एक शोर मचाती, खाली निर्माण स्थल। हालाँकि यह सरल मोहल्लों के लिए ठीक काम करता है, लेकिन जब शहर जटिल हो जाता है, तो यह विफल हो जाता है। कुछ इमारतों के पास सुनाने के लिए समृद्ध कहानियाँ होती हैं, जबकि कुछ खाली होती हैं; कुछ दोस्त दूर होते हैं लेकिन गहरे रहस्य साझा करते हैं, जबकि करीबी पड़ोसी पूरी तरह से अजनबी हो सकते हैं। पुरानी नियम पुस्तिका इस विविधता को नहीं संभाल सकती, जो अक्सर महत्वपूर्ण आवाजों को शोर में डुबो देती है या उन दूर के संबंधों को मिस कर देती है जो वास्तव में मायने रखते हैं।

यहाँ लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में प्रवेश करें, जो वे सुपर-स्मार्ट AI मस्तिष्क हैं जो मनुष्यों की तरह पढ़, लिख और तर्क कर सकते हैं। मुख्य प्रश्न जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम इन शहर की इमारतों के साथ एक विचारहीन कोरस के सदस्य की तरह व्यवहार करना बंद कर सकते हैं और उन्हें स्वतंत्र, सोचने वाले एजेंटों के रूप में देखना शुरू कर सकते हैं? क्या होगा यदि प्रत्येक इमारत खुद तय कर सके कि उसे किससे बात करनी है, किसे सुनना है और कब बोलना है? यह ग्राफ एजेंटिक लर्निंग (Graph Agentic Learning) का अग्रिम क्षेत्र है, जो नेटवर्क में व्यक्तिगत नोड्स (nodes) को स्वायत्त निर्णय लेने की शक्ति देने का प्रयास कर रहा है। यह एक कठोर, ऊपर-से-नीचे (top-down) कमांड संरचना से एक अराजक, रचनात्मक और अत्यधिक व्यक्तिगत सूचना लोकतंत्र की ओर एक बदलाव है।


शोध पत्र: ReaGAN – जब हर नोड को एक दिमाग मिलता है

अपने शोध पत्र में, लेखक ReaGAN (रिट्रीवल-ऑगमेंटेड ग्राफ एजेंटिक नेटवर्क) नामक एक नया ढांचा पेश करते हैं। प्रत्येक नोड को एक ही उबाऊ, पूर्व-लिखित पटकथा का पालन करने के लिए मजबूर करने के बजाय, ReaGAN प्रत्येक नोड को एक स्वायत्त एजेंट के रूप में मानता है। इसे हमारे शहर की प्रत्येक इमारत को एक व्यक्तिगत सहायक देने के रूप में सोचें जो एक सुपर-स्मार्ट, फ्रोजन ब्रेन (एक लार्ज लैंग्वेज मॉडल जिसे फिर से प्रशिक्षित नहीं किया जा रहा है) से लैस है।

यहाँ यह "एजेंट" जीवन कैसे काम करता है:

1. एजेंट का टूलकिट
प्रत्येक नोड के पास चार मुख्य महाशक्तियाँ हैं:

  • मेमोरी (स्मृति): एक व्यक्तिगत नोटबुक जहाँ नोड अपनी कहानी, अपने पड़ोसियों की कहानियाँ और अपने द्वारा एकत्र किए गए किसी भी सहायक तथ्य को संग्रहीत करता है।
  • प्लानिंग (योजना): एक "मस्तिष्क" (फ्रोजन LLM) जो नोटबुक को देखता है और निर्णय लेता है, "मुझे आगे क्या करना चाहिए?"
  • एक्शन (कार्य): वास्तव में चीजें करने की क्षमता, जैसे पड़ोसियों से बात करना या जानकारी खोजना।
  • टूल्स (उपकरण): एक विशेष उपकरण जिसे RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है, जो नोड को केवल अपनी गली के लोगों के बजाय पूरे शहर में जानकारी खोजने की अनुमति देता है।

2. बात करने का नया तरीका (स्थानीय बनाम वैश्विक)
पुराने दिनों में, एक नोड केवल अपने निकटतम पड़ोसियों से बात कर सकता था (लोकल एग्रीगेशन)। ReaGAN नियमों को बदल देता है।

  • लोकल एग्रीगेशन (Local Aggregation): नोड अपने सीधे पड़ोसियों के साथ त्वरित अपडेट प्राप्त करने के लिए बातचीत करता है।
  • ग्लोबल एग्रीगेशन (Global Aggregation): यदि नोड को लगता है कि उसे अधिक संदर्भ की आवश्यकता है, तो वह पूरे ग्राफ में समान नोड्स खोजने के लिए अपने RAG टूल का उपयोग करता है, भले ही वे मीलों दूर हों और सड़क से जुड़े न हों। यह एक लाइब्रेरियन की तरह है जो केवल बगल वाले व्यक्ति से किताब की सिफारिश के लिए पूछने के बजाय, सही मिलान के लिए पूरी लाइब्रेरी कैटलॉग खोजता है।
  • NoOp (कोई ऑपरेशन नहीं): कभी-कभी, सबसे समझदारी भरा काम कुछ न करना होता है। एजेंट चुपचाप बैठ सकता है और कोई नई जानकारी एकत्र नहीं कर सकता यदि वह पहले से ही पर्याप्त जानता है। यह नोड को बहुत अधिक शोर से अभिभूत होने से बचाता है।

3. निर्णय चक्र (Decision Loop)
तर्क का प्रत्येक "स्तर" एक चक्र है। नोड अपनी मेमोरी को देखता है, अपने LLM मस्तिष्क से पूछता है, "मेरा अगला कदम क्या है?" मस्तिष्क कह सकता है, "अपने पड़ोसियों से जाओ और बात करो," या "पूरी तरह से समान कहानियों के लिए पूरे ग्राफ को खोजो," या "अभी बस एक अनुमान लगाओ।" नोड उस क्रिया को निष्पादित करता है, अपनी मेमोरी को नई जानकारी के साथ अपडेट करता है, और प्रक्रिया को दोहराता है। अंत में, जब वह आश्वस्त महसूस करता है, तो वह एक भविष्यवाणी करता है।

उन्होंने क्या पाया

शोधकर्ताओं ने वैज्ञानिक पत्रों (Cora, Citeseer, और Chameleon) के तीन वास्तविक दुनिया के डेटासेट पर ReaGAN का परीक्षण किया ताकि यह देखा जा सके कि क्या ये "सोचने वाले एजेंट" पारंपरिक तरीकों की तुलना में पत्रों को बेहतर ढंग से वर्गीकृत कर सकते हैं।

  • प्रतिस्पर्धी प्रदर्शन: भले ही ReaGAN एक फ्रोजन LLM का उपयोग करता है (जिसका अर्थ है कि इसे विशिष्ट ग्राफ डेटा पर प्रशिक्षित या फाइन-ट्यून नहीं किया गया था), इसने अविश्वसनीय रूप से अच्छा प्रदर्शन किया। Cora डेटासेट पर, इसने 84.95% की सटीकता प्राप्त की, जो प्रसिद्ध GCN मॉडल (84.71%) और GraphSAGE (84.35%) को थोड़ा पीछे छोड़ देती है। यह बताता है कि नोड्स को अपने लिए सोचने देने से उन मॉडलों की बराबरी या उनसे बेहतर प्रदर्शन किया जा सकता है जिन्हें डेटा पर व्यापक रूप से प्रशिक्षित किया गया है।
  • चुनाव की शक्ति: जब उन्होंने "प्लानिंग" क्षमता (नोड्स को एक निश्चित स्क्रिप्ट का पालन करने के लिए मजबूर करना) को हटाया या "ग्लोबल सर्च" को हटाया (नोड्स को केवल पड़ोसियों से बात करने के लिए मजबूर करना), तो प्रदर्शन गिर गया। यह साबित करता है कि यह निर्णय लेना कि क्या करना है और दूर और व्यापक रूप से देखने की क्षमता, दोनों ही आवश्यक हैं।
  • "नो-नेम" ट्रिक: एक आश्चर्यजनक खोज में, लेखकों ने पाया कि AI को श्रेणियों के वास्तविक नाम (जैसे "मशीन लर्निंग" या "डेटाबेस") दिखाने से वास्तव में प्रदर्शन में कमी आई। AI इन शब्दों से विचलित हो जाता था और ग्राफ में मौजूद साक्ष्यों के बजाय अपने पूर्व-मौजूदा ज्ञान के आधार पर अनुमान लगाता था। जब उन्होंने लेबल को गुमनाम (Label_1, Label_2 कहना) कर दिया, तो AI को सख्ती से प्रदान किए गए संदर्भ के आधार पर तर्क करने के लिए मजबूर होना पड़ा, जिससे बहुत बेहतर परिणाम मिले।
  • दक्षता: हालांकि यह एक सरल गणितीय गणना की तुलना में धीमा है (NVIDIA RTX A6000 GPU पर 64 नोड्स के बैच के लिए लगभग 3.10 सेकंड लगता है), यह शून्य से एक नया मॉडल प्रशिक्षित करने की भारी लागत से पूरी तरह बचता है। यह एक "प्लग-एंड-प्ले" समाधान है जो मौजूदा AI की तर्क शक्ति का उपयोग करता है।

निष्कर्ष

ReaGAN यह सुझाव देता है कि ग्राफ लर्निंग का भविष्य बड़े, तेज़ नियम पुस्तिका बनाने के बारे में नहीं है। यह डेटा के प्रत्येक हिस्से को एक आवाज, एक स्मृति और दुनिया के साथ जुड़ने का निर्णय लेने की स्वतंत्रता देने के बारे में है। नोड्स को स्वतंत्र एजेंटों के रूप में मानकर जो योजना बना सकते हैं, खोज सकते हैं और तर्क कर सकते हैं, लेखकों ने दिखाया है कि हम पारंपरिक प्रशिक्षण की भारी मेहनत के बिना उच्च सटीकता प्राप्त कर सकते हैं। यह एक सख्त सेना से, जो एक साथ कदम से कदम मिलाकर चलती है, विविध खोजकर्ताओं के समूह में परिवर्तन है, जिनमें से प्रत्येक सत्य के अपने पथ को खोज रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →