← नवीनतम पेपर
💻 computer science

Graph Query Generation with Constraint-guided Large Language Agents

यह शोध पत्र UniQGen को प्रस्तुत करता है, जो एक नवीन बाधा-निर्देशित (constraint-guided) ढांचा है जो नॉलेज ग्राफ क्वेश्चन आंसरिंग के लिए उच्च-गुणवत्ता वाली, निष्पादन योग्य (executable) साइफर (Cypher) क्वेरी उत्पन्न करने हेतु LLM एजेंटों और एक विस्तारित चेज़ एंड बैकचेज़ (Chase & Backchase) एल्गोरिदम का लाभ उठाता है, जिसके लिए फाइन-ट्यूनिंग की आवश्यकता नहीं है, जिससे यह सटीकता और दक्षता में अत्याधुनिक तरीकों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Mengying Wang, Nicolaas Jedema, Rahul Pandey, RaviKiran Krishnan, Jens Lehmann, Yinghui Wu

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengying Wang, Nicolaas Jedema, Rahul Pandey, RaviKiran Krishnan, Jens Lehmann, Yinghui Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास तथ्यों का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय (एक नॉलेज ग्राफ) है। आप इससे अंग्रेजी में एक सवाल पूछना चाहते हैं, जैसे "कौन सी दवाएं टेटनी (tetany) का इलाज करती हैं?" या "किन अमेरिकी शहरों ने फरवरी में ओलंपिक की मेजबानी की थी?"

समस्या यह है कि यह पुस्तकालय अपने डेटा को संग्रहीत करने के लिए दो बहुत अलग "भाषाओं" का उपयोग करता है: एक सख्त, संरचित फाइलिंग सिस्टम (RDF/SPARQL) की तरह है और दूसरा लचीले, जुड़े हुए नोट्स के जाल (Property Graphs/Cypher) की तरह है। अधिकांश कंप्यूटर प्रोग्राम केवल एक ही भाषा बोल पाते हैं। यदि आप अंग्रेजी में सवाल पूछते हैं, तो कंप्यूटर अक्सर भ्रमित हो जाता है, ऐसे तथ्य बना देता है जो मौजूद ही नहीं हैं (hallucinations), या महत्वपूर्ण विवरण भूल जाता है (जैसे कि क्या कोई दवा वास्तव में उपयोग के लिए स्वीकृत है)।

यूनिकजेन (UniQGen) से मिलिए: "स्मार्ट ट्रांसलेटर" सुरक्षा जाल के साथ

इस शोध पत्र के लेखकों ने UniQGen नामक एक नया सिस्टम बनाया है। इसे केवल एक अनुवादक के रूप में न सोचें जो केवल अनुमान लगाता है, बल्कि एक जासूसी टीम के रूप में सोचें जो अंतिम रिपोर्ट लिखने से पहले एक पहेली को सुलझाती है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "कन्स्ट्रेंट टेबल" (सुराग बोर्ड)

सीधे डेटाबेस को क्वेरी करने के लिए आवश्यक जटिल कोड लिखने के बजाय, UniQGen पहले एक जासूस की तरह एक कॉर्कबोर्ड पर सुराग रखने जैसा काम करता है।

  • सुराग (The Clues): यह आपके प्रश्न को छोटे तथ्यों में तोड़ देता है (जैसे, "दवा", "इलाज करती है", "टेटनी")।
  • छिपे हुए सुराग (The Hidden Clues): यह उन "प्रैग्मैटिक" (व्यावहारिक) सुरागों को भी जोड़ता है जो आपने कहे नहीं हैं लेकिन जो निहित हैं। उदाहरण के लिए, यदि आप किसी दवा के बारे में पूछते हैं, तो सिस्टम जानता है कि आपका मतलब संभवतः एक अनुमोदित (approved) दवा से है, न कि किसी काल्पनिक दवा से।
  • कॉन्फिडेंस स्कोर (The Confidence Score): प्रत्येक सुराग को एक "कॉन्फिडेंस स्कोर" दिया जाता है। यदि कोई सुराग अस्पष्ट है (जैसे "कोई भी दवा"), तो उसे कम स्कोर मिलता है। यदि वह विशिष्ट है (जैसे "FDA-अनुमोदित"), तो उसे उच्च स्कोर मिलता है।

2. "चेज़" चरण (जाल को ढीला करना)

कल्पना कीजिए कि आप मछलियों (उत्तरों) को पकड़ने के लिए एक मछली पकड़ने का जाल फेंकते हैं।

  • समस्या: आपका प्रारंभिक जाल बहुत तंग हो सकता है। आपने शायद एक नियम शामिल कर लिया है जो कहता है "केवल शीतकालीन ओलंपिक," लेकिन आपका प्रश्न केवल "ओलंपिक" था। आप कुछ भी नहीं पकड़ पाते क्योंकि आपका जाल बहुत छोटा है।
  • समाधान (Chase): सिस्टम सभी सुरागों के साथ एक सुपर-टाइट जाल के साथ शुरू होता है। यदि यह कुछ भी नहीं पकड़ता (या सही उत्तरों को छोड़ देता है), तो यह व्यवस्थित रूप से एक बार में एक सुराग हटाकर जाल को ढीला करता है। यह तब तक जाल को ढीला करता रहता है जब तक कि यह कम से कम सही उत्तरों को न पकड़ ले। यह सुनिश्चित करता है कि यह किसी भी महत्वपूर्ण चीज़ को मिस न करे (पूर्णता/Completeness)।

3. "बैकचेज़" चरण (जाल को कसना)

अब, आपका जाल इतना ढीला है कि यह सही मछलियों को पकड़ सके, लेकिन यह बहुत सारा कचरा (गलत उत्तर) भी पकड़ रहा है।

  • समस्या: आपके पास एक जाल है जो "सभी ओलंपिक" को पकड़ता है, लेकिन आप केवल "शीतकालीन ओलंपिक" चाहते थे।
  • समाधान (Backchase): सिस्टम अब पीछे की ओर काम करता है। यह ढीले जाल से शुरू होता है और कचरे को बाहर निकालने के लिए एक-एक करके सुराग वापस जोड़ने की कोशिश करता है। यह सुराग जोड़ना तब रोकता है जैसे ही इसे एहसास होता है कि, "यदि मैं यह एक और नियम जोड़ता हूँ, तो मैं फिर से सही उत्तरों को खोने लगूँगा।" यह सुनिश्चित करता है कि अंतिम उत्तर सटीक हो और इसमें कचरा शामिल न हो (सत्यता/Soundness)।

4. "रेंडरर" (भाषा बोलना)

एक बार जब जासूसी टीम सुरागों का सही सेट (लॉजिक) समझ लेती है, तो सिस्टम उस लॉजिक को उस विशिष्ट भाषा में अनुवाद करता है जिसे डेटाबेस समझता है।

  • जादू: क्योंकि अनुवाद से पहले ही लॉजिक को समझ लिया गया था, इसलिए UniQGen दोनों भाषाओं (SPARQL और Cypher) को समान रूप से अच्छी तरह से बोल सकता है। इसे हर बार नए भाषा को सीखने या "सिखाने" की आवश्यकता नहीं होती; यह बस अंतिम रिपोर्ट के लहजे (dialect) को बदल देता है।

यह एक बड़ी बात क्यों है?

  • "स्कूली शिक्षा" की आवश्यकता नहीं: अधिकांश AI सिस्टम को हर नए डेटाबेस के लिए भारी मात्रा में डेटा पर "पढ़ाए जाने" (fine-tuned) की आवश्यकता होती है। UniQGen "ट्रेनिंग-फ्री" है। यह अपने जासूसी तर्क का उपयोग करके चलते-फिरते चीजों को समझ लेता है।
  • कोई "लॉक-इन" नहीं: कंपनियाँ अक्सर एक प्रकार के डेटाबेस का उपयोग करने में फंस जाती हैं क्योंकि स्विच करना बहुत कठिन होता है। UniQGen डेटाबेस के सिंटैक्स के बजाय, आपके प्रश्न के इरादे (intent) को समझकर इस लॉक-इन को तोड़ देता है।
  • बेहतर उत्तर: अपने परीक्षणों में, UniQGen पिछले तरीकों की तुलना में सही उत्तर खोजने में बहुत बेहतर था, विशेष रूप से उन जटिल प्रश्नों के लिए जिनमें कई बिंदुओं को जोड़ने की आवश्यकता होती है (multi-hop reasoning)। इसने मानक परीक्षणों पर सटीकता में काफी सुधार किया।

संक्षेप में:
UniQGen एक स्मार्ट, अनुकूलन योग्य एजेंट है जो पहले सुरागों में तोड़कर यह समझता है कि आपका वास्तविक अर्थ क्या है, फिर यह सही उत्तरों को पकड़ने और गलत उत्तरों को छानने के बीच सही संतुलन बनाने के लिए "ढीला और कसने" की रणनीति का उपयोग करता है, और यह सब बिना हर नए डेटाबेस के लिए पुन: प्रशिक्षित हुए किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →