← नवीनतम पेपर
🤖 machine learning

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

यह शोध पत्र PIPE-Cypher को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो लाइव एंटरप्राइज प्रॉपर्टी ग्राफ्स और वास्तविक दुनिया के उपयोगकर्ता प्रश्नों को निष्पादन योग्य, विविध और संतुलित Text-to-Cypher बेंचमार्क में परिवर्तित करता है ताकि ग्राफ क्वेरी सिस्टम के दोहराव योग्य और तैनाती-प्रासंगिक मूल्यांकन को सक्षम बनाया जा सके।

मूल लेखक: Suraj Ranganath, Anish Raghavendra

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Suraj Ranganath, Anish Raghavendra

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल बैंक या एक जटिल लॉजिस्टिक्स कंपनी में काम करते हैं। आपकी कंपनी के पास डेटा का एक विशाल, जीवंत मानचित्र (एक "प्रॉपर्टी ग्राफ") है जो यह दिखाता है कि पैसा कैसे घूमता है, कौन किसे जानता है, और सामान कहाँ से यात्रा करता है। यह मानचित्र आपकी कंपनी के लिए अद्वितीय है; यह अपने स्वयं के विशेष नामों, नियमों और गुप्त कोडों का उपयोग करता है जिसे कोई और नहीं जानता।

अब, कल्पना कीजिए कि आप एक स्मार्ट असिस्टेंट (एक AI) बनाना चाहते हैं जो आपके कर्मचारियों को साधारण अंग्रेजी में प्रश्न पूछने की अनुमति दे, जैसे "पिछले सप्ताह उन सभी खातों को दिखाएं जिन्होंने एक ब्लॉक किए गए उपयोगकर्ता को पैसा ट्रांसफर किया था," और उस AI को वह जटिल कंप्यूटर कोड (जिसे Cypher कहा जाता है) स्वचालित रूप से लिखने में सक्षम हो जिसकी इस उत्तर को प्राप्त करने के लिए आवश्यकता है।

समस्या यह है कि आप इस AI का परीक्षण सार्वजनिक, सामान्य मानचित्रों पर नहीं कर सकते। इसे आपके विशिष्ट मानचित्र पर, आपके विशिष्ट नियमों के साथ परीक्षण करने की आवश्यकता है। लेकिन इसके लिए परीक्षण बनाना एक दुस्वप्न जैसा है:

  1. मानचित्र हर दिन बदलता है।
  2. AI ऐसा कोड लिख सकता है जो दिखने में सही लगे लेकिन गलत प्रश्न पूछ रहा हो।
  3. आप अपने गुप्त डेटा को टेस्ट जेनरेट करने के लिए किसी सार्वजनिक AI सेवा को नहीं भेज सकते।

PIPE-Cypher वह समाधान है जिसे लेखकों ने बनाया है। इसे एक "टेस्ट किचन" के रूप में समझें जो पूरी तरह से आपकी कंपनी के सुरक्षित कंप्यूटर के भीतर रहता है।

यह "टेस्ट किचन" कैसे काम करता है

हजारों परीक्षण प्रश्न लिखने के लिए किसी इंसान की आवश्यकता होने के बजाय, PIPE-Cypher एक पाइपलाइन (एक फैक्ट्री लाइन) है जो सारा भारी काम करती है:

  1. मैप इंस्पेक्टर (स्कीमा प्रोफाइलिंग):
    सबसे पहले, सिस्टम चुपचाप आपकी कंपनी के डेटा मानचित्र को देखता है। यह सीखता है कि नोड्स (जैसे "Account" या "Person") के नाम क्या हैं, उनके बीच के रास्ते (जैसे "Transfers To") क्या हैं, और उपयोग किए जाने वाले विशिष्ट मान (जैसे "Credit Card" या "Blocked") क्या हैं। यह एक "मेन्यू" बनाता है कि क्या संभव है।

  2. रिवर्स इंजीनियर (रिवर्स ग्राउंडिंग):
    यह सबसे चतुर हिस्सा है। एक प्रश्न का अनुमान लगाने और यह उम्मीद करने के बजाय कि उसका उत्तर मौजूद होगा, सिस्टम उत्तर से शुरू होता है। यह वास्तविक डेटा पॉइंट्स खोजने के लिए सुरक्षित, केवल-पढ़ने योग्य (read-only) क्वेरी चलाता है जो वास्तव में मौजूद हैं।
    उपमा: कल्पना कीजिए कि आप एक शेफ का परीक्षण करना चाहते हैं। शेफ से "सूप बनाने" की उम्मीद करने के बजाय (यह उम्मीद करते हुए कि उनके पास सामग्री होगी), आप पहले पेंट्री की जांच करते हैं कि आपके पास गाजर और प्याज हैं। फिर आप पूछते हैं, "गाजर और प्याज के साथ सूप बनाएं।" यह गारंटी देता है कि प्रश्न उत्तर देने योग्य है।

  3. कठोर संपादक (प्रतिबंधित जनरेशन):
    एक स्थानीय AI (जो आपके अपने सर्वर पर चल रहा है, क्लाउड पर नहीं) उन वास्तविक सामग्रियों के आधार पर अंग्रेजी प्रश्न और Cypher कोड लिखता है। लेकिन इसे खतरनाक तरीकों से रचनात्मक होने की अनुमति नहीं है। इसे सख्त नियमों का पालन करना चाहिए: "केवल डेटा पढ़ें, कभी भी उसे डिलीट न करें," "सटीक नामों का उपयोग करें," और "ऐसे रास्ते न बनाएं जो अस्तित्व में नहीं हैं।"

  4. सेफ्टी गेटकीपर (डिटरमिनिस्टिक वैलिडेशन):
    इससे पहले कि परीक्षण को स्वीकार किया जाए, एक गैर-AI कंप्यूटर प्रोग्राम कोड की जांच करता है। यह एक क्लब के बाउंसर की तरह कार्य करता है:

  • क्या कोड सुरक्षित है? (कोई डेटा डिलीट नहीं करना)।
  • क्या यह वास्तविक नामों का उपयोग करता है? (कोई काल्पनिक शब्द नहीं)।
  • क्या यह वास्तव में चलता है? (यदि कोड कोई परिणाम नहीं देता है, तो इसे खारिज कर दिया जाता है)।
  • क्या यह सही दिशा में जाता है? (ग्राफ में, "A से B" जाना "B से A" जाने से अलग होता है)।
  1. जज (LLM रिव्यूअर):
    अंत में, दूसरा स्थानीय AI एक जज के रूप में कार्य करता है। यह प्रश्न, कोड और वास्तविक परिणामों को देखता है। यह पूछता है: "क्या यह कोड वास्तव में प्रश्न का उत्तर देता है? क्या यह स्पष्ट है?" यदि कोड चलता है लेकिन गलत उत्तर देता है, तो जज इसे खारिज कर देता है।

परिणाम: एक "जीवंत" बेंचमार्क

लेखकों ने इस पाइपलाइन का उपयोग करके वास्तविक दुनिया के वित्तीय और सामाजिक नेटवर्क डेटा का उपयोग करके 3,000 प्रश्नों का एक विशाल टेस्ट सेट तैयार किया।

  • यह भेदभावपूर्ण है: जब उन्होंने इस नए बेंचमार्क पर मानक AI मॉडल का परीक्षण किया, तो अधिकांश बुरी तरह विफल रहे (4% से कम उत्तर सही पाए)। यह साबित करता है कि केवल इसलिए कि एक AI सही दिखने वाला कोड लिख सकता है, इसका मतलब यह नहीं है कि वह आपके विशिष्ट डेटा मानचित्र को समझता है।
  • यह रिफ्रेश करने योग्य है: क्योंकि पाइपलाइन स्वचालित है, यदि आपकी कंपनी अगले महीने एक नया प्रकार का डेटा (जैसे "Crypto Wallets") जोड़ती है, तो आप नए परीक्षण तुरंत उत्पन्न करने के लिए बस पाइपलाइन को फिर से चला सकते हैं। आपको सार्वजनिक डेटासेट के अपडेट होने का इंतजार करने की आवश्यकता नहीं है।
  • यह निजी है: सब कुछ आपके अपने कंप्यूटरों पर होता है। कोई भी संवेदनशील डेटा आपके भवन से बाहर नहीं जाता है।

मुख्य निष्कर्ष

लेखक तर्क देते हैं कि एंटरप्राइज AI के लिए, स्थिर (static) टेस्ट सेट खत्म हो चुके हैं। आप अपने अनूठे, बदलते व्यवसाय के लिए डिज़ाइन किए गए सिस्टम का मूल्यांकन एक सामान्य, जमे हुए डेटासेट पर नहीं कर सकते।

PIPE-Cypher गेम बदल देता है क्योंकि यह बेंचमार्क निर्माण को एक दोहराने योग्य, स्वचालित फैक्ट्री प्रक्रिया में बदल देता है। यह सुनिश्चित करता है कि परीक्षण:

  • वास्तविक हैं: वास्तविक डेटा पर आधारित जो मौजूद है।
  • सुरक्षित हैं: गारंटी है कि वे आपके डेटाबेस को तोड़ेंगे नहीं।
  • ईमानदार हैं: सख्ती से यह जांचते हैं कि क्या AI वास्तव में समस्या को हल करता है, न कि केवल सुंदर कोड लिखता है।

संक्षेप में, PIPE-Cypher एक ऐसा टूल है जो कंपनियों को उनके AI सहायकों के लिए अपने स्वयं के, उच्च-गुणवत्ता वाले "ड्राइविंग टेस्ट" बनाने में मदद करता है, यह सुनिश्चित करते हुए कि वे वास्तव में कंपनी के जटिल, अद्वितीय डेटा मार्गों पर बिना दुर्घटना के नेविगेट कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →