← नवीनतम पेपर
🤖 machine learning

On the Safety of Graph Representation Learning

यह शोध पत्र GRL-Safety को प्रस्तुत करता है, जो एक व्यापक बहु-अक्षीय बेंचमार्क है जो पच्चीस डेटासेट्स में बारह ग्राफ रिप्रजेंटेशन लर्निंग विधियों का मूल्यांकन करता है ताकि यह प्रकट किया जा सके कि सुरक्षा प्रदर्शन रिप्रजेंटेशन डिज़ाइन और विशिष्ट स्ट्रेस फैक्टर्स के बीच की अंतःक्रिया पर निर्भर करता है, जो यह दर्शाता है कि फाउंडेशन मॉडल्स सार्वभौमिक मजबूती के बजाय अक्ष-विशिष्ट शक्तियों की पेशकश करते हैं।

मूल लेखक: Xiaoguang Guo, Zehong Wang, Ziming Li, Shawn Spitzel, Soonwoo Kwon, Tianyi Ma, Yanfang Ye, Chuxu Zhang

प्रकाशित 2026-05-08
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoguang Guo, Zehong Wang, Ziming Li, Shawn Spitzel, Soonwoo Kwon, Tianyi Ma, Yanfang Ye, Chuxu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक शानदार नेविगेशन ऐप बनाया है। यह एक धूप वाले, खाली शहर में, बेहतरीन जीपीएस सिग्नल के साथ चलते समय पूरी तरह से काम करता है। आप इसे "क्लीन परफॉरमेंस" (Clean Performance) कहते हैं। लेकिन क्या होता है जब आप भारी तूफान में गाड़ी चलाते हैं, किसी ऐसे मोहल्ले में रास्ता भटक जाते हैं जहाँ कोई सड़क का साइन नहीं है, या किसी ऐसे रास्ते पर जाने की कोशिश करते हैं जो अब आपके मैप पर मौजूद ही नहीं है? क्या आपका ऐप क्रैश हो जाता है? क्या यह आपको किसी झील में भेज देता है? या क्या यह बस कहता है, "मुझे नहीं पता"?

यह शोध पत्र, "On the Safety of Graph Representation Learning," डेटा के लिए अगली पीढ़ी के "नेविगेशन ऐप्स" के लिए एक विशाल, कठोर स्ट्रेस टेस्ट (तनाव परीक्षण) की तरह है।

डेटा की दुनिया में, इन "ऐप्स" को ग्राफ रिप्रेजेंटेशन लर्निंग (GRL) मॉडल कहा जाता है। वे जटिल नेटवर्कों (जैसे सोशल मीडिया कनेक्शन, रासायनिक अणु, या वित्तीय लेनदेन) को सरल मानचित्रों में बदल देते हैं जिन्हें कंप्यूटर समझ सके। हाल ही में, हम साधारण मानचित्रों से आगे बढ़कर "फाउंडेशन मॉडल्स" (Foundation Models) की ओर बढ़ गए हैं—जो सुपर-स्मार्ट, प्री-ट्रेन्ड सिस्टम हैं और हर जगह काम करने का वादा करते हैं।

लेकिन लेखक पूछते हैं: क्या ये सुपर-स्मार्ट मॉडल वास्तव में सुरक्षित हैं जब वास्तविक दुनिया अव्यवस्थित हो जाती है?

यहाँ उनके निष्कर्षों का विवरण दिया गया है, रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

1. समस्या: "क्लीन रूम" का जाल (The "Clean Room" Trap)

अब तक, वैज्ञानिक मुख्य रूप से इन मॉडल्स को एक "क्लीन रूम" में टेस्ट करते थे। वे पूछते थे, "जब सब कुछ एकदम सही हो, तो यह उत्तर की कितनी अच्छी तरह भविष्यवाणी करता है?"
लेखक कहते हैं कि यह एक कार को केवल एक चिकने रेसट्रैक पर टेस्ट करने जैसा है। यह आपको यह नहीं बताता कि कार बर्फ, गड्ढों या फ्लैट टायर को कैसे संभालती है। वास्तविक दुनिया में, डेटा "करप्ट" (खराब जानकारी) हो जाता है, समय के साथ बदल जाता है (नए रुझान), या इसमें भारी असंतुलन (दुर्लभ घटनाएं) होता है।

2. समाधान: GRL-Safety (द "क्रैश टेस्ट" बेंचमार्क)

लेखकों ने GRL-Safety नामक एक नया परीक्षण मैदान बनाया। मॉडल्स को केवल एक स्कोर (जैसे "90% सटीकता") देने के बजाय, उन्होंने 12 अलग-अलग मॉडल्स को 25 विभिन्न वास्तविक दुनिया के डेटासेट्स पर पाँच विशिष्ट प्रकार के स्ट्रेस टेस्ट से गुज़ारा।

इसे AI के लिए एक क्रैश टेस्ट डमी सुविधा के रूप में समझें, लेकिन पाँच अलग-अलग क्रैश परिदृश्यों के साथ:

  • करप्शन रोबस्टनेस (द "स्टैटिक" टेस्ट):

    • परिदृश्य: कल्पना कीजिए कि आपके GPS सिग्नल में बहुत शोर (static) है, या आधे सड़क के संकेत गायब हैं।
    • निष्कर्ष: कुछ मॉडल्स एक मज़बूत ट्रक की तरह हैं; वे ऊबड़-खाबड़ रास्तों पर भी चलते रहते हैं। अन्य मॉडल्स एक स्पोर्ट्स कार की तरह हैं; यदि आप कुछ किनारों (edges/road connections) को हटा देते हैं, तो वे बिखर जाते हैं। दिलचस्प बात यह है कि जो मॉडल्स "खराब संकेतों" को संभालने में माहिर हैं, वे ज़रूरी नहीं कि "गायब सड़कों" को संभालने में भी माहिर हों। ये अलग-अलग कौशल हैं।
  • OOD जनरलाइजेशन (द "न्यू टेरिटरी" टेस्ट):

    • परिदृश्य: आपने अपने मॉडल को न्यूयॉर्क के मानचित्रों पर प्रशिक्षित किया है, लेकिन अब आपको टोक्यो में गाड़ी चलानी है। या, आपने इसे 2010 के डेटा पर प्रशिक्षित किया है, लेकिन अब यह 2024 है।
    • निष्कर्ष: कोई भी एक मॉडल "सभी सड़कों का राजा" नहीं है। एक मॉडल जो समय के बदलावों (जैसे नए रुझानों) को संभाल सकता है, वह नेटवर्क की संरचना बदलने पर (जैसे एक नए प्रकार के अणु के मामले में) बुरी तरह विफल हो सकता है। आप केवल "सर्वश्रेष्ठ" मॉडल नहीं चुन सकते; आपको वह चुनना होगा जो आपके विशिष्ट नए क्षेत्र के लिए सबसे अच्छा हो।
  • क्लास इम्बैलेंस (द "रेयर इवेंट" टेस्ट):

    • परिदृश्य: कल्पना कीजिए कि एक धोखाधड़ी (fraud) डिटेक्टर 1 धोखाधड़ी के लिए प्रत्येक 1,000 सामान्य लेनदेन देखता है। केवल यह कहकर कि "सब कुछ सामान्य है," 99% सटीकता प्राप्त करना आसान है।
    • निष्कर्ष: कई मॉडल्स "बुलिंग" (धौंस जमाने वाले) होते हैं जो केवल बहुमत पर ध्यान देते हैं। वे बेहतरीन स्कोर प्राप्त करते हैं लेकिन दुर्लभ, खतरनाक मामलों (धोखाधड़ी) को पूरी तरह से मिस कर देते हैं। लेखकों ने पाया कि दुर्लभ चीज़ों को पकड़ने के लिए, आपको अक्सर सामान्य चीज़ों पर अपने प्रदर्शन का त्याग करना पड़ता है। यह एक ट्रेड-ऑफ है।
  • फेयरनेस (द "रिच वर्सेस पूर" टेस्ट):

    • परिदृश्य: एक सोशल नेटवर्क में, लोकप्रिय लोगों (हाई-डिग्री नोड्स) के पास बहुत सारे दोस्त होते हैं, जबकि अपॉपुलर लोगों (लो-डिग्री नोड्स) के पास बहुत कम होते हैं।
    • निष्कर्ष: मॉडल्स का झुकाव "लोकप्रिय" लोगों की ओर होता है। वे अच्छी तरह से जुड़े लोगों के लिए बहुत सटीक भविष्यवाणियां करते हैं लेकिन अलग-थलग पड़े लोगों के लिए भ्रमित हो जाते हैं और गलतियाँ करते हैं। मॉडल की "सुरक्षा" इस बात पर बहुत निर्भर करती है कि इसका उपयोग कौन कर रहा है।
  • इंटरप्रिटेशन (द "ट्रस्ट मी" टेस्ट):

    • परिदृश्य: मॉडल कहता है, "यह अणु विषाक्त (toxic) है।" आप पूछते हैं, "क्यों?" और वह अणु के एक विशिष्ट हिस्से की ओर इशारा करता है। क्या वह सच बोल रहा है, या सिर्फ अनुमान लगा रहा है?
    • निष्कर्ष: सिर्फ इसलिए कि एक मॉडल स्पष्टीकरण दे सकता है, इसका मतलब यह नहीं है कि स्पष्टीकरण सच है। लेखकों ने पाया कि केवल कुछ ही मॉडल्स वास्तव में अपने निर्णय के वास्तविक कारण की ओर इशारा करते हैं। अधिकांश केवल तर्कसंगत लगने वाले कारण बना रहे होते हैं जो वास्तव में गलत होते हैं।

3. मुख्य निष्कर्ष (द "ड्राइवर्स एड" लेसन्स)

लेखकों ने तीन मुख्य निष्कर्ष निकाले जो AI सुरक्षा के बारे में हमारी सोच को बदलते हैं:

  1. यह "ब्रांड" के बारे में नहीं, बल्कि "मैच" के बारे में है:
    आप केवल यह नहीं कह सकते कि "फाउंडेशन मॉडल्स सबसे सुरक्षित हैं।" यह इस पर निर्भर करता है कि क्या टूट रहा है। यदि आपके डेटा में लिंक्स गायब हैं, तो आपको एक प्रकार के मॉडल की आवश्यकता है। यदि आपके डेटा में लेबल शोर वाले (noisy) हैं, तो आपको दूसरे की आवश्यकता है। "सुरक्षा" मॉडल के डिज़ाइन को उस विशिष्ट तनाव के साथ मिलाने से आती है जिसका वह सामना करेगा।

  2. "सुपर-मॉडल" का मिथक गलत है:
    सबसे नए, सबसे उन्नत मॉडल्स (फाउंडेशन मॉडल्स) कोई जादुई समाधान नहीं हैं। वे विशेषज्ञ हैं। एक समय के बदलावों को संभालने में माहिर हो सकता है, जबकि दूसरा निष्पक्षता (fairness) में बेहतर हो सकता है। कोई एक एकल मॉडल नहीं है जो हर चीज़ के लिए "सबसे सुरक्षित" हो।

  3. कुछ सड़कें अभी भी बहुत कठिन हैं:
    परीक्षण किए गए सबसे अच्छे मॉडल्स भी कुछ स्थितियों, जैसे अत्यधिक क्लास इम्बैलेंस या विशिष्ट प्रकार के डेटा शिफ्ट के साथ संघर्ष करते हैं। इसका मतलब है कि हम केवल "शेल्फ से सबसे अच्छा मॉडल उठाकर" काम नहीं चला सकते। हमें विशेष रूप से इन अव्यवस्थित, वास्तविक दुनिया के तनावों को संभालने के लिए डिज़ाइन किए गए नए प्रशिक्षण तरीकों को आविष्कार करने की आवश्यकता है।

सारांश

यह शोध पत्र तर्क देता है कि हमें इन ग्राफ मॉडल्स को केवल एक आदर्श, स्वच्छ लैब में उनके प्रदर्शन के आधार पर आंकना बंद करना चाहिए। इसके बजाय, हमें उन्हें वास्तविक दुनिया की स्थितियों के "कीचड़ और बारिश" में टेस्ट करना चाहिए। सुरक्षा कोई एकल संख्या नहीं है; यह इस बात का प्रोफाइल है कि चीजें गलत होने पर एक मॉडल कैसा व्यवहार करता है। वास्तव में सुरक्षित सिस्टम बनाने के लिए, हमें यह जानना आवश्यक है कि इससे पहले कि हम उन्हें अपनी कार चलाने दें, वे कैसे और कब विफल हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →