← नवीनतम पेपर
🤖 AI

GraphLand: Evaluating Graph Machine Learning Models on Diverse Industrial Data

यह शोध पत्र GraphLand प्रस्तुत करता है, जो 14 विविध औद्योगिक ग्राफ डेटासेट का एक व्यापक बेंचमार्क है जिसे मौजूदा मूल्यांकनों के संकीर्ण दायरे को संबोधित करने के लिए डिज़ाइन किया गया है, यह प्रकट करते हुए कि वर्तमान ग्राफ फाउंडेशन मॉडल ग्राफ फीचर्स से उन्नत ग्रेडिएंट-बूस्टेड डिसीजन ट्री की तुलना में कम प्रदर्शन करते हैं।

मूल लेखक: Gleb Bazhenov, Oleg Platonov, Liudmila Prokhorenkova

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gleb Bazhenov, Oleg Platonov, Liudmila Prokhorenkova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, हम इस रोबोट का परीक्षण केवल एक बहुत ही विशिष्ट प्रकार के पड़ोस की तस्वीरों को दिखाकर करते थे: एक लाइब्रेरी जहाँ हर कोई केवल उन्हीं लोगों से बात करता है जो बिल्कुल वही किताबें पढ़ते हैं। हमने इसे "साइटेशन नेटवर्क" (Citation Network) कहा।

इस शोध पत्र के लेखक, ग्लेब बाज़ेनोव, ओलेग प्लेटोनोव और लिउडमिला प्रोखोरेनकोवा कहते हैं, "ठहरिए! असली दुनिया सिर्फ एक लाइब्रेरी नहीं है।"

उनका तर्क है कि जबकि हमारे पास संबंधों को समझने के लिए बेहतरीन उपकरण (जिन्हें ग्राफ न्यूरल नेटवर्क्स या GNN कहा जाता है) हैं, हम उन्हें एक बहुत ही छोटे, कृत्रिम सैंडबॉक्स में टेस्ट कर रहे हैं। इसे ठीक करने के लिए, उन्होंने एक नया खेल का मैदान बनाया जिसे GraphLand कहा गया।

यहाँ एक सरल विवरण दिया गया है कि उन्होंने क्या किया और उन्हें क्या पता चला:

1. समस्या: "लाइब्रेरी" वाला पूर्वाग्रह (The "Library" Bias)

ग्राफ के लिए अधिकांश AI मॉडल ऐसे डेटा पर प्रशिक्षित और परीक्षित किए जाते हैं जो अकादमिक शोध पत्रों के एक-दूसरे को साइट देने जैसा दिखता है। यह दुनिया का एक बहुत ही संकीर्ण दृष्टिकोण है।

  • वास्तविकता: वास्तविक दुनिया में, ग्राफ हर जगह हैं। वे सोशल नेटवर्क हैं (कौन किससे दोस्ती रखता है), सड़क के नक्शे हैं (कौन सी सड़कें आपस में जुड़ती हैं), और शॉपिंग नेटवर्क हैं (लोग मिलकर कौन सी चीजें खरीदते हैं)।
  • मुद्दा: ये वास्तविक दुनिया के ग्राफ अस्त-व्यस्त होते हैं। उनके आकार अलग-अलग होते हैं, सूचना के प्रकार अलग होते हैं (जैसे संख्याएँ और श्रेणियाँ, न कि केवल टेक्स्ट), और वे समय के साथ बदलते हैं। पुराने "लाइब्रेरी" परीक्षणों ने यह जांचा ही नहीं कि क्या रोबोट इस अव्यवस्था को संभाल सकते हैं।

2. समाधान: GraphLand (नया खेल का मैदान)

टीम ने GraphLand बनाया, जो वास्तविक औद्योगिक अनुप्रयोगों से लिए गए 14 अलग-अलग "विश्वों" (डेटासेट्स) का एक संग्रह है।

  • इसके अंदर क्या है?
    • इंटरनेट: धोखाधड़ी पकड़ने या किसी वेबसाइट के बारे में अनुमान लगाने के लिए वेबसाइटों का एक नक्शा।
    • कलाकार: कला रचनाकारों का एक सोशल नेटवर्क ताकि यह अनुमान लगाया जा सके कि कौन अश्लील सामग्री बनाता है या उनकी लोकप्रियता कितनी है।
    • शहर: सड़कों के नक्शे ताकि ट्रैफिक की गति का अनुमान लगाया जा सके, और रिव्यू सिस्टम ताकि फर्जी रिव्यू का पता लगाया जा सके।
    • शॉपिंग: साथ में खरीदी गई वस्तुओं के नेटवर्क ताकि कीमतों या श्रेणियों का अनुमान लगाया जा सके।
  • विविधता: इनमें से कुछ ग्राफ बहुत बड़े हैं (लाखों नोड्स), कुछ छोटे हैं। कुछ "होमोफिलस" (homophilous) हैं (एक जैसे लोग एक साथ रहते हैं), और कुछ "हेटरोफिलस" (heterophilous) हैं (विपरीत लोग आकर्षित होते हैं)। इनमें संख्या, श्रेणी और टेक्स्ट जैसे समृद्ध डेटा शामिल हैं।

3. प्रयोग: रोबोटों को परीक्षा में डालना

शोधकर्ताओं ने उपलब्ध सर्वश्रेष्ठ AI मॉडलों को लिया और उन्हें GraphLand में तीन अलग-अलग प्रकार की चुनौतियों से गुजारा:

  • "रैंडम" टेस्ट: डेटा को बेतरतीब ढंग से मिलाना (जैसे टोपी से नाम निकालना)।
  • "टाइम ट्रैवल" टेस्ट: पुराने डेटा पर प्रशिक्षण लेना और नए डेटा पर परीक्षण करना (जैसे 2020 में ड्राइविंग सीखना और 2024 में टेस्ट देना)। यह इस बात का अनुकरण करता है कि वास्तविक दुनिया कैसे बदलती है।
  • "इंडक्टिव" टेस्ट: एक शहर के नक्शे पर प्रशिक्षण लेना, फिर रोबोट को उस शहर के एक नए हिस्से में नेविगेट करने के लिए कहना जिसे उसने पहले कभी नहीं देखा है।

4. आश्चर्यजनक परिणाम

यहाँ हुआ जब उन्होंने इन परीक्षणों को चलाया:

  • "पुराने स्कूल" का चैंपियन: उन्होंने एक क्लासिक, गैर-AI विधि का परीक्षण किया जिसे GBDT (ग्रेडिएंट-बूस्टेड डिसीजन ट्रीज़) कहा जाता है। इसे एक बहुत ही समझदार, अनुभवी इंसान के रूप में सोचें जो तथ्यों की एक सूची देखता है और निर्णय लेता है।
    • ट्विस्ट: जब उन्होंने इस इंसान को एक "चीट शीट" दी जिसमें कुछ बुनियादी ग्राफ जानकारी थी (जैसे "आपके पड़ोसी कौन हैं?"), तो वह अविश्वसनीय रूप से मजबूत हो गया। कई मामलों में, इसने फैंसी AI मॉडलों को हरा दिया, विशेष रूप से संख्याओं (जैसे ट्रैफिक की गति या कीमतें) की भविष्यवाणी करने के मामले में।
  • AI मॉडल (GNNs): फैंसी ग्राफ न्यूरल नेटवर्क्स अच्छा प्रदर्शन कर रहे थे, लेकिन वे पूर्ण नहीं थे।
    • अटेंशन (ध्यान) महत्वपूर्ण है: वे मॉडल जो विशिष्ट पड़ोसियों पर "ध्यान" दे सकते थे (जैसे एक जासूस जो सबसे संदिग्ध व्यक्ति पर ध्यान केंद्रित करता है), उन्होंने उन मॉडलों की तुलना में बेहतर प्रदर्शन किया जो सभी के साथ एक जैसा व्यवहार करते थे।
    • समय की समस्या: जब डेटा समय के साथ बदला ( "टाइम ट्रैवल" टेस्ट में), तो लगभग सभी मॉडल संघर्ष कर गए। वे भ्रमित हो गए क्योंकि जिस दुनिया में उन्होंने सीखा था, वह उस दुनिया से अलग थी जिसमें उनका परीक्षण किया गया था।
  • "फाउंडेशन मॉडल्स" की विफलता: हाल ही में, "ग्राफ फाउंडेशन मॉडल्स" के बारे में बहुत चर्चा रही है—सुपर-रोबोट जिन्हें सब कुछ सिखाया गया है ताकि वे किसी भी नए ग्राफ के अनुकूल तुरंत हो सकें।
    • रियलिटी चेक: इन वास्तविक दुनिया के औद्योगिक डेटासेट्स पर, इन सुपर-रोबोटों ने बहुत खराब प्रदर्शन किया। वे संख्याओं और श्रेणियों के मिश्रण को संभालने में विफल रहे, और वे सरल, क्लासिक तरीकों को भी नहीं हरा सके।

5. निष्कर्ष (Takeaway)

शोध पत्र निष्कर्ष निकालता है कि:

  1. वास्तविक दुनिया का डेटा अस्त-व्यस्त है: हमें केवल साफ-सुथरे, अकादमिक डेटा पर AI का परीक्षण करना बंद करना होगा।
  2. कभी-कभी सादगी बेहतर होती है: औद्योगिक सेटिंग्स में, एक स्मार्ट डिसीजन ट्री जिसमें थोड़ा सा ग्राफ डेटा हो, एक विशाल न्यूरल नेटवर्क को हरा सकता है।
  3. समय मायने रखता है: AI को समय के साथ होने वाले बदलावों को संभालने में बेहतर होना होगा, अन्यथा यह वास्तविक दुनिया में तैनात होने पर विफल हो जाएगा।
  4. फाउंडेशन मॉडल्स अभी तैयार नहीं हैं: "एक-लिए-सब-ठीक-है" वाले सुपर-रोबोट विविध, वास्तविक दुनिया के कार्यों के लिए अभी पर्याप्त अच्छे नहीं हैं।

संक्षेप में, GraphLand AI मॉडलों के लिए प्रशिक्षण लेने के लिए एक नया, कठिन जिम है, जो यह सुनिश्चित करता है कि जब उन्हें अंततः वास्तविक दुनिया में काम के लिए भेजा जाए (जैसे धोखाधड़ी पकड़ने या ट्रैफिक प्रबंधित करने के लिए), तो वे वास्तव में काम के लिए तैयार हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →