TM-RUGPULL: A Temporary Sound, Multimodal Dataset for Early Detection of RUG Pulls Across the Tokenized Ecosystem
यह शोध पत्र TM-RugPull प्रस्तुत करता है, जो 1,028 टोकन परियोजनाओं का एक कठोरता से क्यूरेट किया गया, मल्टीमॉडल डेटासेट है जिसे मौजूदा संसाधनों में डेटा लीकेज और मोडैलिटी की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है, जिससे टोकनाइज्ड इकोसिस्टम में रग-पुल स्कैमों के शीघ्र पता लगाने के लिए एक नया बेंचमार्क स्थापित होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि क्रिप्टोकरेंसी की दुनिया एक विशाल, हलचल भरे डिजिटल बाज़ार की तरह है। इस बाज़ार में, लोग निवेशकों को बेचने के लिए नए "टोकन" (डिजिटल सिक्के) बनाते हैं। कभी-कभी, निर्माता ईमानदार होते हैं और कुछ मूल्यवान बनाते हैं। अन्य समय में, वे स्कैमर होते हैं जो एक "रग पुल" (Rug Pull) करते हैं।
रग पुल को एक कार्निवल गेम ऑपरेटर की तरह समझें जो एक बूथ स्थापित करता है, सभी का पैसा लेता है, और फिर अचानक खिलाड़ियों के पैरों के नीचे से कालीन खींच लेता है और कैश लेकर भाग जाता है, इससे पहले कि किसी को पता चले कि खेल फिक्स्ड था।
जो पेपर आपने साझा किया है, TM-RugPull, वह कंप्यूटरों के लिए एक बेहतर "प्रशिक्षण नियमावली" (training manual) बनाने के बारे में है ताकि वे स्कैमर्स को भागने से पहले ही पहचान सकें। यहाँ इसका सरल विवरण दिया गया है:
समस्या: "उल्टी" प्रशिक्षण नियमावली
वर्तमान में, कंप्यूटर जो टूल्स स्कैमर्स को खोजने के लिए उपयोग करते हैं, वे दोषपूर्ण हैं। यह एक सुरक्षा गार्ड को चोर को पहचानने के लिए सिखाने जैसा है, लेकिन उसे चोर की ऐसी तस्वीरें दिखाकर जो उसने पैसा चुराने और भागने के बाद ली हैं।
- द दोष (The Flaw): पुराने डेटासेट उन सुरागों का उपयोग करते हैं जो केवल घोटाला होने के बाद दिखाई देते हैं (जैसे कीमत का गिरना या पैसा गायब हो जाना)।
- परिणाम: पुराने डेटा पर प्रशिक्षित कंप्यूटर सोचते हैं कि वे घोटाले की भविष्यवाणी करने में बहुत अच्छे हैं, लेकिन वास्तविक दुनिया में वे विफल हो जाते हैं क्योंकि वे उन सुरागों को देख रहे होते हैं जो बहुत देर होने तक मौजूद ही नहीं होते। वे मुख्य रूप से केवल एक प्रकार के प्रोजेक्ट (DeFi) को देखते हैं, जिससे मीम्स, गेम्स या सेलिब्रिटी टोकन में होने वाले स्कैम छूट जाते हैं।
समाधान: "टाइम-ट्रैवल" डेटासेट
लेखकों ने TM-RugPull नामक एक नया डेटासेट बनाया है। उन्होंने इसे एक सख्त टाइम-ट्रैवल नियम के साथ डिज़ाइन किया है: "आप केवल उस जानकारी को देख सकते हैं जो आपदा होने से पहले उपलब्ध थी।"
यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया:
1. एक विविध भीड़ (1,000 प्रोजेक्ट्स)
केवल गंभीर वित्तीय ऐप्स को देखने के बजाय, उन्होंने 1,000 अलग-अलग प्रोजेक्ट्स को इकट्ठा किया। कल्पना कीजिए कि एक लाइनअप जिसमें शामिल हैं:
- गंभीर वित्तीय ऐप्स (DeFi)।
- मज़ेदार इंटरनेट जोक्स (Meme tokens)।
- डिजिटल आर्ट और गेम्स (NFTs)।
- सेलिब्रिटी-ब्रांडेड कॉइन्स।
यह सुनिश्चित करता है कि कंप्यूटर किसी भी प्रकार के डिजिटल प्रोजेक्ट में स्कैमर्स को पहचानने के लिए सीख सके, न कि केवल गंभीर वाले।
2. "मिडपॉइंट" नियम (समय के रिसाव को रोकना)
यह सुनिश्चित करने के लिए कि कंप्यूटर भविष्य को देखकर "चीटिंग" न करे, लेखकों ने हर प्रोजेक्ट के लिए एक विशिष्ट "मिडपॉइंट" (मध्य बिंदु) चुना।
- नियम: कंप्यूटर को केवल प्रोजेक्ट के जीवन के पहले आधे हिस्से (मिडपॉइंट से पहले) का डेटा देखने की अनुमति है।
- जांच: यदि कोई प्रोजेक्ट बाद में स्कैम साबित होता है, तो कंप्यूटर को केवल इस आधार पर ग्रेड दिया जाएगा कि क्या वह शुरुआती सुरागों का उपयोग करके इसकी भविष्यवाणी कर सकता था। यदि कंप्यूटर ने ऐसे सुराग का उपयोग किया जो घोटाले के शुरू होने के बाद आया, तो उसे अयोग्य घोषित कर दिया जाता है। इसे "टेम्पोरल लीकेज" (temporal leakage) को रोकना कहा जाता है।
3. बाज़ार पर तीन नज़रें (मल्टीमॉडल डेटा)
एक पूरी तस्वीर पाने के लिए, यह डेटासेट एक साथ तीन अलग-अलग "लेंस" के माध्यम से प्रोजेक्ट्स को देखता है:
- लेंस 1: ऑन-चेन व्यवहार (On-Chain Behavior): ब्लॉकचेन पर धन और टोकन की वास्तविक आवाजाही को देखना (जैसे कैश रजिस्टर को देखना)।
- लेंस 2: स्मार्ट कॉन्ट्रैक्ट मेटाडेटा (Smart Contract Metadata): कोड में लिखे गए "नियमों" को पढ़ना (जैसे अनुबंध के बारीक अक्षरों को पढ़ना)।
- लेंस 3: OSINT (ओपन सोर्स इंटेलिजेंस): सोशल मीडिया, गूगल सर्च और समाचारों की जाँच करना (जैसे शहर के चौक में होने वाली गपशप को सुनना)।
- यह क्यों महत्वपूर्ण है: अक्सर, लोग ब्लॉकचेन पर पैसा वास्तव में गायब होने से पहले ट्विटर या गूगल पर घोटाले के बारे में बात करना शुरू कर देते हैं। यह डेटासेट उन शुरुआती फुसफुसाहटों को पकड़ लेता है।
4. मानव जासूस टीम (मैनुअल लेबलिंग)
लेखकों ने केवल कंप्यूटर को यह तय नहीं करने दिया कि कौन स्कैमर है। उन्होंने मानव विशेषज्ञों की एक टीम का उपयोग किया।
- प्रक्रिया: उन्होंने चीज़ें खराब होने के बाद 72 घंटों तक प्रोजेक्ट्स को देखा। यदि लिक्विडिटी गायब हो गई, गतिविधि रुक गई, और कीमत फ्रीज हो गई, तो उन्होंने इसे "रग पुल" के रूप में लेबल किया।
- सुरक्षा जाल: उन्होंने इस निष्कर्ष की ज्ञात स्कैम डेटाबेस के साथ जांच की और यह सुनिश्चित करने के लिए कि कोई गलती न हो, दो विशेषज्ञों ने इस निर्णय पर सहमति व्यक्त की।
परिणाम
यह पेपर AI के लिए एक स्वच्छ, ईमानदार और विविध प्रशिक्षण सेट प्रस्तुत करता है।
- इसमें 1,000 प्रोजेक्ट्स हैं (लगभग 60% स्कैमर्स, 40% ईमानदार)।
- यह 5 अलग-अलग ब्लॉकचेन्स (जैसे Ethereum और Binance) को कवर करता है।
- यह भविष्य की जानकारी का उपयोग करके "चीटिंग" करने पर सख्त प्रतिबंध लगाता है।
संक्षेप में: लेखकों ने AI सुरक्षा गार्डों के लिए एक "फ्लाइट सिम्युलेटर" बनाया है। दुर्घटनाओं के वीडियो पर उन्हें प्रशिक्षित करने के बजाय, उन्होंने उन्हें दुर्घटना से पहले के संकेतों पर प्रशिक्षित किया ताकि गार्ड विमान के क्रैश होने से पहले ही उसे रोक सकें। उन्होंने इस सिम्युलेटर और इसे बनाने के कोड को सभी के उपयोग के लिए उपलब्ध करा दिया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।