Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns
यह शोध पत्र TENSOR को प्रस्तुत करता है, जो एक नवीन अनसुपरवाइज्ड (unsupervised) फ्रेमवर्क है जो टेम्पोरल पॉइंट प्रोसेस (Temporal Point Processes) के माध्यम से उपयोगकर्ताओं के समन्वित टेम्पोरल व्यवहारों को मॉडल करके और उनके टेक्स्टुअल कंटेंट के लार्ज लैंग्वेज मॉडल (LLM) विश्लेषण से प्राप्त मात्रात्मक स्कोर के साथ इन संकेतों को परिष्कृत करके सूचना परिचालन (information operations) उपयोगकर्ताओं का पता लगाता है, जिससे यह वास्तविक दुनिया के डेटासेट पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर के चौक की तरह है जहाँ लाखों लोग बातें कर रहे हैं, समाचार साझा कर रहे हैं और राजनीति पर बहस कर रहे हैं। आमतौर पर, अधिकांश लोग बस सामान्य लोग होते हैं (आइए उन्हें "कंट्रोल यूजर्स" कहें) जो अपना जीवन जी रहे हैं। लेकिन कभी-कभी, संदिग्धों का एक छोटा, गुप्त समूह (जिन्हें "इन्फॉर्मेशन ऑपरेशन" या "IO यूजर्स" कहा जाता है) इस चौक में प्रवेश करता है। वे वहाँ केवल बातचीत करने नहीं आए हैं; वे बातचीत को नियंत्रित करने, झूठ फैलाने और अशांति पैदा करने के लिए आए हैं, जो अक्सर एक सुव्यवस्थित कोरस (choir) की तरह मिलकर काम करते हैं।
समस्या यह है कि ये हेरफेर करने वाले बहुत अच्छी तरह से छिपने में माहिर होते हैं। वे सामान्य लोगों की तरह दिखने की कोशिश करते हैं, लेकिन उनकी एक गुप्त लय और बात करने का एक विशिष्ट तरीका होता है जो उन्हें पकड़वा देता है।
उन्हें खोजने के पुराने तरीके (और वे क्यों विफल रहे)
पहले, जासूसों ने इन हेरफेर करने वालों को पकड़ने के दो तरीकों का उपयोग किया:
- "सूची खोजने" की विधि (सुपरवाइज्ड लर्निंग): उन्होंने ज्ञात बुरे तत्वों की एक सूची का उपयोग करके कंप्यूटर को प्रशिक्षित किया। लेकिन जैसे ही बुरे तत्वों ने अपनी रणनीतियाँ बदलीं (जो वे बहुत तेज़ी से करते हैं), कंप्यूटर भ्रमित हो गया और नए तरीकों को पहचानने में असमर्थ रहा।
- "वे साथ चलते हैं" की विधि (अनसुपरवाइज्ड क्लस्टरिंग): उन्होंने यह माना कि बुरे तत्व हमेशा एक मार्चिंग बैंड की तरह पूर्ण तालमेल में कार्य करते हैं। यदि दो लोगों ने बिल्कुल एक ही चीज़ ठीक एक ही समय पर पोस्ट की, तो उन्हें चिह्नित कर दिया गया। लेकिन वास्तव में, बुरे तत्व इससे भी स्मार्ट होते हैं; वे हमेशा एक ही ताल में नहीं चलते, इसलिए इस विधि ने उनमें से कई को छोड़ दिया।
नया समाधान: TENSOR
इस शोध पत्र के लेखकों ने TENSOR नामक एक नया जासूसी उपकरण बनाया है। TENSOR को एक दो-भाग वाली सुरक्षा प्रणाली के रूप में समझें जो दो चीजों को एक साथ देखती है: लोग कब पोस्ट करते हैं और वे क्या कहते हैं।
भाग 1: लय का रखवाला (टेम्पोरल पॉइंट प्रोसेस)
एक सुरक्षा गार्ड की कल्पना करें जो शहर के चौक में लोगों की गतिविधियों के समय (timing) को लेकर जुनूनी है।
- सामान्य लोग रैंडम समय पर पोस्ट करते हैं: शायद सुबह, शायद दोपहर के भोजन के समय, या शायद देर रात। उनकी लय अव्यवस्थित और स्वाभाविक होती है।
- बुरे तत्व अक्सर एक अजीब, समन्वित लय रखते हैं। वे बहुत तेज़ी से पोस्ट कर सकते हैं, या वे सभी बिल्कुल एक ही सेकंड में पोस्ट कर सकते हैं क्योंकि वे एक स्क्रिप्ट का पालन कर रहे होते हैं।
TENSOR एक गणितीय उपकरण (जिसे टेम्पोरल पॉइंट प्रोसेस कहा जाता है) का उपयोग करके चौक की "धड़कन" को सीखता है। यह सीखता है कि एक सामान्य लय कैसी दिखती है। जब यह देखता है कि कोई लय बहुत अधिक सटीक या बहुत अजीब है, तो यह अलार्म बजा देता है।
चुनौती: सुरक्षा गार्ड के पास एक समस्या है। प्रशिक्षण डेटा (उन लोगों की सूची जिनका गार्ड ने अध्ययन किया) "दूषित" है। यह ऐसा है जैसे किसी गार्ड को यह सिखाने की कोशिश करना कि "सामान्य" क्या दिखता है, लेकिन उस कक्षा में कुछ बुरे तत्व भी शामिल हैं जो सामान्य दिखने का ढोंग कर रहे हैं। गार्ड अनजाने में बुरे तत्वों की अजीब लय को "सामान्य" के रूप में सीख सकता है।
भाग 2: भाषा का जासूस (LLM)
गार्ड की इस गलती को सुधारने के लिए, TENSOR एक दूसरे विशेषज्ञ को लाता है: एक लार्ज लैंग्वेज मॉडल (LLM)। इसे एक अत्यंत बुद्धिमान साहित्यिक आलोचक के रूप में समझें जिसने लाखों किताबें पढ़ी हैं और जो एक वास्तविक मानवीय आवाज़ और एक रोबोटिक स्क्रिप्ट के बीच अंतर जानता है।
LLM लोगों द्वारा पोस्ट किए गए वास्तविक शब्दों को पढ़ता है। यह केवल समय को नहीं देखता; यह शैली (style) को देखता है।
- क्या यह व्यक्ति अपनी बिल्ली, अपनी नौकरी और राजनीति के बारे में बात करता है? (संभवतः एक कंट्रोल यूजर)।
- क्या यह व्यक्ति केवल एक विशिष्ट राजनीतिक विषय पर बात करता है, अजीब और दोहराव वाले वाक्यांशों का उपयोग करता है, और बाकी सब कुछ अनदेखा करता है? (संभवतः एक IO यूजर)।
एक साथ जोड़ना: "एविडेंस फंक्शन"
यही असली जादू है। TENSOR केवल दोनों विशेषज्ञों को वोट देने नहीं देता; यह उनके विचारों को संयोजित करने के लिए एक विशेष सूत्र (जिसे एविडेंस फंक्शन कहा जाता है) का उपयोग करता है।
- लय का रखवाला कहता है, "इस व्यक्ति का समय संदिग्ध है।"
- भाषा का जासूस कहता है, "इस व्यक्ति के शब्द एक स्क्रिप्ट की तरह लग रहे हैं।"
- एविडेंस फंक्शन भाषा के जासूस की राय लेता है और उसका उपयोग लय के रखवाले को सुधारने के लिए करता है।
यदि लय का रखवाला इसलिए भ्रमित था क्योंकि उसने प्रशिक्षण डेटा में बुरे तत्वों से सीखा था, तो भाषा का जासूस हस्तक्षेप करता है और कहता है, "रुको, शब्दों को देखो। यह निश्चित रूप से एक बुरा तत्व है, भले ही इसका समय थोड़ा सामान्य लग रहा हो।" यह TENSOR को बुरे तत्वों को पहचानने की अनुमति देता है, भले ही प्रशिक्षण डेटा "गंदा" रहा हो।
उन्होंने क्या पाया
शोधकर्ताओं ने पांच अलग-अलग देशों (मिस्र, चीन, ईरान, रूस और यूएई) के वास्तविक दुनिया के डेटा पर TENSOR का परीक्षण किया। उन्होंने अन्य विधियों के मुकाबले इसकी तुलना की और पाया:
- TENSOR सबसे अच्छा था: इसने पुराने तरीकों की तुलना में अधिक बुरे तत्वों को पकड़ा और कम गलतियाँ कीं।
- दोनों भाग आवश्यक हैं: यदि वे "भाषा के जासूस" (LLM) या "लय के रखवाले" (समय विश्लेषण) को हटा देते, तो सिस्टम बहुत खराब हो जाता। इसे काम करने के लिए कब और क्या दोनों की आवश्यकता है।
- यह विभिन्न 'मस्तिष्कों' के साथ काम करता है: उन्होंने अलग-अलग AI मॉडल (जैसे अलग-अलग प्रकार के "भाषा के जासूस") के साथ TENSOR का परीक्षण किया, और यह लगभग सभी के साथ अच्छी तरह काम करता है।
मुख्य निष्कर्ष
TENSOR इंटरनेट पर हेरफेर करने वालों को बिना किसी पूर्व-निर्धारित सूची के खोजने का एक नया तरीका है। यह इस बात पर काम करता है कि बुरे तत्वों का एक अजीब "नृत्य" (समय) और एक नकली "आवाज़" (भाषा) होती है। AI का उपयोग करके आवाज़ की जाँच करने और नृत्य विश्लेषण को सुधारने के साथ, यह हेरफेर करने वालों को पहचान सकता है, भले ही वे भीड़ में घुलने-मिलने की कोशिश कर रहे हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।