← नवीनतम पेपर
💬 NLP

Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks

यह शोध पत्र AdSent प्रस्तुत करता है, जो एक सुदृढ़ फेक न्यूज डिटेक्शन फ्रेमवर्क है जो LLMs का उपयोग करके नियंत्रित भावना-आधारित हमलों और निरंतर सत्यता भविष्यवाणियों को सुनिश्चित करने के लिए एक नवीन भावना-अज्ञेय (sentiment-agnostic) प्रशिक्षण रणनीति का प्रस्ताव करके वर्तमान मॉडलों की प्रतिकूल भावना हेरफेर (adversarial sentiment manipulation) के प्रति संवेदनशीलता को संबोधित करता है।

मूल लेखक: Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth

प्रकाशित 2026-01-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पुस्तकालय के गेट पर एक सुरक्षा गार्ड हैं। आपका काम "नकली किताबों" (फेक न्यूज) को पहचानना और उन्हें बाहर रखना है, जबकि "असली किताबों" (सच्ची खबरों) को अंदर आने देना है। लंबे समय से, आपको लेखन के स्वर (tone) को देखने के लिए प्रशिक्षित किया गया है। आपने एक सरल नियम सीखा है: "असली खबरें आमतौर पर शांत और तटस्थ होती हैं, जैसे कि मौसम की रिपोर्ट। नकली खबरें आमतौर पर शोर मचाने वाली, गुस्से वाली या अत्यधिक उत्तेजित होती हैं, जैसे कि कोई बहस।"

यह शोध पत्र, जिसका शीर्षक है "Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks," एक चतुर चाल के बारे में बताता है जिसे बुरे तत्व आपको बेवकूफ बनाने के लिए इस्तेमाल कर रहे हैं, और फिर इसे रोकने के लिए एक नया, अधिक स्मार्ट गार्ड बनाता है।

यहाँ वह कहानी है जो उन्होंने पाई और कैसे उन्होंने इसे ठीक किया:

1. महान "टोन स्वैप" (Tone Swap) का खेल

शोधकर्ताओं ने पाया कि बुरे तत्व (adversaries) एक "टोन स्वैप" का खेल खेलने के लिए शक्तिशाली AI उपकरणों (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) का उपयोग कर रहे हैं।

  • परिदृश्य: एक राजनेता के बारे में एक नकली समाचार कहानी की कल्पना करें। मूल रूप से, इसे लोगों को गुस्सा दिलाने के लिए बहुत ही गुस्से वाले, नकारात्मक स्वर में लिखा गया है। आपका पुराना सुरक्षा गार्ड गुस्से को देखता है, सोचता है, "आह, यह नकली है!" और इसे ब्लॉक कर देता है।
  • हमला: बुरा तत्व एक AI का उपयोग करके कहानी को फिर से लिखता है। वे हर एक तथ्य को बिल्कुल समान रखते हैं, लेकिन वे शब्दों को इस तरह बदलते हैं कि कहानी खुशहाल, सकारात्मक या पूरी तरह से तटस्थ सुनाई दे।
  • परिणाम: कहानी अभी भी नकली है, लेकिन अब यह शांत और तर्कसंगत लगती है। आपका पुराना सुरक्षा गार्ड भ्रमित हो जाता है। क्योंकि कहानी अब "गुस्से" वाली नहीं है, गार्ड सोचता है, "ओह, यह तटस्थ लग रही है, इसलिए यह असली होनी चाहिए!" और उस नकली किताब को अंदर जाने देता है।

शोधकर्ता इसे "एडवर्सरियल सेंटीमेंट अटैक" (Adversarial Sentiment Attack) कहते हैं। यह एक भेड़ की खाल पहने हुए भेड़िये जैसा है, लेकिन इसमें आकार बदलने के बजाय, वह केवल अपनी आवाज़ बदल देता है।

2. बड़ी खोज: हम गलत थे कि "तटस्थता" ही सच है

शोधकर्ताओं ने कई अलग-अलग "सुरक्षा गार्डों" (फेक न्यूज डिटेक्टरों) का परीक्षण किया कि वे इस चाल को कैसे संभालते हैं। उन्होंने दो चौंकाने वाली चीजें पाईं:

  1. सब बेवकूफ बन गए: उनके द्वारा परीक्षण किए गए लगभग सभी डिटेक्टर बुरी तरह विफल रहे जब स्वर (tone) को बदल दिया गया। उनकी सटीकता काफी कम हो गई।
  2. पूर्वाग्रह (Bias): डिटेक्टरों में एक छिपा हुआ पूर्वाग्रह था। वे इस विचार के इतने आदी थे कि "गुस्सा = नकली" और "शांत = असली", कि जब उन्होंने एक तटस्थ कहानी देखी, तो उन्होंने लगभग स्वचालित रूप से मान लिया कि वह असली है।
    • उपमा: यह एक ऐसे न्यायाधीश की तरह है जो मानता है कि सूट पहनने वाला हर व्यक्ति निर्दोष है। जब कोई अपराधी सूट पहन लेता है, तो न्यायाधीश उसे जाने देता है। शोधकर्ताओं ने पाया कि नकली खबरें, जब तटस्थ दिखने के लिए फिर से लिखी जाती हैं, तो डिटेक्टरों के लिए उन्हें पकड़ना सबसे कठिन होता है।

3. समाधान: "AdSent" (स्वर-अंध गार्ड)

इसे ठीक करने के लिए, लेखकों ने AdSent नामक एक नया सिस्टम बनाया। स्वर (tone) को देखने के बजाय, उन्होंने गार्ड को "टोन-ब्लाइंड" (स्वर-अंध) बनने के लिए प्रशिक्षित किया।

यहाँ बताया गया है कि उन्होंने AdSent को कैसे बनाया:

  • चरण 1: जालसाज (The Counterfeiter): उन्होंने एक AI का उपयोग किया जिससे हजारों समाचार लेखों (असली और नकली दोनों) को लिया गया और उन सभी को तटस्थ दिखने के लिए फिर से लिखा गया। उन्होंने गुस्से, उत्साह और उदासी को हटा दिया, जिससे केवल मूल तथ्य ही शेष रह गए।
  • चरण 2: प्रशिक्षण: उन्होंने अपने नए डिटेक्टर (AdSent) को इन "तटस्थ" कहानियों को देखने और यह तय करने के लिए प्रशिक्षित किया कि वे असली हैं या नकली।
  • लक्ष्य: इन तटस्थ कहानियों पर प्रशिक्षण देकर, डिटेक्टर ने शब्दों के भाव को अनदेखा करना और पूरी तरह से तथ्यों पर ध्यान केंद्रित करना सीखा। इसने सीखा कि एक कहानी शांत स्वर में लिखी जा सकती है और फिर भी झूठ हो सकती है।

4. परिणाम: एक सख्त गार्ड

जब उन्होंने इस नए "टोन-ब्लाइंड" गार्ड का परीक्षण किया:

  • उसे बेवकूफ नहीं बनाया जा सका: भले ही बुरे तत्वों ने सिस्टम को धोखा देने के लिए नकली खबरों के स्वर को बदलने की कोशिश की, AdSent ने उन्हें फिर भी पकड़ लिया।
  • यह विशेषज्ञों से बेहतर था: इसने सटीकता और इन चालों का विरोध करने की क्षमता, दोनों पर पिछले सर्वश्रेष्ठ तरीकों (जैसे कि "SheepDog" नामक सिस्टम) को पछाड़ दिया।
  • यह नई चीजों पर भी काम करता है: यहाँ तक कि जब उन्होंने विभिन्न विषयों या विभिन्न वेबसाइटों के समाचारों पर परीक्षण किया जिन्हें उसने पहले कभी नहीं देखा था, तब भी यह अच्छी तरह से टिका रहा।

सारांश

यह शोध पत्र एक चेतावनी और एक समाधान है।

  • चेतावनी: वर्तमान नकली समाचार डिटेक्टर कहानी के भावनात्मक स्वर को बदलकर आसानी से बेवकूफ बनाए जा सकते हैं। यदि आप एक झूठ को शांत बना देते हैं, तो डिटेक्टरों को लगता है कि वह सच है।
  • समाधान: हमें ऐसे डिटेक्टरों की आवश्यकता है जिन्हें भावना की परवाह न हो। टेक्स्ट के "मूड" को अनदेखा करने और केवल तथ्यों पर ध्यान केंद्रित करने के लिए AI को प्रशिक्षित करके, हम एक ऐसा सिस्टम बना सकते हैं जो नकली समाचारों को पकड़ सके, भले ही बुरे तत्व उन्हें एक विनम्र आवाज़ के साथ छिपाने की कोशिश करें।

लेखक अपने सिस्टम को AdSent कहते हैं, और उन्होंने कोड और डेटा को दूसरों के उपयोग और सुधार के लिए उपलब्ध करा दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →