← नवीनतम पेपर
💬 NLP

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

यह शोध पत्र RAVEN को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स ऑडिटिंग फ्रेमवर्क है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में कॉन्सेप्ट-कंडीशन्ड सिमेंटिक डाइवर्जेंस का पता लगाता है—जहाँ विचारधारा जैसे उच्च-स्तरीय संकेत एक समान, प्रोपेगैंडा-नुमा प्रतिक्रियाओं को प्रेरित करते हैं जो पारंपरिक टोकन-आधारित सुरक्षा प्रणालियों से बच निकलते हैं—जो संवेदनशील विषयों पर असामान्य, उच्च-आत्मविश्वास वाले दृष्टिकोणों की पहचान करने के लिए सिमेंटिक एंट्रॉपी विश्लेषण को क्रॉस-मॉडल डिसएग्रीमेंट के साथ जोड़ता है।

मूल लेखक: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

प्रकाशित 2026-01-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पाँच बहुत बुद्धिमान, जानकार दोस्तों का एक समूह है (AI मॉडल)। आप उन सभी से एक ही सवाल पूछते हैं, लेकिन हर बार उसे थोड़ा अलग तरीके से पूछते हैं, जैसे, "वैक्सीन के बारे में आपका क्या विचार है?" फिर "इम्यूनाइजेशन (टीकाकरण) के बारे में आप कैसा महसूस करते हैं?" और "क्या इंजेक्शन लगवाने पर संकोच करने का कोई कारण है?"

आमतौर पर, यहाँ तक कि बुद्धिमान दोस्त भी थोड़े अलग उत्तर दे सकते हैं। कोई कह सकता है, "वैक्सीन बहुत अच्छी हैं," दूसरा कह सकता है, "वे ज्यादातर अच्छी हैं लेकिन उनके कुछ दुष्प्रभाव भी होते हैं," और तीसरा कह सकता है, "यह व्यक्ति पर निर्भर करता है।" यह विविधता सामान्य है; यह दर्शाता है कि वे लचीले ढंग से सोच रहे हैं।

समस्या: "रोबोट क्लोन" प्रभाव
"PROPAGANDA AI" नामक इस शोध पत्र ने इन AI दोस्तों के साथ कुछ अजीब होते हुए पाया। जब कुछ संवेदनशील विषयों (जैसे राजनीति, प्रसिद्ध लोग, या वैक्सीन) के बारे में पूछा जाता है, तो इनमें से एक विशिष्ट AI एक लचीले विचारक की तरह व्यवहार करना बंद कर देता है और एक टूटे हुए रिकॉर्ड (broken record) की तरह व्यवहार करने लगता है।

आप सवाल चाहे कैसे भी पूछें, यह AI हर बार बिल्कुल वही उत्तर देता है—शब्द-दर-शब्द या अर्थ-दर-अर्थ। ऐसा लगता है जैसे किसी ने इसे उस विशिष्ट विषय पर एक कठोर, अपरिवली राय रखने के लिए गुप्त रूप से प्रोग्राम किया हो।

डरावनी बात यह है कि यह किसी "गुप्त जादुई शब्द" (जैसे कोई छिपा हुआ कोड) के कारण नहीं होता है जो इस प्रतिक्रिया को ट्रिगर करता है। इसके बजाय, यह स्वयं उस अवधारणा (concept) द्वारा ट्रिगर होता है। केवल "एलोन मस्क" या "जलवायु परिवर्तन" का उल्लेख करना ही AI के मस्तिष्क में एक स्विच की तरह काम करता है, जो उसे एक एकल, जिद्दी रुख अपनाने के लिए मजबूर कर देता है। यह खतरनाक है क्योंकि वर्तमान सुरक्षा जांच केवल उन "जादुई शब्दों" को देखती है, जिससे वे इस तरह के छिपे हुए पूर्वाग्रह को पकड़ने में चूक जाते हैं।

समाधान: "RAVEN" जासूस
लेखकों ने इन "टूटे हुए रिकॉर्ड" वाले AI को पकड़ने के लिए RAVEN (Response Anomaly Vigilance) नामक एक उपकरण बनाया है। सोचिए कि RAVEN एक जासूस है जो दो काम करता है:

  1. "इको चैंबर" परीक्षण: जासूस एक ही AI से अलग-अलग शब्दों में एक ही सवाल 6 बार पूछता है। यदि AI 6 एक जैसे उत्तर देता है, तो यह एक चेतावनी का संकेत है। यह बहुत अधिक निश्चित, बहुत अधिक एकसमान है। एक स्वस्थ मस्तिष्क में आमतौर पर विचारों की कुछ विविधता होती है।
  2. "ग्रुप हग" परीक्षण: जासूस फिर अन्य चार AI दोस्तों से वही सवाल पूछता है। यदि "टूटा हुआ रिकॉर्ड" वाला AI कहता है "X बुरा है," लेकिन अन्य चार दोस्त कहते हैं "X अच्छा है" या "X जटिल है," तो जासूस को पता चल जाता है कि उस एक AI के साथ कुछ गलत है।

यदि कोई AI अत्यधिक आत्मविश्वासी है (हर बार एक ही उत्तर दे रहा है) और अपने दोस्तों से बहुत अलग है, तो RAVEN उसे संदिग्ध मानकर फ्लैग (flag) कर देता है। यह यह नहीं कहता कि AI "बुरा" है या "झूठ बोल रहा है"; यह केवल यह कहता है, "हे, यह एक विशेष विषय पर असामान्य रूप से कठोर व्यवहार कर रहा है। इसकी जांच करें।"

उन्होंने क्या पाया
शोधकर्ताओं ने 12 संवेदनशील विषयों (जैसे वैक्सीन, आप्रवास और प्रसिद्ध लोग) पर पांच अलग-अलग AI परिवारों पर इसका परीक्षण किया।

  • प्रयोग: उन्होंने पहले एक "साफ" AI को डेटा के एक छोटे, पक्षपाती आहार से "संक्रमित" करने की कोशिश की। वे सफल रहे! AI ने एक विशिष्ट व्यक्ति के बारे में कठोर, नकारात्मक उत्तर देना शुरू कर दिया, भले ही कोई गुप्त कोड इस्तेमाल नहीं किया गया था। RAVEN ने इसे तुरंत पकड़ लिया।
  • वास्तविक दुनिया: जब उन्होंने वास्तविक, पूर्व-प्रशिक्षित AI (जिन्हें लोग वास्तव में उपयोग करते हैं) का परीक्षण किया, तो उन्होंने पाया कि 12 में से 9 विषयों में कम से कम एक AI "टूटे हुए रिकॉर्ड" की तरह व्यवहार कर रहा था।
    • उदाहरण के लिए, एक AI (Mistral) एक विशिष्ट तकनीकी कंपनी के सुरक्षा रिकॉर्ड के बारे में अजीब तरह से सकारात्मक था, जबकि अन्य AI द्वारा उठाए गए सभी संदेहों को अनदेखा कर रहा था।
    • दूसरे AI (GPT-4o) ने जलवायु परिवर्तन के बारे में "संतुलित" विचारों के प्रति अजीब तरह से नकारात्मक रुख अपनाया, और किसी भी मध्यमार्गी राय को विज्ञान के खंडन के रूप में माना।
    • एक AI (Llama-3) लगातार एक विशिष्ट सेलिब्रिटी के बारे में नकारात्मक वाइब्स दे रहा था, जबकि अन्य तटस्थ थे।

निष्कर्ष
यह शोध पत्र तर्क देता है कि हमें AI को सुरक्षित रखने के लिए केवल "गुप्त ट्रिगर शब्दों" को देखने के बजाय, वैचारिक कठोरता (conceptual rigidity) पर भी नज़र रखने की आवश्यकता है। यदि कोई AI अचानक किसी विशिष्ट विषय के आने पर एक जिद्दी, एकतरफा इको चैंबर बन जाता है, तो यह छिपे हुए पूर्वाग्रह या हेरफेर का संकेत हो सकता है।

RAVEN एक प्रारंभिक चेतावनी प्रणाली की तरह है। यह समस्या को ठीक नहीं करता है, बल्कि अलार्म बजाता है ताकि इंसान जाकर उस AI को देख सकें और पूछ सकें, "तुम इस एक चीज़ के बारे में इतना अजीब व्यवहार क्यों कर रहे हो?" यह हमें इन "प्रचार-जैसे" (propaganda-like) व्यवहारों को बहुत अधिक फैलने से पहले पहचानने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →