← नवीनतम पेपर
🤖 AI

Agentic Microphysics: A Manifesto for Generative AI Safety

यह शोध पत्र एजेंटिक एआई सुरक्षा के लिए एक नया ढांचा प्रस्तावित करता है जो ध्यान को अलग-थलग मॉडलों से हटाकर स्थानीय अंतःक्रियाओं के "एजेंटिक माइक्रोफिजिक्स" (agentic microphysics) पर केंद्रित करता है, जिसमें इन सूक्ष्म-स्तरीय गतिकी को जनसंख्या-स्तरीय जोखिमों से जोड़ने और प्रभावी हस्तक्षेपों को डिजाइन करने के लिए एक "जेनरेटिव सेफ्टी" (generative safety) पद्धति का उपयोग किया गया है।

मूल लेखक: Federico Pierucci, Matteo Prandi, Marcantonio Bracale Syrnikov, Marcello Galisai, Piercosma Bisconti

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Federico Pierucci, Matteo Prandi, Marcantonio Bracale Syrnikov, Marcello Galisai, Piercosma Bisconti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों का एक शहर बना रहे हैं। अतीत में, सुरक्षा इंजीनियर केवल इस बात की चिंता करते थे कि क्या प्रत्येक व्यक्तिगत रोबोट "अच्छा" है या "बुरा"। वे पूछते थे: "यदि मैं इस एक रोबोट को कोई आदेश देता हूँ, तो क्या वह किसी को चोट पहुँचाएगा?"

लेकिन दुनिया बदल रही है। जल्द ही, ये रोबोट केवल आदेश नहीं लेंगे; वे एक-दूसरे से बात करेंगे, पिछली बातचीत को याद रखेंगे, उपकरणों का उपयोग करेंगे और टीमों में काम करेंगे। उनके अपने "व्यक्तित्व" और दीर्घकालिक लक्ष्य होंगे।

यह शोध पत्र तर्क देता है कि केवल व्यक्तिगत रोबोटों की जाँच करना अब पर्याप्त नहीं है। भले ही प्रत्येक एकल रोबोट पूरी तरह से अच्छा और सभ्य हो, लेकिन जब वे आपस में बातचीत करना शुरू करते हैं, तो रोबोटों की एक पूरी भीड़ अनजाने में एक आपदा पैदा कर सकती है।

यहाँ इस शोध पत्र का समाधान दिया गया है, जिसे सरल उपमाओं के माध्यम से समझाया गया है।

1. समस्या: "अच्छा रोबोट" विरोधाभास (The "Good Robot" Paradox)

कल्पना कीजिए कि एक कमरा विनम्र, ईमानदार लोगों से भरा है। यदि आप व्यक्तिगत रूप से उनसे पूछें, "क्या आप अपने पड़ोसी से झूठ बोलेंगे?" तो वे सभी कहेंगे, "नहीं।"

लेकिन उन्हें एक विशिष्ट सामाजिक स्थिति में डाल दें—जैसे कि एक खेल जहाँ वे एक गुप्त क्लब बनाकर जीत सकते हैं—तो अचानक, वे वही विनम्र लोग समूह की रक्षा करने के लिए एक-दूसरे से झूठ बोलना शुरू कर सकते हैं। वे एक ऐसी अफवाह फैलाना शुरू कर सकते हैं जो जंगल की आग की तरह फैल जाए, या वे सभी एक खतरनाक आग को अनदेखा करने का निर्णय ले सकते हैं क्योंकि बाकी सभी भी उसे अनदेखा कर रहे हैं।

शोध पत्र इसे एजेंटिक माइक्रोफिजिक्स (Agentic Microphysics) कहता है।

  • उपमा: इसे ट्रैफिक के अध्ययन की तरह समझें। आप एक कार (मॉडल) का अध्ययन कर सकते हैं कि उसके ब्रेक काम करते हैं या नहीं। लेकिन ट्रैफिक जाम, दुर्घटनाएं और ग्रिडलॉक एक टूटी हुई कार के कारण नहीं होते; वे इस कारण होते हैं कि सड़क पर बहुत सारी कारें एक-दूसरे के साथ कैसे परस्पर क्रिया करती हैं।
  • बदलाव: हमें केवल व्यक्तिगत रोबोट के "ब्रेक" को देखना बंद करना होगा और समूह के "ट्रैफिक नियमों" का अध्ययन करना शुरू करना होगा।

2. समाधान: "जेनरेटिव सेफ्टी" (Generative Safety)

लेखक जेनरेटिव सेफ्टी नामक सुरक्षा परीक्षण के एक नए तरीके का प्रस्ताव देते हैं। केवल यह देखने के बजाय कि क्या हो रहा है और बेहतर होने की उम्मीद करने के बजाय, वे समस्याओं को लैब में उगाना (Grow) चाहते हैं ताकि यह समझा जा सके कि वे वास्तव में कैसे होती हैं।

इसे एक बेकर द्वारा केक के परीक्षण की तरह समझें।

  • पुराना तरीका (अवलोकन): आप बेकरी से एक केक खरीदते हैं। वह जला हुआ है। आप कहते हैं, "ओह नहीं, केक खराब है।" आपको पता नहीं चलता कि क्यों वह जला हुआ है। क्या यह ओवन था? आटा? या क्या किसी ने दरवाजा बहुत बार खोला था?
  • नया तरीका (जेनरेटिव सेफ्टी): बेकर कहता है, "आइए एक नियंत्रित रसोई में 1,000 छोटे केक बेक करें।"
    • केक #1: हम बहुत अधिक गर्मी का उपयोग करते हैं।
    • केक #2: हम दरवाजा खुला छोड़ देते हैं।
    • केक #3: हम सामग्री को गलत क्रम में मिलाते हैं।
    • परिणाम: हम पाते हैं कि केवल तभी केक जलता है जब हम दरवाजा खुला छोड़ देते हैं। अब हमें इसे ठीक करने का सटीक नियम पता है।

शोध पत्र में, इसका अर्थ है एक डिजिटल सिमुलेशन बनाना जहाँ शोधकर्ता "खेल के नियमों" (जैसे कि कौन किससे बात करता है, वे क्या देख सकते हैं, और वे चीजों को कैसे याद रखते हैं) में बदलाव कर सकें ताकि यह देख सकें कि वास्तव में क्या रोबोटों को अनियंत्रित बनाता है।

3. प्रयोग: "न्यूज़ फीड" का जाल (The "News Feed" Trap)

अपने बिंदु को सिद्ध करने के लिए, लेखकों ने सोशल मीडिया फीड (जैसे फेसबुक या एक्स/ट्विटर) स्क्रॉल करने वाले लोगों की तरह व्यवहार करने वाले AI एजेंटों के साथ एक विशिष्ट प्रयोग चलाया।

  • सेटअप: उन्होंने AI एजेंटों को 48 समाचार कहानियों की एक सूची दी। वे यह देखना चाहते थे कि क्या रोबोट "झुंड" (herding) बनाएंगे (यानी, क्या वे केवल इसलिए एक ही कहानी पर क्लिक करेंगे क्योंकि अन्य लोग भी कर रहे हैं)।
  • ट्विस्ट: उन्होंने दो चीजों का परीक्षण किया:
    1. सोशल प्रूफ (Social Proof): एक कहानी को कितने "लाइक" मिले।
    2. पोजीशन (Position): सूची में कहानी कहाँ दिखाई देती है (ऊपर बनाम नीचे)।
  • चौंकाने वाली खोज: रोबोटों को "लाइक" से ज्यादा फर्क नहीं पड़ा। उन्होंने लगभग पूरी तरह से पोजीशन पर ध्यान दिया।
    • यदि कोई कहानी सूची में सबसे ऊपर थी, तो रोबोट उस पर क्लिक करते थे, भले ही उस पर शून्य लाइक हों।
    • यदि कोई कहानी सबसे नीचे थी, तो लाखों लाइक होने के बावजूद, रोबोट उसे अनदेखा कर देते थे।

सबक: "झुंड" बनाने वाला व्यवहार लोकप्रियता से प्रभावित होने के कारण नहीं था। यह फीड के डिज़ाइन के कारण था। "सूची का शीर्ष" एक गेटकीपर की तरह काम कर रहा था।

4. यह सुरक्षा के लिए क्यों महत्वपूर्ण है

यह सुरक्षा के लिए एक बहुत बड़ी बात है। इसका मतलब है कि एक बुरा तत्व (एक हैकर या दुर्भावनापूर्ण कंपनी) AI को "बुरा" बनने के लिए धोखा देने की जरूरत नहीं है। उन्हें बस आर्किटेक्चर को हैक करने की आवश्यकता है।

  • हमला: यदि कोई बुरा तत्व "रैंकिंग एल्गोरिदम" को हेरफेर करके खतरनाक या गलत जानकारी को फीड के बिल्कुल शीर्ष पर रख देता है, तो AI एजेंट उन सभी पर क्लिक करेंगे, उन्हें साझा करेंगे और उन्हें प्रसारित करेंगे, जिससे गलत सूचना का एक बड़ा प्रसार (cascade) पैदा होगा।
  • रक्षा: क्योंकि अब हम "माइक्रो-फिजिक्स" (फीड के विशिष्ट नियम) को समझते हैं, हम बेहतर सुरक्षा प्रोटोकॉल डिजाइन कर सकते हैं। हम सिस्टम में ऐसे "गार्डरेल्स" (सुरक्षा घेरे) बना सकते हैं जो यह रोक सकें कि "सूची का शीर्ष" ही एकमात्र महत्वपूर्ण चीज़ न रह जाए।

सारांश: बड़ी तस्वीर

यह शोध पत्र एक घोषणापत्र है जो कहता है: "केवल व्यक्तिगत रोबोट के मस्तिष्क की जाँच करना बंद करें। उस खेल के मैदान की जाँच करें जहाँ वे खेलते हैं।"

  1. पुरानी सुरक्षा: "क्या यह रोबोट अच्छा है?"
  2. नई सुरक्षा: "जब 1,000 अच्छे रोबोट इन विशिष्ट नियमों के तहत एक-दूसरे से बात करते हैं, तो क्या होता है?"
  3. विधि: केवल देखें नहीं; सिमुलेट (Simulate) करें। लैब में समस्या को पैदा करें, उस सटीक नियम को खोजें जो आपदा का कारण बनता है, और फिर उस नियम को बदलकर उसे रोकें।

AI सुरक्षा को मनोविज्ञान (एक एजेंट के मन का अध्ययन करना) के बजाय भौतिकी (Physics) (यह अध्ययन करना कि कैसे छोटी अंतःक्रियाएं बड़े बल बनाती हैं) की तरह मानकर, हम ऐसे सिस्टम बना सकते हैं जो न केवल व्यक्तिगत रूप से, बल्कि सामूहिक रूप से भी सुरक्षित हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →