← नवीनतम पेपर
💻 computer science

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

यह शोधपत्र ValueFlow को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह मात्रात्मक रूप से मापता है कि मल्टी-एजेंट LLM सिस्टम के माध्यम से वैल्यू व्यवधान (value perturbations) कैसे प्रसारित होते हैं, यह मान (value) के विचलन को एजेंट-स्तरीय संवेदनशीलता और सिस्टम-स्तरीय संरचनात्मक प्रभावों में विभाजित करके प्रदर्शित करता है, जिससे यह सिद्ध होता है कि वैल्यू अलाइनमेंट मूल रूप से एक सिस्टम-स्तरीय गुण है जो इंटरेक्शन टोपोलॉजी द्वारा आकार लेता है।

मूल लेखक: Jinnuo Liu, Chuke Liu, Hua Shen

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinnuo Liu, Chuke Liu, Hua Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह एक मेज के चारों ओर बैठा है, और वे यह तय करने की कोशिश कर रहे हैं कि कौन सी फिल्म देखनी है। प्रत्येक मित्र की अपनी व्यक्तिगत पसंद (उनके "मूल्य") होती है। आमतौर पर, वे आपस में चर्चा करते हैं, एक-दूसरे की बात सुनते हैं, और अंततः एक फिल्म पर सहमत होते हैं।

अब, कल्पना कीजिए कि एक मित्र को गुप्त रूप से एक जासूस द्वारा यह कहने के लिए मजबूर किया गया है कि, "हमें ज़रूर एक हॉरर फिल्म देखनी चाहिए!" भले ही वह आमतौर पर उन्हें नापसंद करता हो।

यह पेपर ValueFlow एक सरल लेकिन पेचीदा सवाल पूछता है: उस एक व्यक्ति की अचानक, जबरदस्ती दी गई राय समूह में कैसे फैलती है? क्या पूरा समूह अचानक हॉरर फिल्में पसंद करने लगता है? या वे बस उस एक मित्र को अनदेखा कर देते हैं और अपनी मूल योजना पर टिके रहते हैं?

यहाँ रोजमर्रा के उपमाओं (analogies) का उपयोग करके पेपर के निष्कर्षों का विवरण दिया गया है:

1. समस्या: "विस्परिंग गैलरी" (Whispering Gallery) प्रभाव

अतीत में, वैज्ञानिक यह जांचते थे कि क्या एक अकेला AI "अच्छा" या "बुरा" है, इसके लिए उससे अकेले सवाल पूछते थे। लेकिन आज, AI अक्सर टीमों में उपयोग किए जाते हैं, जो समस्याओं को हल करने के लिए एक-दूसरे से बात करते हैं।

लेखकों ने महसूस किया कि भले ही हर एक AI शुरुआत में अच्छे मूल्यों के साथ शुरू होता है, लेकिन जिस तरह से वे एक-दूसरे से बात करते हैं, वह अनजाने में उनके विचारों को मोड़ सकता है। यह "टेलीफोन" के खेल की तरह है, जहाँ संदेश बदलने के बजाय, समूह के मूल विश्वास कि क्या "सही" या "महत्वपूर्ण" है, सच्चाई से भटक सकते हैं।

2. उपकरण: "ValueFlow" (वैल्यू लीक डिटेक्टर)

शोधकर्ताओं ने ValueFlow नामक एक टूल बनाया है ताकि यह मापा जा सके कि किसी AI के मूल्यों को उसके दोस्तों द्वारा कितनी आसानी से "संक्रमित" किया जा सकता है।

उन्होंने 56 अलग-अलग मानवीय मूल्यों (जैसे "राष्ट्रीय सुरक्षा," "दोस्ती," "स्वतंत्रता," या "धन") के साथ एक परीक्षण बनाया। उन्होंने AI से उनके मूल्यों के बारे में सवाल पूछे, फिर गुप्त रूप से एक "परटर्बेशन" (perturbation) इंजेक्ट किया—मूल रूप से, उन्होंने कुछ नकली AI दोस्तों को बातचीत में चरम विचार चिल्लाने के लिए कहा ताकि यह देखा जा सके कि वास्तविक AI ने कैसे प्रतिक्रिया दी।

3. दो प्रमुख माप

यह पेपर इस "संक्रमण" को दो तरीकों से मापता है, जैसे पाइप में लीक की जांच करना:

  • "कान" का परीक्षण (एजेंट ससेप्टिबिलिटी, या β\beta):
    यह मापता है कि दूसरों को सुनने पर एक विशिष्ट AI कितनी आसानी से अपना मन बदल लेता है।

    • उपमा: कल्पना कीजिए कि एक पार्टी में एक व्यक्ति है। यदि कोई कहता है, "पिज्जा सबसे अच्छा भोजन है," तो क्या वह व्यक्ति तुरंत सहमत हो जाता है?
    • निष्कर्ष: कुछ मूल्य कंक्रीट की दीवारों (बदलने में कठिन) की तरह होते हैं। यदि मूल्य "आत्म-अनुशासन" या "सच्ची दोस्ती" है, तो AI आमतौर पर शोर को अनदेखा कर देता है। लेकिन अन्य मूल्य गीली रेत (आसानी से आकार बदलने योग्य) की तरह हैं। यदि मूल्य "सामाजिक शक्ति" या "प्रभावशाली" है, तो AI केवल इसलिए अपना मन बहुत जल्दी बदल लेता है क्योंकि दूसरे इसके बारे में बात कर रहे हैं।
  • "पाइप" का परीक्षण (सिस्टम ससेप्टिबिलिटी, या $SS$):
    यह मापता है कि बातचीत की संरचना कैसे गलत राय को फैलने में मदद करती है।

    • उपमा: कल्पना कीजिए कि समूह विभिन्न आकारों में व्यवस्थित है।
      • चेन (Chain): A बात करता है B से, B बात करता है C से। यदि A संक्रमित होता है, तो जहर C तक यात्रा करता है।
      • स्टार (Star): हर कोई एक केंद्रीय नेता से बात करता है। यदि नेता संक्रमित होता है, तो हर कोई तुरंत संक्रमित हो जाता है।
      • मेश (Mesh): हर कोई हर किसी से बात करता है।
    • निष्कर्ष: पेपर ने पाया कि गलत राय कहाँ से शुरू होती है, यह बहुत मायने रखता है। यदि एक "केंद्रीय" AI (नेता) को बुरा विचार आता है, तो यह हर जगह फैलता है। यदि एक "परिधीय" AI (किनारे पर रहने वाला व्यक्ति) को बुरा विचार आता है, तो वह अक्सर समाप्त हो जाता है। इसके अलावा, यदि कोई AI एक साथ कई अलग-अलग आवाजों को सुनता है, तो उसे बेवकूफ बनाना कठिन होता है (आवाजें एक-दूसरे को रद्द कर देती हैं)।

4. बड़ा आश्चर्य: यह केवल AI के बारे में नहीं है

सबसे महत्वपूर्ण खोज यह है कि आप इसे केवल व्यक्तिगत AI को स्मार्ट या "अच्छा" बनाकर ठीक नहीं कर सकते।

  • "व्यक्तित्व" कारक: कुछ AI मॉडल (जैसे इस अध्ययन में Google या Meta द्वारा बनाए गए) स्वाभाविक रूप से अधिक जिद्दी होते हैं और दूसरों की तुलना में अपना मन बदलने की कम संभावना रखते है (जैसे Alibaba द्वारा बनाया गया मॉडल)।
  • "विषय" कारक: कुछ विषय स्वाभाविक रूप से अधिक नाजुक होते हैं। AI "पारिवारिक सुरक्षा" के बारे में बहुत जिद्दी हैं लेकिन "सार्वजनिक छवि" के बारे में बहुत आसानी से बहक जाते हैं।
  • "कमरे का लेआउट" कारक: भले ही आपके पास दुनिया का सबसे जिद्दी AI हो, यदि आप उसे एक "स्टार" नेटवर्क में रखते हैं जहाँ वह एक एकल, मुखर, पक्षपाती नेता को सुनता है, तो वह भी संक्रमित हो जाएगा।

5. समाधान: कमरे को डिजाइन करें, न कि केवल लोगों को

पेपर निष्कर्ष निकालता है कि AI सिस्टम को सुरक्षित रखने के लिए, हम केवल यह जांचकर काम नहीं चला सकते कि व्यक्तिगत रोबोट "अच्छे" हैं या नहीं। हमें सिस्टम को सावधानीपूर्वक डिजाइन करना होगा।

  • सबसे अधिक सुझाव देने योग्य (suggestible) AI को प्रभारी न बनाएं।
  • एक केंद्रीय रोबोट को सभी से बात करने न दें।
  • जानें कि कौन से विषय "लीकी" (leaky) हैं और उन बातचीतों की बारीकी से निगरानी करें।

संक्षेप में: ValueFlow दिखाता है कि AI एजेंटों की एक टीम में, व्यक्तिगत सदस्यों की तुलना में समूह की गतिशीलता (group dynamic) अधिक महत्वपूर्ण है। यदि कमरे की व्यवस्था गलत तरीके से की गई है, तो एक बुरा विचार जंगल की आग की तरह फैल सकता है, भले ही सभी की शुरुआत अच्छी नियत से हुई हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →