← नवीनतम पेपर
💬 NLP

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

यह शोध पत्र आंशिक रूप से दृश्यमान संयुक्त निर्णय लेने वाले कार्यों में विचारशील (deliberative) LLM एजेंटों के लिए एक स्केलेबल बेंचमार्क और मूल्यांकन ढांचा प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि वर्तमान मॉडल जटिल संरेखण और तर्क करने में संघर्ष करते हैं, विचार प्रक्रिया स्वयं आत्मचिंतन और त्रुटि सुधार के अवसर प्रदान कर सकती है जो कभी-कभी केंद्रीकृत बेसलाइन से बेहतर प्रदर्शन करती है।

मूल लेखक: Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप और आपका एक दोस्त मिलकर एक बेहतरीन डिनर पार्टी की योजना बना रहे हैं, लेकिन आप दोनों दो अलग-अलग कमरों में हैं और सब कुछ देख नहीं सकते।

  • आप पेंट्री (आपके पास क्या सामग्री है) देख सकते हैं, लेकिन आप गेस्ट लिस्ट (कौन आ रहा है और उन्हें क्या पसंद है) नहीं देख सकते।
  • आपका दोस्त गेस्ट लिस्ट (एलर्जी और पसंदीदा भोजन सहित) देख सकता है, लेकिन वह पेंट्री नहीं देख सकता।

एक अच्छा मेनू बनाने के लिए, आप दोनों को आपस में बात करनी होगी, अपनी जानकारी साझा करनी होगी और व्यंजनों की एक अंतिम सूची पर सहमत होना होगा। यदि आप सामग्री के बारे में गलत अनुमान लगाते हैं या किसी एलर्जी के बारे में भूल जाते हैं, तो पार्टी आपदा बन जाएगी।

यह शोध पत्र AI रोबोट्स (विशेष रूप से लार्ज लैंग्वेज मॉडल्स) को ठीक इसी तरह की टीमवर्क करने के लिए सिखाने के बारे में है। शोधकर्ता इसे "डेलिब्रेटिव कोलैबोरेशन" (Deliberative Collaboration) कहते हैं।

यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. सेटअप: द "ब्लाइंडफोल्डेड पज़ल" (आंखों पर पट्टी बांधकर सुलझाने वाली पहेली)

शोधकर्ताओं ने एक परीक्षण खेल (एक बेंचमार्क) बनाया जहाँ AI एजेंटों को मिलकर समस्याओं को हल करना होता है, लेकिन प्रत्येक एजेंट केवल पहेली का एक हिस्सा देख पाता है।

  • खेल: उन्होंने ऐसी स्थितियाँ बनाईं जैसे मेनू डिजाइन करना (जहाँ एक एजेंट के पास भोजन की जानकारी है, दूसरे के पास मेहमानों की) या एक टीम को कार्य सौंपना (जहाँ एक के पास बजट है, दूसरे के पास श्रमिकों के कौशल हैं)।
  • नियम: एजेंटों को आपस में बात करनी होगी, अपनी "आंशिक" जानकारी का आदान-प्रदान करना होगा और एक एकल अंतिम निर्णय पर सहमत होना होगा। यदि वे कोई गलती करते हैं (जैसे झींगे (shrimp) से एलर्जी वाले व्यक्ति के लिए झींगे का व्यंजन मंगवाना), तो उन्हें कम स्कोर मिलता है।

2. प्रयोग: स्मार्ट रोबोट बनाम साधारण रोबोट

उन्होंने कई अलग-अलग AI मॉडल का परीक्षण किया, बहुत शक्तिशाली "सुपर-ब्रेन" से लेकर छोटे और सस्ते मॉडल्स तक। उन्होंने देखा कि ये रोबोट कितने अच्छे थे:

  • जानकारी साझा करने में: क्या उन्होंने अपने साथी को बताया जो उन्होंने देखा?
  • सुनने में: क्या वे अपने साथी की बात समझ पाए?
  • गणना करने में: क्या उन्होंने गणित सही किया ताकि योजना काम कर सके?

उन्होंने कुछ रोबोट्स को गणित में मदद के लिए एक "कैलकुलेटर" टूल भी दिया, यह देखने के लिए कि क्या इससे उनकी गलतियाँ ठीक होती हैं।

3. बड़े आश्चर्य (परिणाम)

आश्चर्य #1: सबसे बुद्धिमान रोबोट भी संघर्ष करते हैं
यहाँ तक कि सबसे उन्नत AI मॉडल्स को भी कठिनाई हुई। कभी-कभी वे सही जानकारी साझा करने में विफल रहे, या अपनी जानकारी को मिलाने की कोशिश करते समय भ्रमित हो गए।

  • उपमा: यह दो दिग्गजों के एक कमरे में होने जैसा है जो आपस में बात करने में इतने व्यस्त हैं कि वे खाना पकाने से पहले सामग्री की जांच करना ही भूल जाते हैं।

आश्चर्य #2: "कैलकुलेटर" हमेशा मदद नहीं करता
आप सोच सकते हैं कि रोबोट को कैलकुलेटर देने से वे परफेक्ट हो जाएंगे। लेकिन कभी-कभी, इसने चीजों को और खराब कर दिया!

  • "संशय का जाल" (The Skepticism Trap): कुछ मामलों में, कैलकुलेटर ने कुल जानकारी के आधार पर एक सटीक समाधान दिया। लेकिन क्योंकि रोबोट केवल एक आंशिक दृश्य देख पा रहा था, उसने कैलकुलेटर के उत्तर को देखा और सोचा, "रुको, इसमें मेरी सामग्री से अधिक चीजों की जरूरत है! यह गलत होगा!" इसलिए, रोबोट ने सटीक उत्तर को खारिज कर दिया और गणित को खुद हल करने की कोशिश की, जिसमें वह अक्सर विफल रहा।
  • उपमा: कल्पना कीजिए कि एक GPS आपको सबसे तेज़ रास्ता बता रहा है, लेकिन आप केवल अपनी गली का नक्शा देख पा रहे हैं। आप सोचते हैं कि GPS झूठ बोल रहा है क्योंकि रास्ता उस पड़ोस से होकर जाता है जिसे आप देख नहीं पा रहे हैं, इसलिए आप GPS को अनदेखा कर देते हैं और रास्ता भटक जाते हैं।

आश्चर्य #3: बात करना वास्तव में अच्छा है (कभी-कभी)
यह सबसे दिलचस्प हिस्सा है। शोधकर्ताओं ने रोबोट्स के आपस में बात करने (डेलिब्रेशन) बनाम एक रोबोट द्वारा सब कुछ एक साथ देखने (सेंट्रलाइज्ड) की तुलना की।

  • आमतौर पर, वह रोबोट जीतता है जो सब कुछ देख सकता है।
  • लेकिन, कुछ पेचीदा मामलों में, वह रोबोट जिसने सब कुछ देखा था, गलती कर बैठा और उसे सुधार नहीं पाया। हालाँकि, जो रोबोट आपस में बात कर रहे थे, वे एक-दूसरे को दोबारा चेक (double-check) कर सके। एक कहेगा, "रुको, मुझे लगता है कि यह एक नियम का उल्लंघन करता है," और दूसरा कहेगा, "ओह, तुम सही हो, चलो इसे बदलते हैं।"
  • उपमा: एक कार चलाने वाला व्यक्ति स्टॉप साइन (रुकने का संकेत) मिस कर सकता है। लेकिन कार में बैठे दो लोग कह सकते हैं, "हे, ध्यान से देखो!" और दुर्घटना होने से पहले ड्राइवर को सही कर सकते हैं। "बात करने" की प्रक्रिया ने त्रुटियों के लिए एक सुरक्षा जाल (safety net) के रूप में काम किया।

4. निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हालांकि AI बेहतर हो रहा है, लेकिन जब सभी के पास केवल आंशिक जानकारी होती है, तो वे मिलकर काम करने में अभी भी परफेक्ट नहीं हैं।

  • वे सरल कार्यों में अच्छे हैं।
  • वे जटिल गणित और गहरी तर्कशक्ति (reasoning) में संघर्ष करते हैं जब उन्हें समझने के लिए "बात" करनी पड़ती है।
  • हालाँकि, बहस करने और बात करने की प्रक्रिया केवल समय की बर्बादी नहीं है; वास्तव में यह AI को अपनी गलतियों को पकड़ने में मदद करती है, जो कि एक एकल "सर्वज्ञ" AI भी मिस कर सकता है।

संक्षेप में: यह शोध पत्र दिखाता है कि AI को "बातचीत करके सुलझाना" सिखाना कठिन है, लेकिन जब वे इसे सही ढंग से करते हैं, तो वे एक एकल AI से अधिक स्मार्ट हो सकते हैं जिसके पास सब कुछ जानने की क्षमता है लेकिन उसके पास दूसरा विचार (second opinion) नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →