← नवीनतम पेपर
🤖 AI

CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs

CalBench मल्टी-एजेंट LLMs के लिए एक नियंत्रित मूल्यांकन वातावरण है जो समन्वय गुणवत्ता, संचार दक्षता, निष्पक्षता और गोपनीयता रिसाव को इष्टतम और बेसलाइन समाधानों के विरुद्ध सटीक रूप से मापने के लिए निजी जानकारी के साथ एक विकेंद्रीकृत कैलेंडर शेड्यूलिंग कार्य का उपयोग करता है।

मूल लेखक: Chelsea Zou, Yiheng Yao, Selena She, Robert D. Hawkins

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chelsea Zou, Yiheng Yao, Selena She, Robert D. Hawkins

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप पाँच दोस्तों के साथ एक ग्रुप डिनर आयोजित करने की कोशिश कर रहे हैं। समस्या यह है कि कोई भी दूसरों को ठीक से नहीं बताना चाहता कि वे मंगलवार की रात को क्या कर रहे हैं। शायद कोई अपना गुप्त मेडिकल अपॉइंटमेंट छिपा रहा है, कोई सरप्राइज पार्टी छिपा रहा है, और तीसरा अपने बॉस के साथ एक कठिन बातचीत से बच रहा है।

वास्तविक दुनिया में, आप सभी आपस में मैसेज करेंगे: "मैं 7 बजे फ्री हूँ," "मैं 7 बजे नहीं आ सकता, मुझे बच्चे को पिक करना है," "8 बजे कैसा रहेगा?" आप एक ऐसा समय खोजने की कोशिश करते हैं जो सभी के लिए सही हो, बिना अपने गहरे राज खोले।

CalBench एक डिजिटल प्लेग्राउंड है जिसे स्टैनफोर्ड के शोधकर्ताओं द्वारा बनाया गया है ताकि यह परीक्षण किया जा सके कि AI एजेंट (कंप्यूटर प्रोग्राम जो इंसानों की तरह व्यवहार करते हैं) इस तरह की जटिल स्थिति को कितनी अच्छी तरह संभाल सकते हैं।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. खेल: एक गुप्त ग्रुप चैट

शोधकर्ताओं ने N एजेंटों (मान लीजिए 5 AI असिस्टेंट) के साथ एक खेल सेट किया है। प्रत्येक एजेंट के पास एक निजी कैलेंडर है जिसमें शामिल है:

  • खाली समय (Free time): उपलब्ध स्लॉट्स।
  • काम (Errands): पहले से तय प्रतिबद्धताएं (जैसे "डेंटिस्ट" या "जिम")।
  • रहस्य (Secrets): प्रत्येक काम का एक छिपा हुआ "स्वाद" या संदर्भ होता है (जैसे "दिवालियापन की फाइलिंग" बनाम "किराना खरीदना")।

लक्ष्य समूह के लिए M नई मीटिंग्स शेड्यूल करना है। सफल होने के लिए, एजेंटों को एक ऐसा समय स्लॉट तय करना होगा जो सभी के लिए सही हो।

चुनौती:

  • गोपनीयता (Privacy): एजेंट A, एजेंट B का कैलेंडर नहीं देख सकता। वे केवल अपना जानते हैं।
  • बातचीत (Negotiation): उन्हें एक-दूसरे से बात करनी होगी ताकि एक सही समय मिल सके।
  • जाल (The Trap): यदि एजेंट A कहता है, "मैं मंगलवार को नहीं आ सकता क्योंकि मेरी एक मीटिंग है," तो वह अनजाने में यह भी बता सकता है कि वह मीटिंग क्या है। यह खेल यह परखता है कि क्या वे यह कह पाते हैं कि "मैं व्यस्त हूँ" बिना यह बताए कि "मैं अपने वकील से मिलने जा रहा हूँ।"

2. "ओरेकल" (परफेक्ट समाधान)

यह जानने के लिए कि AI कितना अच्छा काम कर रहा है, शोधकर्ताओं के पास एक "गॉड मोड" चीट शीट है जिसे ओरेकल (Oracle) कहा जाता है।

  • ओरेकल एक साथ सभी के कैलेंडर देख सकता है। उसे वह परफेक्ट टाइम स्लॉट पता है जो सभी के लिए कम से कम परेशानी पैदा करे।
  • AI एजेंटों की तुलना इस परफेक्ट समाधान से की जाती है। क्या उन्होंने ऐसा समय खोजा जो सभी के लिए काम करे? क्या उन्होंने अनावश्यक अफरा-तफरी मचा दी (जैसे किसी को अपना सबसे महत्वपूर्ण कार्यक्रम रद्द करने के लिए मजबूर करना)?

3. तीन बड़ी चुनौतियाँ

पेपर तीन विशिष्ट कौशलों का परीक्षण करता है, जिन्हें समझाने के लिए रूपकों का उपयोग किया गया है:

A. "ग्रुप हग" (समन्वय - Coordination)

क्या एजेंट वास्तव में किसी समय पर सहमत हो पाते हैं?

  • विफलता का तरीका: कभी-कभी एजेंट सोचते हैं कि वे मंगलवार शाम 5 बजे के लिए सहमत हुए हैं, लेकिन एजेंट A ने इसे मंगलवार शाम 6 बजे के लिए लिख दिया था। अंत में एक "घोस्ट मीटिंग" (ghost meeting) हो जाती है जिसमें कोई नहीं आता।
  • परिणाम: कुछ मॉडल्स (जैसे Gemini 3.1 Pro) इसमें बहुत अच्छे थे, वे 100% समय सबको सहमत करने में सफल रहे। अन्य संघर्ष करते रहे और मीटिंग्स अधूरी रह गईं।

B. "लागत" (दक्षता बनाम निष्पक्षता - Efficiency vs. Fairness)

कल्पना कीजिए कि किसी मीटिंग को शाम 5 बजे से बदलकर 6 बजे करना।

  • कम लागत (Low Cost): "किराना खरीदने" जैसे काम को बदलना आसान है।
  • उच्च लागत (High Cost): "कोर्ट की सुनवाई" को बदलना एक आपदा है।
  • परीक्षण: क्या AI ऐसा समय ढूंढ सकता है जो समूह के लिए कुल दर्द (total pain) को कम करे?
  • आश्चर्य: कुछ AI इसमें बहुत खराब थे। वे एक ऐसा समय ढूंढ लेते थे जो काम तो करता था, लेकिन उसने एक व्यक्ति को उसके सबसे महत्वपूर्ण कार्यक्रम को रद्द करने के लिए मजबूर कर दिया जबकि बाकी सब कुछ नहीं कर रहे थे। इसे निष्पक्षता (Fairness) की विफलता कहा जाता है। सबसे अच्छे मॉडल्स ने एक संतुलन पाया जहाँ "दर्द" समान रूप से साझा किया गया।

C. "जिज्ञासु पड़ोसी" (गोपनीयता - Privacy)

यह इस अध्ययन का सबसे अनूठा हिस्सा है। शोधकर्ताओं ने ग्रुप चैट में एक "जिज्ञासु एजेंट" (Nosy Agent) यानी एक जासूस पेश किया।

  • जासूस ऐसे सवाल पूछता है जैसे, "ओह, आप मंगलवार को नहीं आ सकते? क्यों? क्या यह कुछ संवेदनशील है?"
  • परीक्षण यह है: क्या अन्य एजेंट अपने रहस्य बताने के चक्कर में फिसल जाएंगे?
  • परिणाम: जब उन्हें अपने रहस्य साझा न करने के लिए कहा गया, तब भी कुछ AI दबाव में आ गए।
    • उदाहरण: एक एजेंट से पूछा गया कि वह स्लॉट क्यों नहीं बदल सकता। "मेरा संघर्ष है" कहने के बजाय, उसने कहा, "मेरी अपने वकील के साथ दिवालियापन की फाइलिंग की तैयारी है।"
    • अध्ययन में पाया गया कि जब मीटिंग बदलने की "लागत" अधिक थी (यानी वह एक बड़ा मामला था), तो एजेंट यह समझाने के लिए कि यह इतना कठिन क्यों है, अपने राज उगलने के प्रति अधिक प्रवृत्त थे।

4. "बातचीत" बनाम "कार्रवाई" का निष्कर्ष

शोधकर्ताओं ने AI की बातचीत के बारे में कुछ दिलचस्प देखा:

  • अधिक बात करने का मतलब बेहतर परिणाम नहीं है। कुछ मॉडल्स ने सैकड़ों संदेश भेजे लेकिन फिर भी एक अच्छा समय खोजने में विफल रहे।
  • सटीकता मायने रखती है। सबसे अच्छे मॉडल्स केवल यह नहीं कहते थे कि "यह कठिन है।" वे कहते थे, "यह कठिन है क्योंकि इसे बदलने में 100 अंक का खर्च आता है।"
  • उपमा: कल्पना कीजिए कि आप बिल बांट रहे हैं।
    • खराब AI: "मैं ज्यादा नहीं देना चाहता, यह बहुत कठिन है।" (अस्पष्ट, अनुपयोगी)।
    • अच्छा AI: "मैं 5देसकताहूँ,लेकिनअगरमैं5 दे सकता हूँ, लेकिन अगर मैं 10 दूँगा, तो मैं कंगाल हो जाऊँगा।" (सटीक, जो एक निष्पक्ष समाधान की अनुमति देता है)।

5. निचोड़ (Bottom Line)

CalBench यह साबित करता है कि एक टीम में काम करने के लिए AI को केवल स्मार्ट होना ही नहीं चाहिए, बल्कि उसे डिप्लोमैटिक (कूटनीतिक) भी होना चाहिए।

  • उसे यह पता होना चाहिए कि क्या साझा करना है (उपलब्धता) और क्या छिपाना है (गुप्त कारण)।
  • उसे यह समझना होगा कि "समस्या को हल करना" केवल कोई भी समय स्लॉट ढूंढना नहीं है; बल्कि वह समय ढूंढना है जिससे कम से कम नुकसान हो और सभी के साथ निष्पक्ष व्यवहार हो।

पेपर निष्कर्ष निकालता है कि हालांकि AI योजना बनाने में बेहतर हो रहा है, फिर भी वह गोपनीयता (राज रखने) और दक्षता (काम पूरा करने) के बीच संतुलन बनाने में संघर्ष करता है। निर्णय को समझाने का दबाव जितना अधिक होता है, AI द्वारा गलती से कोई राज लीक करने की संभावना उतनी ही अधिक होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →