← नवीनतम पेपर
🤖 AI

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

यह शोधपत्र DecisionBench को प्रस्तुत करता है, जो विविध मॉडलों और कार्यों में दीर्घ-क्षितिज (long-horizon) एजेंटिक वर्कफ़्लो के उभरते हुए डेलीगेशन (delegation) के मूल्यांकन के लिए एक व्यापक बेंचमार्क सबस्ट्रेट है, जो यह प्रकट करता है कि जबकि जागरूकता स्थितियों (awareness conditions) में कार्य की गुणवत्ता स्थिर रहती है, रूटिंग फिडेलिटी (routing fidelity) और समग्र ऑर्केस्ट्रेशन प्रदर्शन को सुधारने के लिए महत्वपूर्ण अप्राप्त क्षमता मौजूद है।

मूल लेखक: Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रसोई के प्रबंधक (मैनेजर) हैं। आपको एक जटिल ऑर्डर पूरा करना है जिसके लिए काटने, ग्रिल करने, बेक करने और प्लेटिंग करने की आवश्यकता है। आप यह सब खुद करने की कोशिश कर सकते हैं, लेकिन आप थके हुए हैं, और शायद आप बेकिंग में उतने अच्छे नहीं हैं।

DecisionBench एक नया "किचन सिम्युलेटर" है जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि एक प्रबंधक (एक AI एजेंट) काम के कुछ हिस्सों को अन्य शेफों (अन्य AI मॉडल्स) को सौंपने (delegate करने) का निर्णय कितनी अच्छी तरह लेता है, बजाय इसके कि वह सब कुछ अकेले करे।

यहाँ इस शोध पत्र का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. समस्या: "सब कुछ खुद करने वाला" जाल (The "Do-It-All" Trap)

अतीत में, हमने केवल यह परीक्षण किया कि क्या एक अकेला शेफ भोजन बना सकता है। लेकिन वास्तविक दुनिया में, AI एजेंटों को लंबे, जटिल कार्य करने होते हैं जिनमें घंटों लगते हैं। कभी-कभी, एक छोटा, सस्ता या अधिक विशिष्ट शेफ किसी विशिष्ट चरण (जैसे सब्जियां काटना) को मुख्य शेफ की तुलना में तेज़ी से और बेहतर तरीके से कर सकता है।

बड़ा सवाल यह है: क्या मुख्य शेफ को पता चलता है कि मदद कब मांगनी है, और क्या वे सही व्यक्ति से मदद मांगते हैं?

2. सेटअप: "DecisionBench" रसोई

लेखकों ने इसे परीक्षण करने के लिए एक नियंत्रित रसोई बनाई। उन्होंने केवल शेफ को खाना बनाते हुए नहीं देखा; उन्होंने एक विशिष्ट नियम पुस्तिका भी तैयार की:

  • कार्य (The Tasks): उन्होंने कठिन कार्यों के तीन मौजूदा "मेन्यू" (GAIA, τ-bench, BFCL) का उपयोग किया जिनमें चरणों की एक लंबी श्रृंखला की आवश्यकता होती है।
  • शेफ (The Chefs): उन्होंने मदद के लिए उपलब्ध "पियर्स" (peers) के रूप में 7 अलग-अलग कंपनियों (जैसे OpenAI, Anthropic, Google) के 11 अलग-अलग AI मॉडल्स को चुना।
  • टूल्स (The Tools): मुख्य शेफ के पास दो विशेष टूल्स हैं:
    1. call_model: एक बटन जो किसी अन्य शेफ को एक उप-कार्य (sub-task) सौंपने के लिए है।
    2. read_profile: एक मेनू जो मुख्य शेफ को बताता है कि अन्य शेफ किन चीजों में अच्छे हैं (जैसे, "शेफ A गणित में अच्छा है लेकिन लंबे टेक्स्ट में बुरा है")।

3. प्रयोग: हमें कितनी जानकारी की आवश्यकता है?

शोधकर्ताओं ने यह देखना चाहा कि विभिन्न स्तरों की जानकारी के तहत मुख्य शेफ कैसा प्रदर्शन करता है। उन्होंने पांच परिदृश्यों का परीक्षण किया:

  • ब्लाइंड (Blind): शेफ के पास मदद के लिए बुलाने का बटन तो है, लेकिन उसे यह पता नहीं है कि कौन किसमें अच्छा है। वे बस अनुमान लगाते हैं।
  • अवेयर - प्रीलोडेड (Aware - Preloaded): शेफ को शिफ्ट शुरू होने से पहले प्रत्येक अन्य शेफ की खूबियों और कमियों का वर्णन करने वाला एक "चीट शीट" (प्रोफाइल कार्ड) दिया जाता है।
  • अवेयर - ऑन-डिमांड (Aware - On-Demand): शेफ के पास कोई चीट शीट नहीं होती, लेकिन वे कार्य के दौरान जब भी उन्हें आवश्यकता हो, किसी विशिष्ट शेफ का प्रोफाइल मांग सकते हैं
  • विविधताएं (The Variations): उन्होंने अलग-अलग प्रकार के चीट शीट्स का परीक्षण किया: एक मानव विशेषज्ञ द्वारा लिखा गया, एक कठिन गणित/सांख्यिकी द्वारा उत्पन्न, और एक दो अन्य AI जजों द्वारा लिखा गया।

4. बड़े आश्चर्य (निष्कर्ष)

आश्चर्य #1: अधिक जानने का मतलब यह नहीं है कि भोजन अनिवार्य रूप से स्वादिष्ट होगा।
भले ही मुख्य शेफ के पास सभी के सटीक प्रोफाइल थे, लेकिन अंतिम गुणवत्ता (कार्य की सफलता दर) लगभग वैसी ही थी जैसी "ब्लाइंड" स्थिति में थी।

  • उपमा: यह शहर का एक विस्तृत नक्शा होने जैसा है लेकिन फिर भी ट्रैफिक में फंस जाना। अतिरिक्त जानकारी ने यात्रा को अपने आप तेज़ या मंजिल को बेहतर नहीं बनाया।

आश्चर्य #2: जानकारी कैसे प्राप्त होती है, यह जानकारी से अधिक महत्वपूर्ण है।
यह सबसे बड़ी खोज थी।

  • "चीट शीट" (Preloaded) विफल रही: जब शेफ को काम शुरू करने से पहले प्रोफाइल्स की एक लंबी सूची पढ़ने के लिए मजबूर किया गया, तो उन्होंने जानकारी का सही उपयोग नहीं किया। उनके द्वारा किए गए डेलीगेशन के निर्णय वास्तव में "ब्लाइंड" स्थिति की तुलना में बदतर थे।
  • "ऑन-डिमांड" टूल काम कर गया: जब शेफ किसी विशिष्ट चरण पर अटकने पर किसी विशिष्ट शेफ का प्रोफाइल मांग सकते थे, तो उन्होंने मदद के लिए किसे बुलाना है, इसके बारे में दोगुने सही निर्णय लिए।
  • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। यदि आप उन्हें परीक्षा से पहले 50 पन्नों की पाठ्यपुस्तक थमा देते हैं, तो वे अभिभूत हो सकते हैं और मुख्य तथ्यों को भूल सकते हैं। लेकिन यदि उन्हें किसी प्रश्न पर अटकने पर केवल एक विशिष्ट तथ्य खोजने की अनुमति दी जाती है, तो वे समस्या को बहुत बेहतर तरीके से हल करते हैं। वितरण का तरीका (डिलीवरी मेथड) (ज़रूरत पड़ने पर पूछना) नायक था, न कि किताब की सामग्री।

आश्चर्य #3: हम बहुत सारी क्षमता को हाथ से जाने दे रहे हैं।
शोधकर्ताओं ने एक "परफेक्ट सीलिंग" (Perfect Ceiling) की गणना की। यह वह स्कोर है जो शेफ को तब मिलता यदि उसे जादुई रूप से पता होता कि हर चरण के लिए कौन सा सहायक सबसे अच्छा है और वह तुरंत उन्हें बुला लेता।

  • परिणाम: वर्तमान सर्वोत्तम तरीके अभी भी इस परफेक्ट सीलिंग से 15% से 31% खराब हैं।
  • उपमा: हम वर्तमान में 60 मील प्रति घंटे की गति से कार चला रहे हैं, लेकिन इंजन 100 मील प्रति घंटे की क्षमता रखता है। हमारे पास भविष्य में डेलीगेशन के तरीके को सुधारने के लिए बहुत बड़ी "अनरियलाइज्ड हेडरूम" (unrealized headroom) मौजूद है।

आश्चर्य #4: शेफ अपने ब्रांड को पसंद करते हैं।
मुख्य शेफ उन शेफों को बुलाने की प्रवृत्ति रखते थे जो उसी कंपनी के बने थे, भले ही किसी दूसरी कंपनी का शेफ उस काम के लिए अधिक उपयुक्त हो।

  • उपमा: यह फोर्ड फैक्ट्री के मैनेजर द्वारा केवल अन्य फोर्ड मैकेनिकों को बुलाने जैसा है, भले ही उस विशिष्ट मरम्मत के लिए टोयोटा का मैकेनिक शहर में सबसे अच्छा हो। यह "ब्रांड बायस" (brand bias) डेटा में एक स्पष्ट पैटर्न था।

5. निष्कर्ष

लेखक निष्कर्ष निकालते हैं कि DecisionBench एक नया, आवश्यक उपकरण है जो यह मापने के लिए है कि AI एजेंट टीमों का प्रबंधन कितनी अच्छी तरह करते हैं।

भविष्य के लिए मुख्य सबक यह है: AI पर शुरुआत में बहुत सारी जानकारी मत थोपिए। इसके बजाय, उन्हें ठीक उसी समय जानकारी खोजने के उपकरण दें जब उन्हें उसकी आवश्यकता हो। यदि हम जानकारी देने के तरीके को ठीक कर देते हैं, तो हम उस विशाल क्षमता (15-31% का अंतर) को अनलॉक कर सकते हैं जो वर्तमान में अप्रयुक्त पड़ी है।

लेखकों ने अपने सभी "किचन रेसिपी", "शेफ" और "स्कोरकार्ड" जारी कर दिए हैं ताकि अन्य शोधकर्ता टीमों को प्रबंधित करने के अपने नए तरीकों का परीक्षण कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →