← नवीनतम पेपर
🤖 AI

ForestBench: A Unified Graph Framework for Evaluating Multi-Agent Collaboration

ForestBench एक एकीकृत ग्राफ-आधारित मूल्यांकन ढांचे को प्रस्तुत करता है जो विविध मल्टी-एजेंट सिस्टम ट्रेसेस को एक साझा प्रतिनिधित्व स्थान (shared representation space) में मैप करता है, जिससे पूर्व-निर्धारित सत्यापित-सफल निष्पादन पथों के जंगलों (forests) के विरुद्ध तुलना करके सहयोग की गुणवत्ता का तीव्र, मॉडल-अज्ञेय (model-agnostic) मूल्यांकन सक्षम होता है।

मूल लेखक: Guo Chen, Ziwen Li, Reed Li, Yu Lu, Haibo Shi, Bingbing Xu, Junjie Huang

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guo Chen, Ziwen Li, Reed Li, Yu Lu, Haibo Shi, Bingbing Xu, Junjie Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ डिजिटल सहायकों की टीमें, जिन्हें 'लार्ज लैंग्वेज मॉडल्स' (LLMs) जैसे विशाल मस्तिष्क वाले कंप्यूटरों द्वारा संचालित किया जाता है, जटिल पहेलियों को हल करने के लिए काम पर रखी जाती हैं। ये टीमें, जिन्हें मल्टी-एजेंट सिस्टम (MAS) कहा जाता है, मिलकर काम करने वाले दोस्तों के एक समूह की तरह हैं: एक रास्ता तय करता है, दूसरा कार चलाता है, तीसरा नक्शा देखता है, और चौथा मदद के लिए पुकारता है यदि वे रास्ता भटक जाते हैं। बड़ा वादा यह है कि काम को बांटकर और एक-दूसरे से बात करके, वे उन समस्याओं को हल कर सकते हैं जिन्हें एक अकेला व्यक्ति (या एक अकेला कंप्यूटर) अकेले नहीं संभाल सकता। लेकिन यहाँ एक पेच है: अभी, हमें केवल उनके सफल होने का पता तभी चलता है जब हम अंतिम उत्तर देखते हैं, जैसे कि यह देखना कि गणित के सवाल का सही नंबर आया या नहीं। हमें वास्तव में यह नहीं पता कि उन्होंने एक साथ मिलकर कैसे काम किया। क्या वे आपस में बहस कर रहे थे? क्या उन्होंने एक-दूसरे को अनदेखा किया? क्या उन्होंने एक ही चीज़ को बार-बार दोहराकर समय बर्बाद किया? यह एक बास्केटबॉल खेल को केवल अंतिम स्कोर देखकर आंकने जैसा है, यह भूलकर कि टीम ने वास्तव में गेंद पास की थी या सिर्फ एक खिलाड़ी ही पूरे समय दौड़ता रहा।

यहीं पर एक नया विचार आता है जिसे ForestBench कहा जाता है। इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने महसूस किया कि इन डिजिटल टीमों को वास्तव में समझने के लिए, हमें केवल अंतिम परिणाम देखना बंद करना होगा और उनके सहयोग के "नृत्य" (डांस) को देखना शुरू करना होगा। उन्होंने एक विशेष उपकरण बनाया जो इन टीमों के अलग-अलग और अव्यवस्थित तरीकों को एक स्पष्ट चित्र में बदल देता है—कनेक्शन का एक मानचित्र। यह पूछने के बजाय कि, "क्या वे सही थे?", ForestBench पूछता है, "वे एक साथ कैसे काम करते हैं, और क्या उनकी टीम वर्क अन्य सफल टीमों की तरह दिखती है?" यह एक नए टीम के प्रदर्शन की तुलना करने के लिए 'परफेक्ट डांस रूटीन' (पेड़ों का एक "जंगल") की लाइब्रेरी रखने जैसा है, बजाय इसके कि केवल अंतिम मुद्रा के आधार पर "अच्छा काम किया" या "बुरा काम किया" कहा जाए।

समस्या: "अंतिम उत्तर" का जाल

लंबे समय से, वैज्ञानिक इन AI टीमों का परीक्षण मानक परीक्षणों का उपयोग करके कर रहे हैं, जैसे गणित की क्विज़ या कोडिंग चुनौतियाँ। लेकिन इन परीक्षणों में एक अंधा कोना (ब्लाइंड स्पॉट) है। उन्हें केवल इस बात से मतलब है कि अंतिम उत्तर सही है या नहीं। यदि दो टीमें एक ही सही उत्तर देती हैं, तो परीक्षण उन्हें समान मानता है। लेकिन क्या होगा यदि एक टीम घंटों बहस करती रही और बहुत अधिक ऊर्जा बर्बाद की, जबकि दूसरी टीम पूर्ण सामंजस्य में काम करती रही? पुराने परीक्षण अंतर नहीं बता सकते। वे सहयोग के दिलचस्प विवरणों को फेंक देते हैं।

कुछ लोगों ने एक अन्य AI का उपयोग करके इसे ठीक करने की कोशिश की, जो चैट लॉग्स को पढ़ता है और यह तय करता है कि टीम वर्क कैसा था, लेकिन यह महंगा, धीमा है और इस बात पर निर्भर करता है कि कौन सा AI निर्णय ले रहा है। यह हर खेल को देखने के लिए एक अलग रेफरी को बुलाने जैसा है; कभी-कभी वे खेलने की एक विशिष्ट शैली को पसंद कर सकते हैं, और कभी-कभी वे किसी और को पसंद कर सकते हैं, जिससे टीमों की निष्पक्ष तुलना करना कठिन हो जाता है।

समाधान: अराजकता को एक मानचित्र में बदलना

इस शोध पत्र के लेखक एक चतुर समाधान प्रस्तावित करते हैं: ग्राफ (Graphs)। एक ग्राफ को बिंदुओं और रेखाओं वाले एक सरल चित्र के रूप में सोचें। इस मामले में, हर बार जब एक AI एजेंट (एक डिजिटल कार्यकर्ता) कुछ करता है—जैसे संदेश भेजना, किसी टूल का उपयोग करना, या कोई निर्णय लेना—तो वह एक बिंदु (dot) बन जाता है। हर बार जब एक एजेंट के काम का उपयोग दूसरे एजेंट द्वारा किया जाता है, तो एक रेखा (line) उन्हें जोड़ती है।

यह एक अव्यवized बातचीत को एक साफ, संरचित मानचित्र में बदल देता है। इससे कोई फर्क नहीं पड़ता कि एजेंटों के नाम "बॉब" हैं या "एजेंट 1," या वे अलग-अलग भाषाओं में बात करते हैं; मानचित्र बस यह दिखाता है कि किसने क्या किया और किसने किसकी बात सुनी। इस मानचित्र को कोलबोरेशन ग्राफ (Collaboration Graph) कहा जाता है। प्रत्येक टीम के प्रदर्शन को एक ग्राफ में बदलकर, शोधकर्ता अंततः विभिन्न टीमों की तुलना एक ही धरातल पर कर सकते हैं।

"जंगल" का रूपक (Metaphor)

यहाँ सबसे रचनात्मक हिस्सा है। शोधकर्ताओं ने महसूस किया कि किसी समस्या को हल करने का केवल एक आदर्श तरीका नहीं होता है। एक टीम बहस करके गणित की समस्या हल कर सकती है, जबकि दूसरी टीम विशेषज्ञों को कार्य सौंपकर इसे हल कर सकती है। दोनों तरीके काम करते हैं, लेकिन वे बहुत अलग दिखते हैं।

यदि शोधकर्ता एक "परफेक्ट" तरीका चुनते और सभी की तुलना उससे करते, तो वे उन टीमों को गलत तरीके से दंडित करते जो एक अलग, लेकिन फिर भी सफल, शैली का उपयोग करती हैं। इसलिए, एक एकल "गोल्ड स्टैंडर्ड" पेड़ के बजाय, उन्होंने एक रेफरेंस फॉरेस्ट (Reference Forest) बनाया।

एक जंगल की कल्पना करें जहाँ प्रत्येक पेड़ एक समस्या को सफलतापूर्वक हल करने के विभिन्न तरीकों का प्रतिनिधित्व करता है। कुछ पेड़ ऊँचे और सीधे होते हैं (एक सख्त योजना की तरह), जबकि अन्य झाड़ीदार और शाखाओं वाले होते हैं (एक मुक्त-प्रवाह वाली बहस की तरह)। जब एक नया AI टीम किसी कार्य को आज़माती है, तो ForestBench केवल यह नहीं देखता कि वे एक विशिष्ट पेड़ से मेल खाते हैं या नहीं। इसके बजाय, यह देखता है कि उनका "मानचित्र" पूरे जंगल में कितनी अच्छी तरह फिट बैठता है। यह पूछता है: "क्या आपकी टीम वर्क हमारे द्वारा देखे गए सफल तरीकों में से किसी एक जैसा दिखता है?"

व्यवहार में यह कैसे काम करता है

इस प्रणाली को बनाने के लिए, शोधकर्ताओं ने तीन मुख्य कार्य किए:

  1. सही पहेलियों को ढूँढना: उन्होंने 7 अलग-अलग सार्वजनिक डेटासेट्स (प्रश्नों के संग्रह) को देखा और आसान वाले को हटा दिया। उन्होंने केवल 844 प्रश्न रखे जो इतने जटिल थे कि उनमें टीम वर्क की आवश्यकता थी। यदि कोई प्रश्न बहुत सरल था, तो एक अकेला AI उसे हल कर सकता था, और वहां अध्ययन के लिए कोई दिलचस्प सहयोग नहीं बचता।
  2. जंगल बनाना: उन्होंने इन 844 प्रश्नों पर 6 अलग-अलग लोकप्रिय AI टीम फ्रेमवर्क चलाए। प्रत्येक प्रश्न के लिए, उन्होंने 10 अलग-अलग सफल प्रयासों को एकत्र किया। ये 10 सफल "मानचित्र" उस विशिष्ट प्रश्न के लिए रेफरेंस फॉरेस्ट बन गए।
  3. स्कोरकार्ड बनाना: उन्होंने मानचित्रों को मापने के लिए नियमों का एक सेट बनाया। वे निम्नलिखित चीजों को देखते हैं:
    • फॉरेस्ट मैच (Forest Match): इस टीम का मानचित्र जंगल में मौजूद सफल मानचित्रों से कितना मिलता-जुलता है?
    • नोड वैधता (Node Validity): क्या सभी के काम का उपयोग किया गया, या कुछ एजेंटों ने शून्य में बात की?
    • रिडंडेंसी (Redundancy): क्या टीम ने एक ही जानकारी को बार-बार दोहराया?
    • दक्षता (Efficiency): उन्होंने कितने "टोकन" (AI सोच की डिजिटल मुद्रा) खर्च किए?

उन्होंने क्या पाया

जब उन्होंने ForestBench का उपयोग करके 6 अलग-अलग AI टीम फ्रेमवर्क का परीक्षण किया, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं जो पुराने "अंतिम उत्तर" वाले परीक्षणों ने मिस कर दी थीं:

  • सटीकता ही सब कुछ नहीं है: "डिबेट" (Debate) नामक एक फ्रेमवर्क ने सही उत्तरों की उच्चतम संख्या प्राप्त की। लेकिन जब आपने मानचित्र को देखा, तो यह वास्तव में जंगल के सफल पैटर्न से सबसे कम मिलता-जुलता था। यह सबसे महंगा भी था, जिसने सबसे सस्ते टीम की तुलना में लगभग दोगुना कंप्यूटिंग पावर खर्च किया।
  • छिपे हुए दोष: एक अन्य फ्रेमवर्क, "AFlow," की सटीकता उच्च थी लेकिन वह बहुत "रिडंडेंट" (Redundant) था। वह बार-बार वही जानकारी दोहराता रहा, जैसे कोई छात्र अपने निबंध में एक ही वाक्य को बार-बार लिखता रहता है।
  • विभिन्न कार्यों के लिए विभिन्न शैलियाँ: कोडिंग जैसे कुछ कार्यों पर, "डिबेट" शैली वास्तव में सफल पैटर्न के अधिक करीब थी। यह दर्शाता है कि सहयोग करने का "सर्वश्रेष्ठ" तरीका इस बात पर निर्भर करता है कि आप क्या करने की कोशिश कर रहे हैं।

यह क्यों मायने रखता है

ForestBench की सबसे बड़ी जीत इसकी गति और निष्पक्षता है। एक बार जब "जंगल" (सफल मानचित्रों का संग्रह) बन जाता है, तो एक नई टीम की जाँच करने में केवल मिलीसेकंड लगते हैं और इसके लिए किसी अन्य AI को जज करने की आवश्यकता नहीं होती है। यह एक पुन: प्रयोज्य, वस्तुनिष्ठ तरीका है यह देखने का कि टीमें कैसे काम करती हैं, न कि केवल यह कि क्या वे काम करती हैं।

शोधकर्ता सुझाव देते हैं कि यह दृष्टिकोण हमें यह समझने में मदद करता है कि AI एजेंटों के सहयोग करने का कोई एक "परफेक्ट" तरीका नहीं है। इसके बजाय, हमें उनके टीम वर्क की संरचना को देखने की आवश्यकता है। यदि कोई टीम विफल होती है, तो ForestBench हमें बता सकता है कि क्यों: क्या वे इसलिए विफल हुए क्योंकि उन्होंने पर्याप्त बात नहीं की? क्या उन्होंने खुद को दोहराकर समय बर्बाद किया? या क्या वे बस गलत उत्तर प्राप्त कर रहे थे?

संक्षेप में, ForestBench हमें "क्या वे जीते?" से "उन्होंने खेल कैसे खेला?" की ओर ले जाता है। AI सहयोग के अदृश्य नृत्य को मैप करके, यह हमें डिजिटल सहायकों की बेहतर, स्मार्ट टीमें बनाने का एक स्पष्ट और अधिक ईमानदार तरीका देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →