← नवीनतम पेपर
🤖 machine learning

Mixture of Complementary Agents for Robust LLM Ensemble

यह शोध पत्र मल्टी-एआई सहयोग के लिए प्रस्तावक (प्रपोजर) एलएलएम के चयन को पूरकता पर केंद्रित एक कॉम्बिनेटोरियल समस्या के रूप में पुनर्गठित करता है, और ऐसे गणनात्मक रूप से व्यवहार्य ग्रीडी एल्गोरिदम का प्रस्ताव और सत्यापन करता है जो प्रस्तावक और सारांशकर्ता (समराइज़र) के बीच तालमेल को अनुकूलित करके मौजूदा सटीकता- या विविधता-केंद्रित दृष्टिकोणों से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Yichi Zhang, Kevin Lu, Yuang Zhang, Jie Gao, Lirong Xia, Fang-Yi Yu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yichi Zhang, Kevin Lu, Yuang Zhang, Jie Gao, Lirong Xia, Fang-Yi Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं। आपके पास विशेषज्ञों (प्रस्तावक/proposers) की एक टीम है जो प्रत्येक अपना स्वयं का समाधान पेश करती है, और आपके पास एक "मुख्य संपादक" (सारांशकर्ता/summarizer) है जो उन सभी समाधानों को पढ़ता है और अंतिम, सर्वश्रेष्ठ उत्तर लिखता है।

बड़ा सवाल यह है: आपको मेज पर किन विशेषज्ञों को आमंत्रित करना चाहिए?

अधिकांश लोग मानते हैं कि सबसे अच्छी रणनीति या तो:

  1. सबसे बुद्धिमान लोगों को चुनना: केवल उन विशेषज्ञों को आमंत्रित करें जिनका व्यक्तिगत ट्रैक रिकॉर्ड सबसे अच्छा हो।
  2. सबसे अलग लोगों को चुनना: पूरी तरह से अलग तरह से सोचने वाले लोगों का एक मिश्रण आमंत्रित करें, इस उम्मीद में कि उनकी विविधता सभी पहलुओं को कवर कर लेगी।

यह शोध पत्र तर्क देता है कि ये दोनों रणनीतियाँ अक्सर गलत होती हैं। आपको केवल स्मार्ट लोग या अलग लोग नहीं चाहिए; आपको ऐसे लोग चाहिए जिनकी विशिष्ट ताकतें आपस में एक पहेली के टुकड़ों की तरह फिट बैठती हों ताकि मुख्य संपादक अपना काम पूरी तरह से कर सके।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र के विचारों का विवरण दिया गया है:

1. समस्या: "स्टार प्लेयर" का जाल

कल्पना कीजिए कि आप एक बास्केटबॉल टीम के कोच हैं। आपके पास एक सुपरस्टार खिलाड़ी है जो प्रति गेम 50 अंक बनाता है। स्वाभाविक रूप से, आप उन्हें कोर्ट पर चाहते हैं। लेकिन क्या होगा यदि आपका "मुख्य संपादक" (वह कोच जो अंतिम निर्णय लेता है) उस विशिष्ट खिलाड़ी की शैली को संभालने में बहुत खराब है? या क्या होगा यदि वह सुपरस्टार हमेशा वही गलती करता है जिसे कोच ठीक नहीं कर पाता?

शोध पत्र दिखाता है कि "सर्वश्रेष्ठ" व्यक्तिगत मॉडल चुनना अक्सर विफल हो जाता है। एक प्रयोग में, वह टीम जिसमें सबसे सटीक एकल AI मॉडल शामिल था, वास्तव में उस टीम से भी खराब प्रदर्शन कर गई जो एक ऐसे मॉडल के इर्द-गिर्द बनाई गई थी जो अपने आप में कमजोर था लेकिन मुख्य संपादक के साथ पूरी तरह से "क्लिक" (तालमेल) करता था।

उपमा: यह एक ऐसे शेफ को काम पर रखने जैसा है जो फ्रांसीसी व्यंजनों का उस्ताद है, लेकिन एक ऐसे रेस्तरां के लिए जो केवल सुशी परोसता है। व्यक्तिगत रूप से, शेफ अद्भुत है, लेकिन वे मेनू के पूरक नहीं हैं। आपको एक ऐसे शेफ की आवश्यकता है जिसके कौशल रसोई की कमियों को भर सकें, न कि केवल उस व्यक्ति की जिसकी बड़ी प्रतिष्ठा है।

2. समाधान: "केमिस्ट्री" (तालमेल) खोजना

लेखक टीम चुनने का एक नया तरीका प्रस्तावित करते हैं, जिसे Complementary-MoA कहा जाता है। यह पूछने के बजाय कि, "कौन सबसे स्मार्ट है?" या "कौन सबसे अलग है?", वे पूछते हैं: "यह इस विशिष्ट मुख्य संपादक और बाकी टीम के साथ मिलकर सबसे अच्छा कैसे काम करता है?"

उन्होंने महसूस किया कि सबसे अच्छी टीम केवल उच्च स्कोर का संग्रह नहीं है; यह एक ऐसा समूह है जहाँ सदस्यों की त्रुटियाँ एक-दूसरे को काट देती हैं (cancel out), और उनकी ताकतें मुख्य संपादक की सही उत्तर निकालने की क्षमता को बढ़ा देती हैं।

3. चुनौती: सभी का परीक्षण करना बहुत महंगा है

एक आदर्श टीम खोजने के लिए, सैद्धांतिक रूप से आपको विशेषज्ञों के हर संभावित संयोजन को आज़माना होगा, मुख्य संपादक को परिणाम का मूल्यांकन करने देना होगा, और विजेता चुनना होगा।

  • गणित की समस्या: यदि आपके पास 20 विशेषज्ञ हैं और आपको 5 चुनने हैं, तो 15,000 से अधिक संभावित टीमें हैं।
  • लागत: हर बार जब आप एक टीम का परीक्षण करते हैं, तो आपको "मुख्य संपादक" (एक AI मॉडल) को सभी उत्तरों को पढ़ने और एक नया उत्तर लिखने के लिए भुगतान करना पड़ता है। यह धीमा और महंगा है।

4. समाधान: स्मार्ट शॉर्टकट (एल्गोरिदम)

चूंकि हर टीम का परीक्षण करना असंभव है, इसलिए लेखकों ने बिना भारी खर्च के सबसे अच्छी टीम खोजने के लिए तीन "स्मार्ट शॉर्टकट" (एल्गोरिदम) का आविष्कार किया:

  • मॉडल-फर्स्ट ग्रीडी (एक "टीम कप्तान" दृष्टिकोण):
    सभी विशेषज्ञों का परीक्षण करने के बजाय, यह विधि पहले विशेषज्ञों के सबसे अच्छे प्रकारों (मॉडल्स) को चुनती है और फिर उन विशेषज्ञों के सबसे अच्छे संस्करणों (प्रॉम्प्ट्स) को चुनती है। यह मानता है कि एक ही मॉडल के दो अलग-अलग प्रॉम्प्ट्स के बीच के सूक्ष्म अंतर की तुलना में विभिन्न AI मॉडलों के बीच का "केमिस्ट्री" अधिक महत्वपूर्ण है। यह पहले सर्वश्रेष्ठ स्पोर्ट्स टीमों को चुनने, फिर उन टीमों से सर्वश्रेष्ठ खिलाड़ियों को चुनने जैसा है।

  • ट्रुथ-प्रेडिक्शन ग्रीडी (एक "चीट शीट" दृष्टिकोण):
    यह विधि महंगे मुख्य संपादक को टीमों का मूल्यांकन करने के लिए बिल्कुल नहीं कहती। इसके बजाय, यह एक छोटे, सस्ते मशीन लर्निंग मॉडल का उपयोग करती है जो अनुमान लगाता है: "यदि ये विशेषज्ञ ये उत्तर देते हैं, तो संभावित सही उत्तर क्या है?" यह उस टीम को चुनती है जो एक अभ्यास परीक्षण पर सबसे अच्छा अनुमान लगाती है। यह यह पता लगाने के लिए कि कौन सा स्टडी ग्रुप सबसे अच्छा काम करता है, प्रोफेसर से हर समूह को ग्रेड देने के बजाय एक अभ्यास क्विज़ का उपयोग करने जैसा है।

  • ओरेकल-सरोगेट ग्रीडी (एक "सिम्युलेटर" दृष्टिकोण):
    यह विधि मुख्य संपादक का एक सरल "सिमुलेशन" बनाती है। यह वास्तविक मुख्य संपादक से केवल कुछ बार पूछती है कि वे सही उत्तरों की विभिन्न संख्या के प्रति कैसे प्रतिक्रिया करते हैं। फिर, यह उस सरल सिमुलेशन का उपयोग करके सबसे अच्छी टीम चुनती है। यह रेसट्रैक पर जाने से पहले सिम्युलेटर पर कार के इंजन का परीक्षण करने जैसा है।

5. परिणाम: केमिस्ट्री की जीत

लेखकों ने इन विधियों का कठिन गणित और तर्क पहेलियों पर परीक्षण किया। उन्होंने पाया:

  • पुराने तरीके विफल रहे: सबसे "स्मार्ट" मॉडल या सबसे "विविध" मॉडल चुनना अक्सर खराब परिणामों की ओर ले गया क्योंकि उन्होंने इस बात को नजरअंदाज कर दिया कि टीम एक साथ कैसे काम करती है।
  • नए तरीके जीते: वे तरीके जिन्होंने पूरकता (complementarity - टीम कितनी अच्छी तरह फिट बैठती है) की तलाश की, उन्होंने लगातार बेहतर परिणाम दिए।
  • दक्षता: "चीट शीट" और "सिम्युलेटर" विधियां अविश्वसनीय रूप से तेज़ थीं, जिन्हें लगभग कोई महंगा परीक्षण करने की आवश्यकता नहीं थी, फिर भी वे पुराने तरीकों से बेहतर रहीं।

सारांश

AI टीम बनाने को एक बैंड (संगीत समूह) बनाने की तरह समझें। आपको केवल सबसे तेज़ गायक या सबसे अनूठा ड्रमर नहीं चाहिए। आपको ऐसे संगीतकार चाहिए जिनका संगीत एक साथ मिलकर एक ऐसा गाना बनाए जिसे निर्माता (सारांशकर्ता) एक हिट रिकॉर्ड में मिक्स कर सके। यह शोध पत्र हमें सिखाता है कि व्यक्तिगत स्टार पावर से अधिक टीम की केमिस्ट्री (तालमेल) महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →