← नवीनतम पेपर
🤖 AI

Discovering Multiagent Learning Algorithms with Large Language Models

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) अपूर्ण-सूचना वाले खेलों (imperfect-information games) के लिए प्रतिस्पर्धी मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (Multi-Agent Reinforcement Learning) एल्गोरिदम की खोज को स्वचालित कर सकते हैं, और यह दर्शाता है कि इन जटिल, पर्यावरण-विशिष्ट निष्कर्षों को न्यूनतम एल्गोरिद्मिक मुख्य संरचनाओं (minimal algorithmic cores) में संकुचित करने से बेहतर सामान्यीकरण और कम संरचनात्मक जटिलता प्राप्त होती है।

मूल लेखक: Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों के एक समूह को पोकर, गो (Go), या यहाँ तक कि "लायर डाइस" (Liar's Dice) जैसा खेल खेलना सिखाने की कोशिश कर रहे हैं। दशकों से, इंसान ही कोच रहे हैं, जो मैन्युअल रूप से रोबोटों के दिमाग में बदलाव करते रहे हैं, अलग-अलग गणितीय फॉर्मूले आजमाते रहे हैं और उम्मीद करते रहे हैं कि वे बेहतर हो जाएंगे। यह प्रयास और त्रुटि (trial and error) की एक धीमी, उबाऊ प्रक्रिया है।

यह शोध पत्र कोचिंग का एक नया तरीका बताता है: एक इंसान द्वारा कोड को बदलने के बजाय, शोधकर्ताओं ने एक लार्ज लैंग्वेज मॉडल (LLM)—एक सुपर-स्मार्ट AI जो कोड समझता है—को एक 'इवोल्यूशनरी बायोलॉजिस्ट' (विकासवादी जीवविज्ञानी) के रूप में कार्य करने दिया। वे इस सिस्टम को अल्फा-इवॉल्व (AlphaEvolve) कहते हैं।

यहाँ उस कहानी का विवरण दिया गया है जो उन्होंने पाया, जिसे सरल अवधारणाओं में विभाजित किया गया है।

1. द इवोल्यूशनरी लैब (विकासवादी प्रयोगशाला)

शोधकर्ताओं ने दो अलग-अलग प्रकार के गेम-प्लेइंग एल्गोरिदम के साथ एक डिजिटल "लैब" स्थापित की:

  • सीएफआर (CFR - Counterfactual Regret Minimization): इसे एक ऐसे छात्र के रूप में सोचें जो अपनी हर गलती को देखकर सीखता है और पूछता है, "अगर मैंने कुछ और किया होता, तो क्या मैं जीत जाता?"
  • पीएसआरओ (PSRO - Policy-Space Response Oracles): यह एक ऐसे कोच की तरह है जो विभिन्न खिलाड़ियों की एक टीम बनाता है, उन्हें आपस में लड़ाता है, और वर्तमान सर्वश्रेष्ठ खिलाड़ी को हराने के लिए लगातार नए, स्मार्ट खिलाड़ियों को टीम में जोड़ता रहता है।

LLM को इन एल्गोरिदम का सोर्स कोड दिया गया और निर्देश दिया गया: "इन्हें बेहतर बनाओ। उन गलतियों को कम करो (exploitability) जो ये रोबोट करते हैं।"

LLM ने केवल कुछ नंबरों को नहीं बदला; इसने एल्गोरिदम के तर्क (logic) को ही फिर से लिखा, जिससे एल्गोरिदम के डीएनए की तरह उनमें उत्परिवर्तन (mutation) हुआ। कई पीढ़ियों के "सर्वाइवल ऑफ द फिटेस्ट" (योग्यतम की उत्तरजीविता) के बाद, LLM ने दो नए, अत्यधिक जटिल एल्गोरिदम बनाए:

  • VAD-CFR: "रिग्रेट" (पछतावे) वाले छात्र का एक संस्करण जो इस बात के प्रति अनुकूल होता है कि खेल कितना अराजक महसूस होता है।
  • SHOR-PSRO: "टीम कोच" का एक संस्करण जो विभिन्न रणनीतियों को एक बहुत ही विशिष्ट और जटिल तरीके से मिलाता है।

2. "ओवर-इंजीनियर्ड" का जाल (The "Over-Engineered" Trap)

जब उन्होंने इन नए AI-डिस्कवर्ड एल्गोरिदम का परीक्षण किया, तो वे अद्भुत थे। उन्होंने उन विशिष्ट खेलों में सभी मानव-डिजाइन किए गए चैंपियनों को हरा दिया जिनके लिए उन्हें प्रशिक्षित किया गया था।

हालाँकि, शोधकर्ताओं ने कुछ संदिग्ध देखा। LLM ने इन एल्गोरिदम को एक मास्टर शेफ की तरह बनाया था जो विशेष रूप से एक बहुत ही नखरेबाज खाने वाले के लिए व्यंजन तैयार करता है। कोड जटिल, उलझी हुई तंत्रों (mechanisms) से भरा था जो उन विशिष्ट खेलों के लिए तो एकदम सही काम करते थे, लेकिन वे संभवतः केवल "ओवरफिटिंग" थे—यानी उन्होंने खेल के सामान्य नियमों को सीखने के बजाय प्रशिक्षण डेटा को रट लिया था।

यह ऐसा था जैसे LLM ने एक ऐसी कार बनाई जिसमें एक विशेष ट्रैक के लिए टर्बोचार्जर, एक नाइट्रो सिस्टम और एक विशेष सस्पेंशन लगाया गया हो। वह उस ट्रैक पर तो जीतेगा, लेकिन यदि आप उसे एक ऊबड़-खाबड़ कच्ची सड़क पर ले जाएंगे, तो वह बिखर सकता है।

3. "एब्लेशन" सर्जरी (डिटेक्टिव वर्क)

यह पता लगाने के लिए कि वास्तव में इन एल्गोरिदम को क्या स्मार्ट बना रहा था, शोधकर्ताओं ने "सर्जरी" की। उन्होंने व्यवस्थित रूप से कोड के हिस्सों को हटाया ताकि यह देखा जा सके कि क्या होता है। इसे एब्लेशन (ablation) कहा जाता है।

उन्होंने पाया कि फैंसी, जटिल हिस्से (जैसे अस्थिरता को ट्रैक करना या रणनीतियों को विशिष्ट तरीकों से मिलाना) ज्यादातर दिखावा थे। उन्होंने एल्गोरिदम को नए खेलों में जीतने में मदद तो की, लेकिन वे इसे नए खेलों के प्रति सामान्य बनाने (generalize करने) में मदद नहीं कर सके।

जब उन्होंने "फैंसी ड्रेस" को उतार फेंका, तो उन्हें वे बुनियादी ढाँचे (bare bones) मिले जो वास्तव में इंजन को चला रहे थे।

4. डिस्टिल्ड विनर्स (निर्मित विजेता)

सबसे आवश्यक, मौलिक सिद्धांतों को रखकर और अत्यधिक जटिल कोड को हटाकर, उन्होंने दो नए, सरल एल्गोरिदम बनाए:

  • WOP-CFR (Warm-started Optimistic Predictive CFR):

    • उपमा: कल्पना कीजिए कि एक छात्र पहले 500 दिनों तक क्लास के नोट्स लेने से इनकार कर देता है (एक "वार्म स्टार्ट") ताकि वह बुरी आदतें न लिख ले। फिर, वे नोट्स लेना शुरू करते हैं, लेकिन वे "आशावादी" होते हैं—वे मानते हैं कि अगला कदम वर्तमान से थोड़ा बेहतर होगा, जो उन्हें तेजी से सीखने में मदद करता है।
    • परिणाम: यह सरल संस्करण वास्तव में मूल जटिल संस्करण की तुलना में नए खेलों के प्रति अधिक सक्षम था। यह नई स्थितियों में भ्रमित होने की संभावना कम रखता था।
  • PM-PSRO (Projection Matching PSRO):

    • उपमा: कल्पना कीजिए कि एक कोच भीड़ के "शोर" को अनदेखा करता है। पूरी टीम के औसत स्कोर को देखने के बजाय, वह देखता है कि एक खिलाड़ी पूरे औसत के सापेक्ष कैसा प्रदर्शन करता है। यदि कोई खिलाड़ी औसत से नीचे है, तो उसे तुरंत भुला दिया जाता है। यदि वह औसत से ऊपर है, तो उसे सुर्खियों में लाया जाता है।
    • परिणाम: यह सरल संस्करण भी जटिल मूल संस्करण से बेहतर था, जिससे साबित हुआ कि जटिल मिश्रण वाला तर्क आवश्यक नहीं था।

5. मुख्य निष्कर्ष (The Big Takeaway)

शोध पत्र यह निष्कर्ष निकालता है कि LLM विचार प्रस्तावित करने में महान हैं, लेकिन उन्हें परिष्कृत (distill) करने के लिए इंसानों की आवश्यकता होती है।

LLM एक रचनात्मक आविष्कारक की तरह था जो 500 चलते हुए पुर्जों वाली मशीन बनाता है। शोधकर्ता उन इंजीनियरों की तरह थे जिन्होंने महसूस किया, "हे, हमें इसे चलाने के लिए केवल 3 पुर्जों की आवश्यकता है, और बाकी 497 को हटाने से यह अधिक तेज़ और विश्वसनीय हो जाता है।"

दावे का सारांश:
शोधकर्ताओं ने सफलतापूर्वक एक नए गेम-प्लेइंग एल्गोरिदम की खोज के लिए AI का उपयोग किया जो मानव विशेषज्ञों को हरा देते हैं। हालाँकि, AI की कच्ची खोजें बहुत जटिल और विशिष्ट थीं। जटिलता को सर्जिकल तरीके से हटाकर, उन्होंने सरल, स्वच्छ एल्गोरिदम बनाए जो अन देखे खेलों को संभालने में और भी बेहतर थे। यह सिद्ध करता है कि AI वैज्ञानिक खोज के लिए एक शक्तिशाली उपकरण हो सकता है, बशर्ते कि परिणाम को सरल बनाने और व्याख्या करने के लिए इंसान वहां मौजूद हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →