← नवीनतम पेपर
💬 NLP

General learned delegation by clones

यह शोध पत्र SELFCEST को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एक बेस लैंग्वेज मॉडल को डायनामिक रूप से समान-भार वाले समानांतर क्लोन (same-weight parallel clones) उत्पन्न करने और समन्वय करने के लिए एजेंटिक सुदृढीकरण लर्निंग (agentic reinforcement learning) का उपयोग करता है, जिससे मोनोलिथिक बेसलाइन की तुलना में जटिल तर्क कार्यों पर सटीकता-लागत दक्षता और सामान्यीकरण में सुधार होता है।

मूल लेखक: Darren Li, Meiqi Chen, Chenze Shao, Fandong Meng, Jie Zhou

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Darren Li, Meiqi Chen, Chenze Shao, Fandong Meng, Jie Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अत्यधिक व्यस्त जासूस हैं जो एक विशाल, जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक सख्त समय सीमा है और ऊर्जा (टोकन) की एक सीमित आपूर्ति है।

पुराना तरीका:
परंपरागत रूप से, यदि आपका जासूस (AI) फंस जाता है, तो वह दो चीजें करने की कोशिश करता है:

  1. "कड़ी मेहनत करने" का तरीका (The "Think Harder" Method): वह बहुत लंबे समय तक अकेले कमरे में बैठकर समस्या के बारे में सोचता है और पन्नों दर पन्नों नोट्स लिखता है। यह धीमा है और आपकी सारी ऊर्जा खत्म कर देता है।
  2. "अनुमान और जाँच" का तरीका (The "Guess and Check" Method): वह अपने ही 100 क्लोन बनाता है, उन सभी को शून्य से पूरे रहस्य को हल करने के लिए कमरे में भेज देता है, और फिर सबसे अच्छा उत्तर चुन लेता है। यह बेहद बर्बादी भरा है क्योंकि उन 99 क्लोनों में से अधिकांश या तो वही गलतियाँ दोहरा रहे होते हैं या उस पहेली के उन हिस्सों पर समय बर्बाद कर रहे होते हैं जिन्हें उन्हें हल करने की आवश्यकता भी नहीं है।

नया तरीका (SELFCEST):
यह पेपर SELFCEST नामक एक नई रणनीति पेश करता है। अकेले काम करने या पूरे काम के लिए 100 क्लोन बनाने के बजाय, मुख्य जासूस एक स्मार्ट मैनेजर बनना सीखता है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "क्लोन" की अवधारणा (The "Clone" Concept)

कल्पना कीजिए कि मुख्य जासूस के पास खुद के क्लोन तुरंत बनाने की एक जादुई क्षमता है, जो समान बुद्धिमत्ता (वही "मस्तिष्क" या मॉडल वेट्स) रखते हैं, लेकिन उन्हें अलग-अलग छोटे कार्यों पर काम करने के लिए अलग-अलग कमरों में भेजा जाता है।

  • समस्या: "10 अलग-अलग वस्तुओं वाले एक जटिल प्रोजेक्ट की कुल लागत की गणना करें।"
  • पुराना AI: वह एक लंबी, भ्रमित करने वाली सूची में सभी 10 वस्तुओं की गणना करने की कोशिश करता है।
  • SELFCEST AI:
    • रूट एजेंट (Root Agent) सूची को देखता है और कहता है, "यह एक व्यक्ति के लिए बहुत बड़ा है।"
    • वह क्लोन A को पहले 3 वस्तुओं की लागत की गणना करने के लिए भेजता है।
    • वह क्लोन B को अगले 3 वस्तुओं को संभालने के लिए भेजता है।
    • वह क्लोन C को टैक्स (taxes) संभालने के लिए भेजता है।
    • एक बार जब क्लोन अपने छोटे काम पूरे कर लेते हैं, तो वे परिणाम रूट एजेंट को वापस भेज देते हैं।
    • रूट एजेंट उन तीन छोटे उत्तरों को लेता है, उन्हें जोड़ता है, और अंतिम समस्या को हल करता है।

2. प्रतिनिधि बनाना सीखना (The "Coach")

जादू केवल क्लोन बनाने में नहीं है; बल्कि यह सीखने में है कि कब और कैसे उनका उपयोग किया जाए।

एक स्पोर्ट्स कोच के बारे में सोचें जिसने कभी खेल नहीं खेला है लेकिन वह लाखों मैच देख रहा है:

  • शुरुआत में, कोच गलत निर्णय ले सकता है: "एक छोटी सी गणित की समस्या करने के लिए 50 क्लोन भेज दो!" (बर्बादी)।
  • या, "पूरा काम करने के लिए एक क्लोन भेजो!" (बहुत धीमा)।
  • रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) (परीक्षण और त्रुटि) के माध्यम से, कोच को तभी "स्कोर" मिलता है जब अंतिम उत्तर सही होता है।
  • समय के साथ, कोच सीख जाता है: "आह, जब समस्या एक लंबा गणितीय समीकरण हो, तो मुझे इसे विभाजित करना चाहिए। जब समस्या एक छोटी कहानी हो, तो मुझे इसे स्वयं पढ़ना चाहिए।"

AI एक स्मार्ट रिसोर्स मैनेजर बनना सीख जाता है। वह तय करता है:

  • क्या विभाजित करना है?
  • कितने क्लोन भेजने हैं?
  • प्रत्येक क्लोन को कितना समय (कॉन्टेक्स्ट) देना है?

3. "क्रेडिट असाइनमेंट" की समस्या (Who gets the credit?)

यह इस पेपर का सबसे कठिन हिस्सा है। यदि टीम जीतती है, तो ट्रॉफी किसे मिलती है?

  • यदि क्लोन A ने बहुत अच्छा काम किया, लेकिन क्लोन B ने अंतिम जोड़ (addition) में गलती कर दी, और रूट एजेंट विफल रहा, तो क्या क्लोन A को दंडित किया जाना चाहिए?
  • यह पेपर एक "गेटकीपर" नियम का उपयोग करके इसे हल करता है। यदि कोई क्लोन पटरी से उतर जाता है (जैसे कि लूप में फंस जाना या समय समाप्त हो जाना), तो सिस्टम अनिवार्य रूप से कहता है, "हम इस विशिष्ट प्रशिक्षण दौर के लिए इस क्लोन के प्रयास को अनदेखा करते हैं।" यह प्रशिक्षण को स्थिर रखता है ताकि AI अपनी ही गलतियों से भ्रमित न हो।

यह एक बड़ी बात क्यों है?

  • दक्षता (Efficiency): यह एक साथ सब कुछ करने की कोशिश करने की तुलना में कम शब्दों (टोकन) और कम समय का उपयोग करके कठिन समस्याओं को हल करता है।
  • सामान्यीकरण (Generalization): यह केवल गणित की समस्याओं को हल करना नहीं सीखता; यह प्रतिनिधित्व (delegation) का कौशल सीखता है। इसका मतलब है कि यह इस कौशल को नए प्रकार की समस्याओं, जैसे किसी विशिष्ट तथ्य को खोजने के लिए लंबी किताब पढ़ने (Multi-hop QA) या एक पेचीदा तर्क पहेली को हल करने में लागू कर सकता है।
  • लागत (Cost): वास्तविक दुनिया में, AI प्रति शब्द उत्पन्न होने पर पैसे खर्च करता है। SELFCEST AI को मितव्ययी बनना सिखाता है, जिससे वह सबसे कम कीमत पर सबसे अच्छा उत्तर प्राप्त कर सके।

निष्कर्ष (The Bottom Line)

SELFCEST एक अकेले, एकाकी AI को एक टीम लीडर में बदल देता है। यह AI को पूरी दुनिया का बोझ अपने कंधों पर उठाने के बजाय, एक अस्थायी, कुशल टीम बनाने और फिर काम के विशिष्ट हिस्सों को निपटाने के लिए परिणामों को वापस लाने का कौशल सिखाता है। यह बर्फ में संघर्ष करते हुए एक अकेले भेड़िये और मिलकर शिकार करने वाले एक सुव्यवस्थित भेड़ के झुंड के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →