← नवीनतम पेपर
🤖 AI

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

यह शोध पत्र Combee का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो समानांतर स्कैन (parallel scans), एक संवर्धित शफल तंत्र (augmented shuffle mechanism) और एक गतिशील बैच आकार नियंत्रक (dynamic batch size controller) का उपयोग करके स्व-सुधारित भाषा मॉडल एजेंटों के लिए समानांतर प्रॉम्प्ट लर्निंग को स्केल करता है, जिससे कई बेंचमार्क में सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए 17 गुना तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric Yang, Alvin Cheung, James Zou, Kunle Olukotun, Ion Stoica, Joseph E. Gonzalez

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric Yang, Alvin Cheung, James Zou, Kunle Olukotun, Ion Stoica, Joseph E. Gonzalez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक रोबोट की डायरी पढ़कर उसे सिखाना

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है जो समस्याओं को हल करने में आपकी मदद करता है। आमतौर पर, आपको इस रोबोट को सिखाने के लिए इसके आंतरिक कोड को बदलना पड़ता है (जैसे कि नया सॉफ्टवेयर अपडेट इंस्टॉल करना)। लेकिन यह धीमा, महंगा और कठिन काम है।

प्रॉम्प्ट लर्निंग (Prompt Learning) एक नया और स्मार्ट तरीका है। रोबोट के कोड को बदलने के बजाय, आप काम शुरू करने से ठीक पहले उसे एक "चीट शीट" या "प्लेबुक" देते हैं। जैसे-जैसे रोबोट समस्याओं को हल करने की कोशिश करता है, वह गलतियाँ करता है, उनसे सीखता है, और अपनी प्लेबुक में नए नियम लिखता है। यह प्लेबुक समय के साथ बेहतर होती जाती है, जिससे रोबोट के दिमाग को छुए बिना ही वह अधिक स्मार्ट बन जाता है।

समस्या: "बहुत अधिक नोट्स" की बाधा (The "Too Many Notes" Bottleneck)

शोधकर्ताओं ने देखा कि इस सीखने की प्रक्रिया में एक समस्या है।

  • पुराना तरीका (क्रमिक/Sequential): कल्पना कीजिए कि रोबोट एक समस्या हल करता है, अपनी प्लेबुक में एक नोट लिखता है, और फिर रुक जाता है। फिर वह अगली समस्या हल करता है, एक और नोट लिखता है, और फिर रुक जाता है। यह धीमा है।
  • "नाइव" समानांतर तरीका (The "Naive" Parallel Way): काम को तेज करने के लिए, लोगों ने एक ही समय में 100 रोबोट्स को काम पर लगाने की कोशिश की। वे सभी समस्याएं हल करते हैं, नोट्स लिखते हैं, और फिर उन सभी 100 नोट्स को एक ही "मास्टर रोबोट" के पास डाल देते हैं ताकि उन्हें मिलाकर एक बड़ी प्लेबुक बनाई जा सके।

यहीं पर यह टूट जाता है: मास्टर रोबोट अभिभूत (overwhelmed) हो जाता है। यह एक साथ 100 अलग-अलग डायरियों को पढ़ने और उनका सारांश लिखने जैसा है। मास्टर रोबोट भ्रमित हो जाता है, महत्वपूर्ण विवरणों को भूल जाता है, और केवल सामान्य, उबाऊ सलाह लिख पाता है जैसे कि "सावधान रहें।" वह उन विशिष्ट, शानदार सुझावों को फेंक देता है जो कठिन समस्याओं को हल करने में वास्तव में मदद करते हैं। इसे "कॉन्टेक्स्ट ओवरलोड" (Context Overload) कहा जाता है।

समाधान: कोम्बी (Combee - मधुमक्खी का झुंड)

लेखकों ने Combee नामक एक नया सिस्टम बनाया। उन्होंने इसका नाम मधुमक्खियों के नाम पर रखा क्योंकि, एक छत्ते की तरह, यह अराजकता के बिना कुशलता से कुछ बनाने के लिए एक विशाल टीम का उपयोग करता है।

Combee तीन चतुर तरीकों से "बहुत अधिक नोट्स" की समस्या को ठीक करता है:

1. पैरेलल स्कैन (टीम हडल/The Parallel Scan)

सभी 100 नोट्स का एक बड़ा ढेर बनाने के बजाय, Combee उन्हें एक सैन्य ड्रिल या स्पोर्ट्स टीम हडल की तरह व्यवस्थित करता है।

  • यह कैसे काम करता है: 100 रोबोट्स को 10 छोटे समूहों में बांटा जाता है। प्रत्येक समूह पहले अपने नोट्स को मिलाता है। फिर, वे 10 समूह-नेता अपने सारांशों को मिलाते हैं। अंत में, शीर्ष नेता अंतिम 10 सारांशों को मिलाता है।
  • उपमा (Analogy): एक कक्षा की कल्पना करें। 30 छात्रों से एक साथ अपना उत्तर चिल्लाकर बताने के लिए कहने के बजाय (अराजकता!), शिक्षक उन्हें 3 के समूहों में बंटने के लिए कहता है। प्रत्येक टेबल एक उत्तर पर सहमत होती है। फिर टेबल के नेता एक अंतिम उत्तर पर सहमत होते हैं। शिक्षक को केवल कुछ स्पष्ट आवाजों को सुनना पड़ता है, न कि शोर को। यह "मास्टर रोबोट" को अभिभूत होने से रोकता है।

2. ऑगमेंटेड शफलिंग (कॉपी-पेस्ट सुरक्षा जाल/Augmented Shuffling)

कभी-कभी, एक बहुत ही शानदार नोट भी भीड़ में खो जाता है क्योंकि वह अद्वितीय होता है।

  • यह कैसे काम करता है: नोट्स को समूहों में जाने से पहले, Combee हर एक नोट की कुछ प्रतियां बनाता है और उन्हें बेतरतीब ढंग से मिला देता है।
  • उपमा: कल्पना कीजिए कि आप लोगों की एक लंबी कतार में एक गुप्त संदेश भेज रहे हैं। यदि आप इसे केवल एक बार भेजते हैं, तो हो सकता है कि कोई व्यक्ति इसे गिरा दे। लेकिन यदि आप तीन प्रतियां बनाते हैं और उन्हें तीन अलग-अलग लाइनों में भेजते हैं, तो सभी प्रतियों के खो जाने की संभावना लगभग शून्य है। यह सुनिश्चित करता है कि "मास्टर रोबोट" सबसे अच्छे विचारों को देखे, भले ही समूह का आकार बहुत बड़ा क्यों न हो।

3. डायनेमिक बैच साइज (स्मार्ट ट्रैफिक लाइट/The Dynamic Batch Size)

एक समय में कितने रोबोट काम करने चाहिए? बहुत कम होने पर काम धीमा हो जाता है; बहुत अधिक होने पर ओवरलोड की समस्या होती है।

  • यह कैसे काम करता है: Combee में एक इन-बिल्ट ट्रैफिक कंट्रोलर होता है। यह वास्तविक समय में विभिन्न समूह आकारों का परीक्षण करता है। यदि यह देखता है कि अधिक रोबतों को जोड़ने से सीखना धीमा हो रहा है (क्योंकि नोट्स बहुत अव्यवस्थित हो रहे हैं), तो यह स्वचालित रूप से समूह का आकार कम कर देता है। यदि यह देखता है कि अब और रोबट जोड़ना सुरक्षित है, तो यह गति बढ़ा देता है।
  • उपमा: यह एक स्मार्ट हाईवे रैंप मीटर की तरह है। यह एक साथ 100 कारों को मर्ज होने के लिए नहीं छोड़ देता जिससे दुर्घटना हो जाए। यह ट्रैफ़िक के प्रवाह को देखता है और कारों को सही मात्रा में मर्ज होने देता है ताकि सब कुछ बिना रुके तेजी से चलता रहे।

परिणाम: तेज़, सस्ता और स्मार्ट

शोधकर्ताओं ने गणितीय समस्याओं को हल करने, कोडिंग और वित्तीय दस्तावेजों का विश्लेषण करने जैसे कठिन कार्यों पर Combee का परीक्षण किया।

  • गति: Combee पुराने तरीकों की तुलना में 17 गुना तक तेज़ था।
  • गुणवत्ता: तेज़ होने के बावजूद, इसने गलतियाँ नहीं कीं। वास्तव में, इसने बेहतर सीखा क्योंकि इसने अच्छे नोट्स को फेंका नहीं।
  • लागत: इसे चलाने में उतना ही पैसा लगा जितना धीमे तरीकों में लगता है।

सारांश

Combee एक ऐसा सिस्टम है जो AI एजेंटों को उनकी गलतियों से बहुत तेज़ी से सीखने में मदद करता है। यह "लर्निंग बॉस" को बहुत अधिक जानकारी से अभिभूत होने से रोकता है, सूचना को एक अच्छी तरह से संचालित मधुमक्खी के झुंड की तरह व्यवस्थित करके: छोटी टीमों में काम करके, सुरक्षित रहने के लिए महत्वपूर्ण जानकारी की प्रतियां बनाकर, और मौके पर टीम के आकार को समायोजित करके। इसका मतलब है कि AI घंटों के बजाय मिनटों में स्मार्ट हो सकता है, बिना अपनी प्रतिभा खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →