TMAS: Scaling Test-Time Compute via Multi-Agent Synergy
यह शोध पत्र TMAS को प्रस्तुत करता है, जो एक मल्टी-एजेंट सिनर्जी फ्रेमवर्क है जो संरचित क्रॉस-ट्रैजेक्टरी सहयोग के लिए पदानुक्रमित स्मृतियों (hierarchical memories) का उपयोग करके और तर्क कार्यों में अन्वेषण (exploration) और दोहन (exploitation) को प्रभावी ढंग से संतुलित करने के लिए एक हाइब्रिड रिवॉर्ड रीइन्फोर्समेंट लर्निंग स्कीम का उपयोग करके बड़े भाषा मॉडलों के लिए टेस्ट-टाइम कंप्यूट स्केलिंग को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अविश्वसनीय रूप से कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई जटिल गणितीय समस्या या कोई पेचीदा तर्क वाला सवाल। आपके पास एक बहुत ही स्मार्ट सहायक (एक AI) है जो इसे हल करने की कोशिश कर सकता है।
पुराना तरीका: अकेला भेड़िया बनाम भीड़
पहले, यदि AI अटक जाता था, तो शोधकर्ता बस उसे "कड़ी मेहनत करने" या "फिर से प्रयास करने" के लिए कहते थे।
- अकेला भेड़िया (The Lone Wolf): AI बस खुद से बात करता रहता, विचारों की एक लंबी श्रृंखला लिखता। कभी-कभी वह एक लूप में फंस जाता, बार-बार एक ही गलती दोहराता रहता।
- भीड़ (The Crowd): अन्य तरीकों में AI एक साथ कई अलग-अलग उत्तर उत्पन्न करता, सबसे लोकप्रिय एक को चुनता, या एक संस्करण दूसरे की जांच करता। लेकिन ये संस्करण अक्सर अलग-थलग काम करते थे। यदि एक संस्करण को कोई शानदार तरकीब मिल जाती, तो अन्यों को इसके बारे में पता नहीं चलता। यदि एक संस्करण किसी मृत अंत (dead end) पर पहुँच जाता, तो अन्यों को उस रास्ते से बचने का पता नहीं होता। वे एक कमरे में मौजूद लोगों के समूह की तरह थे, जो अलग-अलग विचार चिल्ला रहे थे, लेकिन वास्तव में कोई एक-दूसरे की बात सुन नहीं रहा था या कोई साझा नोटबुक रख रहा था।
नया तरीका: TMAS (साझा मस्तिष्क वाली टीम)
यह पेपर TMAS (टेस्ट-टाइम मल्टी-एजेंट सिनर्जी) पेश करता है। इसे एक AI के रूप में नहीं, बल्कि एक विशेषज्ञ टीम के रूप में सोचें जो एक साझा मेमोरी सिस्टम के साथ मिलकर काम करती है।
यहाँ बताया गया है कि TMAS कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. विशेषज्ञों की टीम
एक AI द्वारा सब कुछ करने के बजाय, TMAS काम को पाँच विशिष्ट "एजेंटों" (टीम के सदस्यों) के बीच विभाजित करता है:
- द सॉल्वर (The Solver): उत्तर खोजने की कोशिश करता है।
- द चेकर (The Checker): सॉल्वर के काम की समीक्षा करता है ताकि गलतियाँ ढूँढी जा सकें।
- द समराइज़र (The Summarizer): चेकर के नोट्स लेता है और उन्हें एक स्पष्ट "सीखे गए सबक" में बदल देता है।
- द एक्सपीरियंस कीपर (The Experience Keeper): यह महत्वपूर्ण है। यह पाठों को देखता है और उन्हें एक "लो-लेवल नोटबुक" में लिखता है। इस नोटबुक में विशिष्ट, ठोस तथ्य होते हैं जैसे, "हे, हमने इस टाइल को वर्टिकल रखने की कोशिश की, और यह विफल रहा। ऐसा दोबारा न करें," या "हमने सिद्ध किया कि यह विशिष्ट संख्या 3 है, इसलिए हम इस तथ्य का बाद में उपयोग कर सकते हैं।"
- द स्ट्रैटेजी गाइड (The Strategy Guide): यह एजेंट एक "हाई-लेवल मैप" में लिखता है। यह मैप विशिष्ट तथ्यों को सूचीबद्ध नहीं करता है; यह दृष्टिकोणों (approaches) को सूचीबद्ध करता है। यह कहता है, "हमने बीजगणित (algebra) का उपयोग करके हल करने की कोशिश की। हमने ज्यामिति (geometry) का भी उपयोग किया। अब इन पर समय बर्बाद न करें; कुछ बिल्कुल नया करने की कोशिश करें।"
2. पुनरावृत्ति प्रक्रिया (The Loop)
टीम राउंड में काम करती है:
- एक्सप्लोर (Explore): सॉल्वर समस्या के कई अलग-अलग प्रयास उत्पन्न करता है।
- वेरिफाई (Verify): चेकर उनके ग्रेड तय करते हैं।
- लर्न (Learn): एक्सपीरियंस कीपर और स्ट्रैटेजी गाइड किए गए अनुभवों और मैप्स के आधार पर अपनी नोटबुक और मैप अपडेट करते हैं।
- रिफाइन (Refine): अगले दौर के सॉल्वर नोटबुक और मैप को पढ़ते हैं। वे पिछले विशिष्ट गलतियों से बचने के लिए "लो-लेवल नोटबुक" का उपयोग करते हैं और यह सुनिश्चित करने के लिए "हाई-लेवल मैप" का उपयोग करते हैं कि वे केवल पुराने तरीकों को दोहरा नहीं रहे हैं।
3. "हाइब्रिड रिवॉर्ड" (कोच का प्रोत्साहन)
AI को इस टीम का प्रभावी ढंग से उपयोग करना सिखाने के लिए, शोधकर्ताओं ने एक विशेष प्रशिक्षण प्रणाली (रीइन्फोर्समेंट लर्निंग) बनाई है। कल्पना कीजिए कि एक कोच टीम को तीन प्रकार के पुरस्कार (rewards) दे रहा है:
- पुरस्कार 1 (सही होना): यदि आप पहेली सुलझा लेते हैं, तो आपको एक अंक मिलता है। (बुनियादी कौशल)।
- पुरस्कार 2 (नोटबुक का उपयोग करना): यदि आप विशेष रूप से "लो-लेवल नोटबुक" से किसी तथ्य का उपयोग करके पहेली सुलझाते हैं, तो आपको एक बोनस मिलता है। यह AI को वास्तव में साझा मेमोरी को पढ़ने और उस पर भरोसा करने के लिए प्रशिक्षित करता है, न कि उसे अनदेखा करने के लिए।
- पुरस्कार 3 (रचनात्मक होना): यदि आप एक नई रणनीति का उपयोग करके पहेली सुलझाते हैं जो "हाई-लेवल मैप" पर नहीं है, तो आपको एक बोनस मिलता है। यह टीम को आलसी होने और केवल पुराने तरीकों को दोहराने से रोकता है। यदि आप केवल पुराने तरीके को कॉपी-पेस्ट करते हैं, तो आपको दंडित किया जाता है।
परिणाम
इस पेपर ने बहुत कठिन गणितीय बेंचमार्क (जैसे इंटरनेशनल मैथ ओलंपियाड) पर इसका परीक्षण किया।
- निष्कर्ष: जैसे-जैसे टीम के पास सोचने के लिए अधिक समय (अधिक "इटरेशन्स") होता है, TMAS लगातार स्मार्ट होता जाता है। अन्य तरीके एक ऐसी दीवार से टकरा जाते हैं जहाँ वे सुधार करना बंद कर देते हैं या भ्रमित होकर अधिक गलतियाँ करने लगते हैं क्योंकि वे अपने ही इतिहास से उलझ जाते हैं।
- उपमा: यह एक ऐसे छात्र के बीच अंतर की तरह है जो बस एक ही किताब को बार-बार पढ़ता रहता है (थक जाता है और भ्रमित हो जाता है) बनाम एक छात्र जिसके पास एक ट्यूटर, एक स्टडी ग्रुप और फ्लैशकार्ड्स का एक साझा सेट है। सिस्टम वाला छात्र तेज़ी से सीखता है, गलतियों को दोहराने से बचता है, और फँसने पर नए कोणों को आज़माता है।
संक्षेप में:
TMAS एक एकल AI को एक साझा मेमोरी वाली समन्वित टीम में बदल देता है। यह AI को विशिष्ट तथ्यों को याद रखने (एक्सपीरियंस बैंक) और कौन से बड़े विचार पहले ही विफल हो चुके हैं (गाइडलाइन बैंक) को ट्रैक करने के लिए मजबूर करता है। AI को इन स्मृतियों का उपयोग करने और नए रास्तों को आज़माने के महत्व को सिखाकर, यह पहले की तुलना में बहुत कठिन समस्याओं को हल कर सकता है, जिससे यह अपने "सोचने के समय" का प्रभावी ढंग से विस्तार कर पाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।