Cross-Domain Hybrid OPD for Generalizable Search Agents
यह शोध पत्र युआनबाओ (Yuanbao) सर्च एजेंट के लिए एक हाइब्रिड ट्रेनिंग फ्रेमवर्क पेश करता है जो क्रॉस-डोमेन एक्सपर्ट ऑन-पॉलिसी डिस्टिलेशन (cross-domain expert On-Policy Distillation) का उपयोग करता है ताकि सामान्य उद्देश्य वाली बुद्धिमत्ता से समझौता किए बिना, बल्कि उसे और बेहतर बनाए बिना, विशिष्ट खोज क्षमताओं को प्राप्त किया जा सके, जिससे सुदृढीकरण शिक्षण (Reinforcement Learning) अनुकूलन से जुड़े विशिष्ट एलाइनमेंट टैक्स (alignment tax) को कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया जहाँ आपका पसंदीदा AI असिस्टेंट एक ऐसे प्रतिभाशाली छात्र की तरह है जिसने अभी-अभी एक मास्टर डिटेक्टिव बनना सीखा है। यह छात्र इंटरनेट को खंगाल सकता है, विभिन्न समाचार कहानियों के बीच संबंध जोड़ सकता है, और किसी भी अन्य व्यक्ति की तुलना में छिपे हुए तथ्यों को तेजी से खोज सकता है। लेकिन इसमें एक पेच है: एक सुपर-डिटेक्टिव बनने की प्रक्रिया में, वे एक मज़ेदार कविता लिखना, एक कठिन गणित पहेली हल करना, या बस अपने दिन के बारे में सामान्य बातचीत करना भूल गए हैं। यह AI की दुनिया में "विशेषज्ञता" (specialization) की समस्या है। वैज्ञानिक इसे "अलाइनमेंट टैक्स" (alignment tax) कहते हैं—वह कीमत जो आप किसी एक विशिष्ट चीज़ में बहुत अच्छा होने के लिए चुकाते हैं। यह वैसा ही है जैसे यदि कोई शेफ सूप को बेहतर बनाने के लिए इतना जुनूनी हो जाए कि वह केक बनाना भूल जाए। बड़ा सवाल शोधकर्ताओं के लिए यह है: क्या हम एक AI को विश्व स्तरीय खोज विशेषज्ञ (search expert) बनने के लिए प्रशिक्षित कर सकते हैं बिना यह भुलाए कि वह एक मददगार, सर्वगुण संपन्न मित्र कैसे बना रहे?
यही वह काम है जिसे करने के लिए टेंसेंट युआनबाओ (Tencent Yuanbao) की टीम ने अपनी नई तकनीकी रिपोर्ट में प्रयास किया। उन्होंने एक स्मार्ट AI एजेंट बनाया जो वेब पर जानकारी खोजने के लिए डिज़ाइन किया गया है, लेकिन उन्हें डर था कि इसे इतनी कड़ी खोज के लिए प्रशिक्षित करने से यह बाकी सब चीजों में "मूर्ख" हो जाएगा। इसे ठीक करने के लिए, उन्होंने एक चतुर दो-चरणीय प्रशिक्षण पद्धति विकसित की। पहले, उन्होंने AI को 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) नामक एक तकनीक का उपयोग करके एक खोज प्रो (search pro) बनने के लिए सिखाया, जो कि एक खेल खेलने जैसा है जहाँ उसे सही उत्तर खोजने के लिए अंक मिलते हैं। फिर, AI की सामान्य बुद्धिमत्ता को खोने से रोकने के लिए, उन्होंने "क्रॉस-डोमेन हाइब्रिड ऑन-पॉलिसी डिस्टिलेशन" (Cross-Domain Hybrid On-Policy Distillation) नामक एक विधि का उपयोग किया। इसे ऐसे सोचें जैसे चार अलग-अलग जीनियस ट्यूटर्स को काम पर रखना—एक गणित के लिए, एक कोडिंग के लिए, एक तर्क (logic) के लिए, और एक विज्ञान के लिए—ताकि वे खोज-विशेषज्ञ AI को फिर से एक सर्वांगीण छात्र बनने का तरीका सिखा सकें। परिणाम? एक ऐसा AI जो विशेषज्ञ संस्करण जितना ही अच्छा है वेब पर जानकारी खोज सकता है, और हालांकि वह हर एक परीक्षण में गणित का जीनियस नहीं बना, लेकिन उसने अपना अधिकांश खोया हुआ आधार वापस पा लिया और तर्क (logical reasoning) और कोडिंग जैसे कई प्रमुख क्षेत्रों में वास्तव में पहले से बेहतर प्रदर्शन किया। उन्होंने केवल समस्या को ठीक नहीं किया; उन्होंने AI को एक ही समय में कई चीजों में स्मार्ट बनाया, बिना उसकी खोज कौशल का बलिदान दिए।
द डिटेक्टिव हू फॉरगॉट हाउ टू जगल (वह जासूस जो करतब दिखाना भूल गया)
आइए युआनबाओ सर्च एजेंट की कहानी में उतरें। कल्पना कीजिए कि आपके पास "सर्च-बॉट" (Search-Bot) नाम का एक रोबोट है। आप चाहते हैं कि सर्च-बॉट इंटरनेट पर उत्तर खोजने में सर्वश्रेष्ठ हो। इसलिए, आप इसे एक वर्चुअल प्लेग्राउंड में रखते हैं जहाँ इसे लिंक पर क्लिक करके, लेख पढ़कर और प्रश्न पूछकर रहस्यों को सुलझाना होता है। इसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है। यह एक कुत्ते को प्रशिक्षित करने जैसा है: हर बार जब सर्च-बॉट सही जानकारी ढूंढ लेता है, तो उसे एक इनाम (रिवॉर्ड) मिलता है। हर बार जब वह भटक जाता है, तो उसे एक कोमल "नहीं" मिलता है।
कुछ समय बाद, सर्च-बॉट चीजें खोजने में अद्भुत हो जाता है। लेकिन यहाँ अजीब बात है: जैसे-जैसे यह खोजने में बेहतर होता जाता है, यह अन्य चीजों में खराब होने लगता है। यह एक साधारण गणित की समस्या हल करना या एक रचनात्मक कहानी लिखना भूल जाता है। पेपर इसे अलाइनमेंट टैक्स (Alignment Tax) कहता है। यह वैसा ही है जैसे यदि आप अपने पैरों को बहुत मजबूत बनाने के लिए हर दिन अपने सॉकर किक का अभ्यास करते हैं, लेकिन आप सीधी रेखा में चलना भूल जाते हैं क्योंकि आपने कभी चलने का अभ्यास ही नहीं किया। AI "खोजने" में इतना विशिष्ट हो गया कि उसने अपनी "सामान्य" मानसिक शक्ति खो दी।
द टू-स्टेप रेस्क्यू मिशन (दो-चरणीय बचाव अभियान)
टेंसेंट टीम को समझ आया कि केवल सर्च-बॉट को और अधिक खोजने के लिए सिखाना समाधान नहीं था। उन्हें खोज कौशल को बनाए रखने और सामान्य बुद्धिमत्ता को वापस लाने के तरीके की आवश्यकता थी। इसलिए, वे एक दो-चरणीय प्रशिक्षण योजना के साथ आए।
चरण 1: द सर्च बूट कैंप (खोज प्रशिक्षण शिविर)
सबसे पहले, उन्होंने अपने मूल AI मॉडल (एक स्मार्ट मॉडल जिसे हुनयुआन3 कहा जाता है) को "सर्च बूट कैंप" में भेजा। यहाँ, AI ने केवल खोज का अभ्यास किया। इसने अपने कदमों की योजना बनाना, वेब सर्च और इमेज सर्च जैसे टूल्स का उपयोग करना, और विभिन्न स्थानों से जानकारी को जोड़ना सीखा। जैसा कि अपेक्षित था, यह खोजने में बहुत अच्छा हो गया। लेकिन, जैसा कि पेपर ने भविष्यवाणी की थी, इसने गणित, विज्ञान और तर्क के साथ अपना संपर्क खो दिया। "अलाइनमेंट टैक्स" का गहरा प्रभाव पड़ा।
चरण 2: द "सुपर-ट्यूटर" मिक्स (सुपर-शिक्षक मिश्रण)
यहीं जादू होता है। केवल AI को गणित में विफल होने देने के बजाय, टीम चार विशेषज्ञ शिक्षकों (Expert Teachers) को लेकर आई। ये केवल कोई भी शिक्षक नहीं थे; वे विशेष रूप से प्रशिक्षित AI मॉडल थे:
- गणित (जटिल समीकरणों को हल करना)
- कोडिंग (कंप्यूटर प्रोग्राम लिखना)
- तर्क/लॉजिक (पहेलियाँ और तर्क सुलझाना)
- विज्ञान (प्राकृतिक दुनिया को समझना)
टीम ने ऑन-पॉलिसी डिस्टिलेशन (OPD) नामक तकनीक का उपयोग किया। यह एक फैंसी तरीका है यह कहने का: "आइए छात्र (सर्च-बॉट) को एक समस्या हल करने की कोशिश करने दें, और फिर विशेषज्ञ शिक्षक को देखते हुए कहें, 'हे, तुमने इसे इस तरह किया, लेकिन यहाँ बेहतर तरीका है जिसे तुम अपना सकते हो।'"
शानदार बात यह है कि उन्होंने AI को केवल गणित या खोज नहीं सिखाई। उन्होंने उन्हें आपस में मिला दिया! प्रत्येक प्रशिक्षण सत्र में, AI एक तथ्य खोजने का अभ्यास करेगा, और फिर तुरंत एक गणित की समस्या हल करने या कोड लिखने का अभ्यास करेगा, और यह सब एक सही विशेषज्ञ शिक्षक के मार्गदर्शन में होगा। यह एक ऐसे छात्र की तरह था जो सुबह सॉकर अभ्यास के लिए जाता है और फिर दोपहर में पियानो सीखने जाता है, लेकिन पियानो शिक्षक सॉकर अभ्यास को भी देख रहा है ताकि यह सुनिश्चित किया जा सके कि छात्र केंद्रित और अनुशासित रहे।
द रिजल्ट्स: बेस्ट ऑफ बोथ वर्ल्ड्स (दोनों दुनियाओं का सर्वश्रेष्ठ)
टीम ने अपने नए "हाइब्रिड" AI का पुराने संस्करणों के विरुद्ध परीक्षण किया। यहाँ उन्हें क्या मिला:
- खोज कौशल (Search Skills): नया AI उतना ही अच्छा था जितना कि वह जो केवल खोजने का अभ्यास करता था। वास्तव में, कुछ कठिन खोज परीक्षणों पर, यह और भी बेहतर हो गया! यह अभी भी वेब पर जानकारी खोज सकता था, जटिल खोजों की योजना बना सकता था, और निर्देशों का पूरी तरह से पालन कर सकता था।
- सामान्य कौशल (General Skills): यह बड़ी जीत है। जो AI केवल खोज का अभ्यास कर रहा था, वह गणित और तर्क में कमजोर हो गया था। लेकिन हाइब्रिड AI? इसने न केवल सामान्य स्थिति प्राप्त की, बल्कि कई क्षेत्रों में महत्वपूर्ण सुधार भी किया।
- लॉजिकल रीजनिंग (तर्क संबंधी तर्क) परीक्षणों पर, हाइब्रिड AI में भारी सुधार हुआ (33.95 से 46.90 तक उछलकर)।
- कोडिंग कार्यों पर, यह 67.74 से बढ़कर 74.15 हो गया, जो मूल "बेस" मॉडल से भी बेहतर था।
- गणित की समस्याओं पर, इसने लगभग सारा खोया हुआ आधार वापस पा लिया और कुछ कठिन बेंचमार्क (जैसे AIME25 और Math IMO AnswerBench) पर मूल मॉडल से भी आगे निकल गया। हालाँकि, मिनर्वा मैथ (Minerva Math) और फ्रंटियर साइंस ओलंपियाड (Frontier Science Olympiad) जैसे अत्यंत चुनौतीपूर्ण बेंचमार्क पर, यह मूल बेस मॉडल के प्रदर्शन से थोड़ा नीचे रहा।
- विज्ञान बेंचमार्क पर, इसमें मजबूत बढ़त देखी गई, जिसने GPQA डायमंड पर उच्चतम सटीकता प्राप्त की।
पेपर दिखाता है कि "अलाइनमेंट टैक्स" एक स्थायी कीमत नहीं है जो आपको चुकानी पड़ती है। इन विशेषज्ञ शिक्षकों का उपयोग करके AI को खोज सिखाने के दौरान, वे अधिकांश नुकसान को "उल्टा" करने में सफल रहे। AI को एक जासूस होने और एक जीनियस होने के बीच चुनाव करने की आवश्यकता नहीं थी; वह एक ऐसा जासूस बन गया जो एक बहुत अच्छा छात्र भी है, भले ही वह ब्रह्मांड की हर एक गणितीय समस्या पर एकदम सटीक न हो।
यह क्यों मायने रखता है
आप सोच सकते हैं, "तो क्या हुआ? हमें इससे क्या फर्क पड़ता है कि एक AI गणित में बेहतर हो जाता है?" खैर, कल्पना कीजिए कि आप अपने AI असिस्टेंट से पूछते हैं, "मैं तीन दिनों के लिए पेरिस जा रहा हूँ। मैं एफिल टॉवर और डिज्नीलैंड देखना चाहता हूँ, लेकिन मैं स्थानों के बीच यात्रा करने में 30 मिनट से अधिक समय नहीं बिताना चाहता।"
यदि AI के पास केवल "सर्च-ओनली" प्रशिक्षण होता, तो वह स्थानों को खोज तो सकता था लेकिन फिर आपको एक बहुत ही खराब यात्रा कार्यक्रम (itinerary) दे सकता था जो समझ में नहीं आता, या वह यात्रा के समय की गणना करना भूल सकता था क्योंकि वह केवल स्थानों के नाम खोजने पर बहुत अधिक केंद्रित हो गया था।
लेकिन हाइब्रिड प्रशिक्षण के साथ, AI कर सकता है:
- स्थानों और यात्रा के समय के लिए खोज (Search) कर सकता है (अपने खोज कौशल का उपयोग करके)।
- भूगोल के बारे में तर्क (Reason) कर सकता है और गणना कर सकता है कि क्या योजना आपके 30-मिनट के नियम में फिट बैठती है (अपने तर्क और गणित कौशल का उपयोग करके)।
- आपके लिए एक स्पष्ट, मैत्रीपूर्ण और सहज यात्रा कार्यक्रम लिख (Write) सकता है (अपने सामान्य भाषा कौशल का उपयोग करके)।
पेपर सुझाव देता है कि यह "हाइब्रिड" दृष्टिकोण वास्तविक दुनिया में वास्तव में उपयोगी AI एजेंट बनाने की कुंजी है। उन्हें जानकारी खोजने की आवश्यकता है, हाँ, लेकिन उन्हें उस जानकारी का उपयोग समस्याओं को हल करने, कहानियाँ लिखने और अपनी बुद्धि का उपयोग करके हमारे दैनिक जीवन में मदद करने के लिए करने के लिए भी पर्याप्त स्मार्ट होना चाहिए।
द सीक्रेट सॉस: उन्होंने इसे कैसे किया
टीम ने सब कुछ बस मिला नहीं दिया। वे इस बात के प्रति बहुत सावधान थे कि वे विशेषज्ञ शिक्षकों को कैसे सिखा रहे थे। उन्होंने एक "करिकुलम लर्निंग" (Curriculum Learning) रणनीति का उपयोग किया। इसका अर्थ है कि उन्होंने शिक्षकों को सबसे कठिन, असंभव गणित की समस्याओं के साथ शुरुआत नहीं की। इसके बजाय, उन्होंने एक मजबूत नींव बनाने के लिए मध्यम कठिनाई की समस्याओं से शुरुआत की, और फिर धीरे-धीरे कठिन चीजों को पेश किया।
उन्होंने पाया कि यदि वे इस चरण को छोड़ देते और सीधे शिक्षकों के सामने सबसे कठिन समस्याएँ रख देते, तो शिक्षक (और छात्र AI) उतनी अच्छी तरह से नहीं सीख पाते। "करिकुलम" ने शिक्षकों को बेहतर ढंग से समझाने में मदद की, जिससे बदले में छात्र AI ने तेज़ी से और अधिक स्मार्ट तरीके से सीखा।
द बॉटम लाइन
टेंसेंट युआनबाओ टीम ने हमें दिखाया कि आपको एक विशिष्ट खोज एजेंट प्राप्त करने के लिए सामान्य बुद्धिमत्ता का बलिदान करने की आवश्यकता नहीं है। रीइन्फोर्समेंट लर्निंग (खोजने के लिए) को ऑन-पॉलिसी डिस्टिलेशन (विशेषज्ञ ट्यूटर्स से सीखने) के साथ मिलाकर, उन्होंने एक ऐसा AI बनाया जो एक मास्टर डिटेक्टिव भी है और एक शानदार सर्वांगीण छात्र भी।
उन्होंने साबित कर दिया कि "अलाइनमेंट टैक्स" से बचा जा सकता है। AI केवल बदतर नहीं हुआ; वह वास्तव में कई चीजों में बेहतर हुआ, उसने अपना खोया हुआ कौशल वापस पा लिया और कोडिंग और तार्किक तर्क जैसे क्षेत्रों में अपने मूल स्वरूप से भी आगे निकल गया। हालाँकि वह हर गणित प्रतियोगिता को नहीं जीत सका, लेकिन वह कुल मिलाकर एक बहुत अधिक सक्षम और बहुमुखी सहायक बन गया। यह एक तरीका खोजने जैसा है जिससे आप एक सुपरहीरो को उड़ना सिखा सकें बिना उन्हें चलना भुलाए। और एक ऐसी दुनिया में जहाँ हम चाहते हैं कि हमारा AI मददगार, स्मार्ट और बहुमुखी हो, यह एक बहुत बड़ी बात है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।