DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
यह शोध पत्र DR Tulu को प्रस्तुत करता है, जो 'इवॉल्विंग रूब्रिक्स के साथ रीइन्फोर्समेंट लर्निंग' (RLER) के माध्यम से प्रशिक्षित एक ओपन-सोर्स डीप रिसर्च मॉडल है, जो पॉलिसी के साथ मूल्यांकन मानदंडों को सह-विकसित करता है, जिससे यह मौजूदा ओपन एजेंटों से बेहतर प्रदर्शन करने और दीर्घकालिक शोध कार्यों पर प्रोप्रायटरी सिस्टमों को टक्कर देने में सक्षम होता है, जबकि यह काफी अधिक लागत-प्रभावी भी है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "DR Tulu: Deep Research के लिए Evolving Rubrics के साथ Reinforcement Learning" पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।
बड़ी तस्वीर: एक रोबोट को शोधकर्ता (Researcher) बनना सिखाना
कल्पना कीजिए कि आप एक रोबोट को किसी जटिल विषय पर एक लंबा, विस्तृत शोध रिपोर्ट लिखने के लिए प्रशिक्षित करना चाहते हैं, जैसे कि "जेनेटिक म्यूटेशन कैसे दुर्लभ बीमारियों का कारण बनते हैं?" या "नवीकरणीय ऊर्जा (renewable energy) का इतिहास क्या है?"
आज के अधिकांश AI मॉडल उन छात्रों की तरह हैं जो केवल छोटी क्विज़ के लिए पढ़ाई करते हैं। वे "फ्रांस की राजधानी क्या है?" जैसे सरल सवालों के जवाब देने में माहिर हैं, लेकिन जब उनसे 20 पन्नों की रिपोर्ट लिखने के लिए कहा जाता है जिसमें सैकड़ों वेबसाइटों को खंगालने, तथ्यों की जांच करने और स्रोतों का हवाला देने की आवश्यकता होती है, तो वे संघर्ष करते हैं।
इस पेपर के लेखकों ने एक नया AI बनाया है जिसे DR Tulu कहा जाता है। यह विशेष रूप से "डीप रिसर्चर" बनने के लिए प्रशिक्षित किया गया पहला ओपन-सोर्स मॉडल है। यह केवल अनुमान नहीं लगाता; यह योजना बनाता है, वेब खोजता है, शोध पत्रों को पढ़ता है, और एक लंबी, अच्छी तरह से प्रमाणित रिपोर्ट लिखता है।
समस्या: एक लंबी रिपोर्ट को ग्रेड कैसे दें?
AI को बेहतर करने के लिए सिखाने हेतु, आप आमतौर पर Reinforcement Learning नामक विधि का उपयोग करते हैं। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें:
- कुत्ता (AI) एक ट्रिक करता है।
- यदि वह इसे सही करता है, तो उसे इनाम (treat) मिलता है।
- यदि वह इसे गलत करता है, तो उसे कोई इनाम नहीं मिलता।
लंबी शोध रिपोर्टों के साथ समस्या यह है कि यह जानना कठिन है कि एक "अच्छी" रिपोर्ट कैसी दिखती है।
- Static Rubrics (पुराना तरीका): कल्पना कीजिए कि एक शिक्षक कुत्ते को एक निश्चित चेकलिस्ट देता है: "5 पैराग्राफ होने चाहिए। 1990 का उल्लेख होना चाहिए।" यदि कुत्ता 1991 के बारे में एक शानदार रिपोर्ट लिखता है, तो शिक्षक उसे फेल कर देता है क्योंकि उसने सख्त चेकलिस्ट का पालन नहीं किया। वह चेकलिस्ट नहीं जानती कि कुत्ते ने वास्तव में क्या खोज निकाला है।
- "क्लोज्ड-बुक" की समस्या: यदि आप किसी AI को केवल अपने मौजूदा ज्ञान के आधार पर चेकलिस्ट बनाने के लिए कहते हैं, तो वह उन नए तथ्यों को मिस कर सकता है जो उसने अभी इंटरनेट पर खोजे हैं।
समाधान: "Evolving Rubrics" (स्मार्ट टीचर)
यह पेपर एक नई विधि पेश करता है जिसे RLER (Reinforcement Learning with Evolving Rubrics) कहा जाता है।
एक स्मार्ट टीचर (Smart Teacher) की कल्पना करें जो एक निश्चित चेकलिस्ट का उपयोग नहीं करता है। इसके बजाय, शिक्षक छात्र (AI) को वास्तविक समय (real-time) में अपना शोध करते हुए देखता है।
- छात्र खोज करता है: छात्र बाहर जाता है, नए तथ्य पाता है, और एक ड्राफ्ट लिखता है।
- शिक्षक अनुकूलित होता है: स्मार्ट टीचर देखता है कि छात्र ने क्या पाया। "ओह, मुझे नहीं पता था कि यह तथ्य मौजूद है! मुझे अपनी चेकलिस्ट में एक नया नियम जोड़ना चाहिए: 'इस नए तथ्य की व्याख्या करनी चाहिए'।"
- फीडबैक लूप: शिक्षक छात्र के सीखने के दौरान ही चेकलिस्ट को अपडेट करता है। यदि छात्र धोखाधड़ी करने की कोशिश करता है (जैसे बिना पढ़े टेक्स्ट कॉपी करना), तो शिक्षक तुरंत एक नियम जोड़ देता है: "चीटिंग करने की अनुमति नहीं है।"
तकनीकी शब्दों में, पेपर इन Evolving Rubrics को कहता है। ये मूल्यांकन मानदंड (evaluation criteria) हैं जो बदलते रहते हैं और AI द्वारा अधिक जानकारी खोजने के साथ और स्मार्ट होते जाते हैं। यह AI को केवल नियमों के एक स्थिर सेट में फंसे रहने के बजाय अपनी खोजों से सीखने की अनुमति देता है।
परिणाम: कम बजट में एक सुपर-रिसर्चर
लेखकों ने इस "स्मार्ट टीचर" पद्धति का उपयोग करके DR Tulu को प्रशिक्षित किया। यहाँ क्या हुआ:
- यह अधिक स्मार्ट है: DR Tulu ने अन्य ओपन-सोर्स रिसर्च मॉडल्स को बहुत बड़े अंतर से पीछे छोड़ दिया। इसने बेहतर रिपोर्ट लिखी, अधिक सटीक तथ्य खोजे और स्रोतों का सही ढंग से हवाला दिया।
- यह दिग्गजों को टक्कर देता है: इसने OpenAI और Google जैसी बड़ी कंपनियों के महंगे, प्रोप्राइटरी सिस्टम के समान (और कभी-कभी बेहतर) प्रदर्शन किया।
- यह सस्ता है: सबसे बड़ी जीत यही है। महंगे सिस्टम एक प्रश्न के लिए लगभग $1.80 खर्च करते हैं। DR Tulu एक प्रश्न के लिए लगभग $0.002 खर्च करता है। यह लगभग 1,000 गुना सस्ता है।
"जेनेटिक डिजीज" टेस्ट
यह साबित करने के लिए कि यह वास्तव में काम करता है, टीम ने DR Tulu को एक बहुत कठिन कार्य दिया: जेनेटिक म्यूटेशन का विश्लेषण करना कि क्या उन्हें विशिष्ट दवाओं के साथ ठीक किया जा सकता है। यह एक ऐसा कार्य है जो आमतौर पर मानव चिकित्सा विशेषज्ञों के लिए आरक्षित होता है।
- DR Tulu ने सफलतापूर्वक मेडिकल डेटाबेस को खोजा, प्रासंगिक शोध पत्र ढूंढे, और एक रिपोर्ट तैयार की।
- यह इस कार्य पर सबसे महंगे, क्लोज्ड-सोर्स AI सिस्टम के साथ प्रतिस्पर्धा करने में सक्षम रहा।
- अन्य ओपन-सोर्स मॉडल विफल रहे क्योंकि वे सही साइटेशन (citations) नहीं ढूंढ सके या तथ्यों को सत्यापित नहीं कर सके।
टूलकिट: "dr-agent-lib"
पेपर ने एक "टूलबॉक्स" भी जारी किया है जिसे dr-agent-lib कहा जाता है।
- इसे AI शोधकर्ताओं के लिए एक स्विस आर्मी नाइफ (Swiss Army Knife) के रूप में समझें।
- यह AI को विभिन्न टूल्स का उपयोग करने की अनुमति देता है: Google Search, विशिष्ट वेबपेज पढ़ना, और अकादमिक शोध पत्रों को खोजना।
- महत्वपूर्ण बात यह है कि AI काम के लिए सही टूल चुनना सीखता है। यदि प्रश्न विज्ञान के बारे में है, तो यह "पेपर सर्च" टूल का उपयोग करता है। यदि यह सामान्य समाचार के बारे में है, तो यह "वेब सर्च" का उपयोग करता है। यह केवल एक टूल का अंधाधुंध उपयोग नहीं करता है।
सारांश
यह पेपर DR Tulu को प्रस्तुत करता है, जो एक ओपन-सोर्स AI है जो गहरा, लंबा शोध करना सीखता है। यह एक विशेष प्रशिक्षण पद्धति (Evolving Rubrics) का उपयोग करता है जहाँ AI के "ग्रेडिंग नियम" AI द्वारा की गई खोजों के आधार पर वास्तविक समय में अपडेट होते हैं। यह AI को बहुत अधिक स्मार्ट, सटीक और वर्तमान अत्याधुनिक शोध उपकरणों की तुलना में काफी सस्ता बनाता है। लेखकों ने कोड, डेटा और मॉडल को साझा किया है ताकि कोई भी इसका उपयोग कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।